Stable Diffusion

Stable Diffusion es un modelo de aprendizaje automático desarrollado por Stability AI para generar imágenes digitales de alta calidad a partir de descripciones en lenguaje natural. El modelo se puede usar para diferentes tareas, como la generación de traducciones de imagen a imagen guiadas por mensajes de texto y la mejora de imágenes.

Stable Diffusion
Información general
Tipo de programa software
Autor https://www.stability.ai/
Desarrollador https://www.stability.ai/
Modelo de desarrollo Código abierto
Lanzamiento inicial 22 de agosto de 2022
Licencia Licencia Creative ML OpenRAIL-M
Idiomas Inglés
Información técnica
Programado en Python
Versiones
Última versión estable 2
Enlaces
Imagen generada por Stable Diffusion con la frase "Painting by Goya with an ape with a computer and the earth in the background"

A diferencia de modelos de la competencia como DALL-E, Stable Diffusion es de código abierto[1] y no limita artificialmente las imágenes que produce.[2] Los críticos han expresado su preocupación por la ética de la IA, afirmando que el modelo se puede utilizar para crear deepfakes.[3] Puede ejecutarse en el hardware del usuario equipado con una tarjeta gráfica (GPU), es completamente gratis, se puede acceder a él online y fue elogiado por PC World como "la próxima aplicación revolucionaria para su PC".[4] Desde su lanzamiento inicial, más de 200,000 personas han descargado el código.[5]

Arquitectura

Stable Diffusion utiliza una variante del modelo de difusión (DM), denominada modelo de difusión latente (LDM) [6]. Introducidos en 2015, los modelos de difusión se entrenan con el objetivo de eliminar aplicaciones sucesivas de ruido gaussiano en las imágenes de entrenamiento, que pueden considerarse una secuencia de autocodificadores de eliminación de ruido. Stable Diffusion consta de tres partes: el autocodificador variacional (VAE), U-Net y un codificador de texto opcional[7]. El codificador VAE comprime la imagen desde el espacio de píxeles a un espacio latente de dimensiones más pequeñas, capturando un significado semántico más fundamental de la imagen[8]. El ruido gaussiano se aplica iterativamente a la representación latente comprimida durante la difusión directa[7]. El bloque U-Net, compuesto por una columna vertebral ResNet, elimina el ruido de la salida de la difusión directa hacia atrás para obtener la representación latente. Por último, el descodificador VAE genera la imagen final convirtiendo la representación de nuevo al espacio de píxeles[7]. El paso de eliminación de ruido puede condicionarse de forma flexible a una cadena de texto, una imagen y otras modalidades. Los datos de condicionamiento codificados se exponen a las U-Nets de eliminación de ruido mediante un mecanismo de atención cruzada[7]. Para condicionar el texto, se utiliza el codificador de texto fijo y preentrenado CLIP ViT-L/14 para transformar las indicaciones de texto a un espacio de incrustación[1]. Los investigadores señalan la mayor eficiencia computacional para el entrenamiento y la generación como una ventaja de los LDM[9][10].

Datos de entrenamiento

Stable Diffusion se entrenó con pares de imágenes y subtítulos extraídos de LAION-5B, un conjunto de datos de acceso público derivado de los datos de Common Crawl extraídos de la web, en el que se clasificaron 5.000 millones de pares imagen-texto en función del idioma, se filtraron en conjuntos de datos separados por resolución, se predijo la probabilidad de que contuvieran una marca de agua y se predijo la puntuación "estética" (por ejemplo, la calidad visual subjetiva).[11][12] El conjunto de datos fue creado por LAION, una organización alemana sin ánimo de lucro que recibe financiación de Stability AI.[11][12] El modelo Stable Diffusion se entrenó con tres subconjuntos de LAION-5B: laion2B-es, laion-high-resolution y laion-aesthetics v2 5+. Un análisis de terceros de los datos de entrenamiento del modelo identificó que de un subconjunto más pequeño de 12 millones de imágenes tomadas del conjunto de datos original más amplio utilizado, aproximadamente el 47 % del tamaño de la muestra de imágenes procedía de 100 dominios diferentes, de los cuales Pinterest ocupaba el 8,5 % del subconjunto, seguido de sitios web como WordPress, Blogspot, Flickr, DeviantArt y Wikimedia Commons.[13]

Procedimientos de entrenamiento

El modelo se entrenó inicialmente con los subconjuntos laion2B-es y laion-high-resolution, y las últimas rondas de entrenamiento se realizaron con LAION-Aesthetics v2 5+, un subconjunto de 600 millones de imágenes subtituladas a las que LAION-Aesthetics Predictor V2 predijo que los humanos darían, de media, una puntuación de al menos 5 sobre 10 cuando se les pidiera que valoraran cuánto les gustaban.[14][15] El subconjunto LAION-Aesthetics v2 5+ también excluía las imágenes de baja resolución y las imágenes que LAION-5B-WatermarkDetection identificaba como portadoras de una marca de agua con una probabilidad superior al 80 %.[11] En las rondas finales de entrenamiento se eliminó además un 10 % de condicionamiento de texto para mejorar la orientación de difusión sin clasificador.[16]

El modelo se entrenó utilizando 256 GPU Nvidia A100 en Amazon Web Services, lo que supuso un total de 150.000 horas de GPU, con un coste de 600.000 dólares.[17][18][19]

Véase también

Referencias

  1. «Stable Diffusion Public Release». Stability.Ai. Consultado el 31 de agosto de 2022.
  2. «Ready or not, mass video deepfakes are coming». The Washington Post. Consultado el 31 de agosto de 2022.
  3. «Deepfakes for all: Uncensored AI art model prompts ethics questions». TechCrunch. Consultado el 31 de agosto de 2022.
  4. «The new killer app: Creating AI art will absolutely crush your PC». PCWorld. Consultado el 31 de agosto de 2022.
  5. Roose, Kevin (21 de octubre de 2022). «A Coming-Out Party for Generative A.I., Silicon Valley’s New Craze». The New York Times. Consultado el 24 de octubre de 2022.
  6. Stable Diffusion, CompVis - Computer Vision and Learning LMU Munich, 6 de enero de 2023, consultado el 6 de enero de 2023.
  7. Alammar, Jay. «The Illustrated Stable Diffusion». jalammar.github.io. Consultado el 6 de enero de 2023.
  8. «High-Resolution Image Synthesis with Latent Diffusion Models». Computer Vision & Learning Group (en inglés estadounidense). Consultado el 6 de enero de 2023.
  9. «Stable Diffusion launch announcement». Stability AI (en inglés británico). Consultado el 6 de enero de 2023.
  10. Rombach; Blattmann; Lorenz; Esser; Ommer (June 2022). High-Resolution Image Synthesis with Latent Diffusion Models (PDF). International Conference on Computer Vision and Pattern Recognition (CVPR). New Orleans, LA. pp. 10684–10695. arXiv:2112.10752.
  11. Baio, Andy (30 de agosto de 2022). «Exploring 12 Million of the 2.3 Billion Images Used to Train Stable Diffusion's Image Generator». Waxy.org (en inglés estadounidense). Consultado el 5 de enero de 2023.
  12. «This artist is dominating AI-generated art. And he’s not happy about it.». MIT Technology Review (en inglés). Consultado el 5 de enero de 2023.
  13. Ivanovs, Alex (8 de septiembre de 2022). «Stable Diffusion: Tutorials, Resources, and Tools». Stack Diary (en inglés estadounidense). Consultado el 5 de enero de 2023.
  14. Schuhmann, Christoph (3 de enero de 2023), CLIP+MLP Aesthetic Score Predictor, consultado el 5 de enero de 2023.
  15. «LAION-Aesthetics | LAION». laion.ai (en inglés). Consultado el 5 de enero de 2023.
  16. Ho, Jonathan; Salimans, Tim (25 de julio de 2022). «Classifier-Free Diffusion Guidance». arXiv:2207.12598 [cs]. Consultado el 5 de enero de 2023.
  17. «https://twitter.com/emostaque/status/1563870674111832066». Twitter. Consultado el 5 de enero de 2023.
  18. «CompVis/stable-diffusion-v1-4 · Hugging Face». huggingface.co. Consultado el 5 de enero de 2023.
  19. Wiggers, Kyle (12 de agosto de 2022). «A startup wants to democratize the tech behind DALL-E 2, consequences be damned». TechCrunch (en inglés estadounidense). Consultado el 5 de enero de 2023.
Este artículo ha sido escrito por Wikipedia. El texto está disponible bajo la licencia Creative Commons - Atribución - CompartirIgual. Pueden aplicarse cláusulas adicionales a los archivos multimedia.