Articulo de referencia

Modelo de conversión de texto a imagen

Comprobado Una imagen condicionada a la indicación , generada por Stable Diffusion 3.5, un modelo de conversión de texto a imagen a gran escala lanzado por primera vez en 2022. ...

Comprobado
Página protegida con cambios pendientes

Una imagen condicionada a la indicación , generada por Stable Diffusion 3.5, un modelo de conversión de texto a imagen a gran escala lanzado por primera vez en 2022.an astronaut riding a horse, by Hiroshige

Un modelo de conversión de texto a imagen ( T2I o TTI ) es un modelo de aprendizaje automático que toma como entrada una descripción en lenguaje natural y produce una imagen que coincide con esa descripción.

Los modelos de conversión de texto a imagen comenzaron a desarrollarse gradualmente a mediados de la década de 2010, durante los inicios del auge de la IA , como resultado de los avances en las redes neuronales profundas . En 2022, la producción de los modelos de conversión de texto a imagen más avanzados, como DALL-E 2 de OpenAI , Imagen de Google Brain , Stable Diffusion de Stability AI , Midjourney y Gen-4 de Runway, comenzó a considerarse cercana a la calidad de las fotografías reales y el arte dibujado por humanos .

Los modelos de conversión de texto a imagen son generalmente modelos de difusión latente , que realizan el proceso de difusión en un espacio latente comprimido en lugar de directamente en el espacio de píxeles. Se utiliza un autoencoder (a menudo un autoencoder variacional ) para convertir entre el espacio de píxeles y esta representación latente. Estos sistemas suelen utilizar un modelo de lenguaje o de visión-lenguaje preentrenado para convertir la entrada en una representación vectorial de texto, y un modelo generativo de imágenes basado en difusión que produce imágenes condicionadas a dicha representación. Los modelos más eficaces se han entrenado generalmente con grandes cantidades de datos de imágenes y texto extraídos de la web . [ 1 ]

Historia

Antes del auge del aprendizaje profundo en la década de 2010, los intentos de crear modelos de texto a imagen se limitaban a collages mediante la organización de imágenes componentes existentes, como las de una base de datos de imágenes prediseñadas . [ 2 ] [ 3 ]

La tarea inversa, la generación de subtítulos para imágenes , era más manejable, y varios modelos de aprendizaje profundo para la generación de subtítulos para imágenes aparecieron antes que los primeros modelos de conversión de texto a imagen. [ 4 ]

A stop sign is flying in blue skies.por AlignDRAW (2015) [ 5 ]

2015–2019

A stop sign is flying in blue skies por DALL-E 2 (2022), DALL-E  3 (2023) y GPT Image 1 (2025) de OpenAI

El primer modelo moderno de conversión de texto a imagen, alignDRAW, fue presentado en 2015 por investigadores de la Universidad de Toronto . alignDRAW extendió la arquitectura DRAW previamente introducida (que utilizaba un autoencoder variacional recurrente con un mecanismo de atención ) para que estuviera condicionada a secuencias de texto. [ 4 ] Las imágenes generadas por alignDRAW tenían una resolución baja (32×32 píxeles, obtenida mediante redimensionamiento ) y se consideraban de "baja diversidad". El modelo fue capaz de generalizar a objetos no representados en los datos de entrenamiento (como un autobús escolar rojo) y manejó adecuadamente indicaciones novedosas como "una señal de stop está volando en cielos azules", mostrando una salida que no se limitaba a "memorizar" datos del conjunto de entrenamiento . [ 4 ] [ 6 ]

En 2016, Reed, Akata, Yan et al. fueron los primeros en utilizar redes generativas antagónicas para la tarea de conversión de texto a imagen. [ 6 ] [ 7 ] Con modelos entrenados en conjuntos de datos específicos de dominio, pudieron generar imágenes "visualmente plausibles" de pájaros y flores a partir de subtítulos de texto como "un pájaro completamente negro con un pico grueso y redondeado distintivo" . Un modelo entrenado en el conjunto de datos COCO (Common Objects in Context), más diverso, produjo imágenes que eran "desde la distancia... alentadoras", pero que carecían de coherencia en sus detalles. [ 6 ] Los sistemas posteriores incluyen VQGAN-CLIP, [ 8 ] XMC-GAN y GauGAN2. [ 9 ]

década de 2020

Uno de los primeros modelos de conversión de texto a imagen que captó la atención del público fue DALL-E de OpenAI , un sistema transformador anunciado en enero de 2021. [ 10 ] Un sucesor capaz de generar imágenes más complejas y realistas, DALL-E 2, se presentó en abril de 2022, [ 11 ] seguido de Stable Diffusion , que se lanzó públicamente en agosto de 2022. [ 12 ] En agosto de 2022, la personalización de texto a imagen permite enseñar al modelo un nuevo concepto utilizando un pequeño conjunto de imágenes de un nuevo objeto que no estaba incluido en el conjunto de entrenamiento del modelo base de conversión de texto a imagen. Esto se logra mediante la inversión textual , es decir, encontrar un nuevo término de texto que corresponda a estas imágenes. Otros modelos de conversión de texto a imagen aparecieron con Adobe en marzo de 2023 y Black Forest Labs en agosto de 2024. [ 13 ]

Al igual que otros modelos de texto a imagen, las plataformas de texto a vídeo basadas en modelos de lenguaje , como Runway , Make-A-Video, [ 14 ] Imagen Video, [ 15 ] Midjourney, [ 16 ] y Phenaki [ 17 ] pueden generar vídeo a partir de texto y/o indicaciones de texto/imagen. [ 18 ]

Arquitectura y formación

Arquitectura de alto nivel que muestra el estado del arte de los modelos de aprendizaje automático de IA, y modelos y aplicaciones destacadas como un mapa de imagen SVG interactivo.

Se han desarrollado modelos de conversión de texto a imagen utilizando diversas arquitecturas. La codificación del texto puede realizarse con una red neuronal recurrente, como una red de memoria a corto y largo plazo (LSTM), aunque los modelos Transformer se han vuelto más populares. Para la generación de imágenes, las redes generativas antagónicas condicionales (GAN) fueron ampliamente utilizadas en sus inicios. Desde 2020, los modelos de difusión se han convertido en la opción preferida. En lugar de entrenar directamente un modelo para generar una imagen de alta resolución a partir de una representación de texto, una técnica común consiste en entrenarlo para generar imágenes de baja resolución o espacio latente, y utilizar uno o más modelos auxiliares de aprendizaje profundo para ampliarlas o decodificarlas, añadiendo detalles más finos.

Los modelos de conversión de texto a imagen se entrenan con grandes conjuntos de datos de pares (texto, imagen), a menudo extraídos de la web. Con su modelo Imagen 2022, Google Brain informó resultados positivos al usar un modelo de lenguaje grande entrenado por separado en un corpus solo de texto (con sus pesos posteriormente congelados), lo que representa una desviación del enfoque estándar hasta entonces. [ 19 ]

conjuntos de datos

Ejemplos de imágenes y subtítulos de tres conjuntos de datos públicos que se utilizan habitualmente para entrenar modelos de conversión de texto a imagen.

Para entrenar un modelo de conversión de texto a imagen se requiere un conjunto de datos de imágenes con sus respectivas descripciones de texto. Un conjunto de datos comúnmente utilizado para este propósito es el conjunto de datos COCO. Publicado por Microsoft en 2014, COCO consta de aproximadamente 123 000 imágenes que representan una diversidad de objetos con cinco descripciones por imagen, generadas por anotadores humanos. Originalmente, el enfoque principal de COCO era el reconocimiento de objetos y escenas en imágenes. Oxford-120 Flowers y CUB-200 Birds son conjuntos de datos más pequeños, de aproximadamente 10 000 imágenes cada uno, restringidos a flores y aves, respectivamente. Se considera menos difícil entrenar un modelo de conversión de texto a imagen de alta calidad con estos conjuntos de datos debido a su reducido rango temático. [ 7 ]

Uno de los conjuntos de datos abiertos más grandes para entrenar modelos de conversión de texto a imagen es LAION-5B, que contiene más de 5 mil millones de pares imagen-texto. Este conjunto de datos se creó mediante web scraping y filtrado automático basado en la similitud con obras de arte de alta calidad y fotografías profesionales. Sin embargo, debido a esto, también contiene contenido controvertido, lo que ha generado debates sobre la ética de su uso.

Algunas plataformas de IA modernas no solo generan imágenes a partir de texto, sino que también crean conjuntos de datos sintéticos para mejorar el entrenamiento y el ajuste fino de los modelos. Estos conjuntos de datos ayudan a evitar problemas de derechos de autor y a ampliar la diversidad de los datos de entrenamiento. [ 20 ]

Evaluación de la calidad

Evaluar y comparar la calidad de los modelos de conversión de texto a imagen es un problema que implica valorar múltiples propiedades deseables. Un requisito específico de estos modelos es que las imágenes generadas se alineen semánticamente con los textos descriptivos utilizados para generarlas. Se han ideado diversos métodos para evaluar estas cualidades, algunos automatizados y otros basados ​​en el juicio humano. [ 7 ]

Una métrica algorítmica común para evaluar la calidad y diversidad de las imágenes es la puntuación Inception (IS), que se basa en la distribución de etiquetas predichas por un modelo de clasificación de imágenes Inceptionv3 preentrenado al aplicarse a una muestra de imágenes generadas por el modelo de conversión de texto a imagen. La puntuación aumenta cuando el modelo de clasificación de imágenes predice una sola etiqueta con alta probabilidad, un esquema diseñado para favorecer las imágenes generadas "distintas". Otra métrica popular es la distancia Inception de Fréchet , que compara la distribución de las imágenes generadas y las imágenes de entrenamiento reales según las características extraídas por una de las capas finales de un modelo de clasificación de imágenes preentrenado. [ 7 ]

Impacto y aplicaciones

La IA tiene el potencial de transformar la sociedad , lo que puede incluir permitir la expansión de géneros de nicho no comerciales (como derivados del cyberpunk como el solarpunk ) por parte de aficionados, entretenimiento novedoso, prototipado rápido, [ 21 ] mayor accesibilidad a la creación artística, [ 21 ] y producción artística por esfuerzo, gasto o tiempo [ 21 ] , por ejemplo, mediante la generación de borradores, definiciones de borradores y componentes de imagen ( inpainting ). Las imágenes generadas se utilizan a veces como bocetos, [ 22 ] experimentos de bajo costo, [ 23 ] inspiración o ilustraciones de ideas en fase de prueba de concepto . Las funcionalidades o mejoras adicionales también pueden estar relacionadas con la edición manual posterior a la generación (es decir, el pulido), como el ajuste posterior con un editor de imágenes. [ 23 ]

Los artistas visuales y diseñadores profesionales utilizaron la IA generativa en la conceptualización inicial (pensamiento divergente) más que en la producción final (pensamiento convergente), y las prácticas que producen resultados digitales o efímeros (p. ej., diseño UI/UX, arte conceptual) los integran con mayor facilidad que las que producen artefactos físicos y permanentes (p. ej., escultura, arquitectura). [ 24 ] En los ámbitos físicos, las preocupaciones sobre la integridad estructural, las limitaciones de los materiales y la "etnocomputación" cultural a menudo limitan la IA a un papel de "mejora complementaria" en lugar de un sustituto de la producción. [ 25 ] Además, las actitudes hacia la adopción varían significativamente según la etapa profesional: los profesionales principiantes ven la IA generativa como una extensión pragmática de las herramientas digitales necesarias para la competitividad en el mercado, mientras que los profesionales sénior suelen expresar un escepticismo crítico con respecto a la devaluación de la experiencia encarnada y el desarrollo de habilidades a largo plazo. [ 24 ]

Lista de modelos destacados de conversión de texto a imagen

Notas explicativas

  1. Inicialmente denominada generación de imágenes GPT-4o [ 26 ]
  2. Esta licencia puede ser utilizada por particulares y organizaciones con ingresos de hasta 1 millón de dólares. Para organizaciones con ingresos anuales superiores a 1 millón de dólares, se requiere la Licencia Empresarial de Stability AI. Todos los resultados son propiedad de los usuarios, independientemente de sus ingresos.
  3. Para el modelo Schnell, el modelo Dev utiliza una licencia no comercial, mientras que el modelo Pro es propietario (solo disponible como API ).

Véase también

Referencias

  1. Vincent, James (24 de mayo de 2022). "Todas estas imágenes fueron generadas por la última IA de Google para la conversión de texto a imagen" . The Verge . Vox Media. Archivado del original el 15 de febrero de 2023. Recuperado el 28 de mayo de 2022 .
  2. Agnese, Jorge; Herrera, Jonathan; Tao, Haicheng; Zhu, Xingquan (octubre de 2019), Un estudio y taxonomía de redes neuronales adversarias para la síntesis de texto a imagen , arXiv : 1910.09399
  3. Zhu, Xiaojin; Goldberg, Andrew B.; Eldawy, Mohamed; Dyer, Charles R.; Strock, Bradley (2007). "Un sistema de síntesis de texto a imagen para aumentar la comunicación" (PDF) . AAAI . 7 : 1590–1595 . Archivado (PDF) del original el 7 de septiembre de 2022. Recuperado el 7 de septiembre de 2022 .
  4. 1 2 3 Mansimov, Elman; Parisotto, Emilio; Lei Ba, Jimmy; Salakhutdinov, Ruslan (noviembre de 2015). "Generación de imágenes a partir de subtítulos con atención". ICLR . arXiv : 1511.02793 .
  5. Mansimov, Elman; Parisotto, Emilio; Ba, Jimmy Lei; Salakhutdinov, Ruslan (29 de febrero de 2016). "Generación de imágenes a partir de subtítulos con atención". Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 1511.02793 .
  6. 1 2 3 Reed, Scott; Akata, Zeynep; Logeswaran, Lajanugen; Schiele, Bernt; Lee, Honglak (junio de 2016). "Síntesis generativa adversaria de texto a imagen" (PDF) . Conferencia internacional sobre aprendizaje automático . arXiv : 1605.05396 . Archivado (PDF) del original el 16 de marzo de 2023. Recuperado el 7 de septiembre de 2022 .
  7. 1 2 3 4 Frolov, Stanislav; Hinz, Tobias; Raue, Federico; Hees, Jörn; Dengel, Andreas (diciembre de 2021). " Síntesis adversaria de texto a imagen: una revisión" . Redes neuronales . 144 : 187–209 . arXiv : 2101.09983 . doi : 10.1016/j.neunet.2021.07.019 . PMID 34500257. S2CID 231698782 .  
  8. Rodríguez, Jesús (27 de septiembre de 2022). "🌅 Edge#229: VQGAN + CLIP" . thesequence.substack.com . Archivado del original el 4 de diciembre de 2022. Recuperado el 10 de octubre de 2022 .
  9. Rodríguez, Jesús (4 de octubre de 2022). "🎆🌆 Edge#231: Síntesis de texto a imagen con GANs" . thesequence.substack.com . Archivado del original el 4 de diciembre de 2022. Recuperado el 10 de octubre de 2022 .
  10. Coldewey, Devin (5 de enero de 2021). "DALL-E de OpenAI crea imágenes plausibles de prácticamente cualquier cosa que se le pida" . TechCrunch . Archivado del original el 6 de enero de 2021. Consultado el 7 de septiembre de 2022 .
  11. Coldewey, Devin (6 de abril de 2022). "El nuevo modelo DALL-E de OpenAI dibuja cualquier cosa, pero más grande, mejor y más rápido que antes" . TechCrunch . Archivado del original el 6 de mayo de 2023. Consultado el 7 de septiembre de 2022 .
  12. "Lanzamiento público de difusión estable" . Stability.Ai . Archivado del original el 30 de agosto de 2022. Consultado el 27 de octubre de 2022 .
  13. Edwards, Benj (2 de agosto de 2024). "FLUX: Este nuevo generador de imágenes con IA es sorprendentemente bueno creando manos humanas" . Ars Technica . Consultado el 7 de marzo de 2026 .
  14. Kumar, Ashish (3 de octubre de 2022). "Meta AI presenta 'Make-A-Video': un sistema de inteligencia artificial que genera vídeos a partir de texto" . MarkTechPost . Archivado del original el 1 de diciembre de 2022. Consultado el 3 de octubre de 2022 .
  15. Edwards, Benj (5 de octubre de 2022). "El generador de IA más reciente de Google crea videos HD a partir de indicaciones de texto" . Ars Technica . Archivado del original el 7 de febrero de 2023. Recuperado el 25 de octubre de 2022 .
  16. Rodríguez, Jesús (25 de octubre de 2022). "🎨 Edge#237: ¿Qué es Midjourney?" . thesequence.substack.com . Archivado del original el 4 de diciembre de 2022 . Recuperado el 26 de octubre de 2022 .
  17. "Phenaki" . phenaki.video . Archivado del original el 7 de octubre de 2022. Consultado el 3 de octubre de 2022 .
  18. Edwards, Benj (9 de septiembre de 2022). "Runway muestra la edición de texto a vídeo con IA mediante indicaciones escritas" . Ars Technica. Archivado del original el 27 de enero de 2023. Recuperado el 12 de septiembre de 2022 .
  19. ^ Sahara, Chitwan; Chan, William; Saxena, Saurabh; Li, Lala; Vaya, Jay; Denton, Emily; Kamyar Seyed Ghasemipour, Seyed; Karagol Ayan, Burcu; Sara Mahdavi, S.; Gontijo Lopes, Rapha; Salimans, Tim; Hola, Jonatán; Flota J, David; Norouzi, Mohammad (23 de mayo de 2022). "Modelos fotorrealistas de difusión de texto a imagen con comprensión profunda del lenguaje". arXiv : 2205.11487 [ cs.CV ].
  20. Martin (29 de enero de 2025). "Generación de texto e imágenes mediante IA" . Debatly .
  21. 1 2 3 Elgan, Mike (1 de noviembre de 2022). "Cómo los 'medios sintéticos' transformarán los negocios para siempre" . Computerworld . Archivado del original el 10 de febrero de 2023. Recuperado el 9 de noviembre de 2022 .
  22. Roose, Kevin (21 de octubre de 2022). "El arte generado por IA ya está transformando el trabajo creativo" . The New York Times . Archivado del original el 15 de febrero de 2023. Consultado el 16 de noviembre de 2022 .
  23. 1 2 Leswing, Kif. "Por qué Silicon Valley está tan entusiasmado con los dibujos torpes hechos por inteligencia artificial" . CNBC. Archivado del original el 8 de febrero de 2023. Recuperado el 16 de noviembre de 2022 .
  24. 1 2 Tsao, Jack; Liang, Cindy Xinyi; Nogues, Collier; Wong, Alice (2026). "Percepciones e integración de la inteligencia artificial generativa en prácticas e industrias creativas: una revisión exploratoria y un modelo conceptual" . AI & Society . 41 (3): 2259– 2278. doi : 10.1007/s00146-025-02667-2 .
  25. Roncoroni, UL; Crousse De Vallongue, V.; Centurion Bolaños, O. (2024). "Problemas de creatividad computacional en el diseño generativo y la fabricación digital de mallas 3D complejas" . International Journal of Architectural Computing . 23 (2): 582– 600. doi : 10.1177/14780771241260850 .
  26. "Introducción a la generación de imágenes 4o" . OpenAI . 25 de marzo de 2025. Consultado el 27 de marzo de 2025 .
  27. "Imagen 2 en Vertex AI ya está disponible para el público en general" . Blog de Google Cloud . Archivado del original el 21 de febrero de 2024. Consultado el 2 de enero de 2024 .