Articulo de referencia

Personalización de texto a imagen

La personalización de texto a imagen es una tarea de aprendizaje profundo para gráficos por computadora que aumenta los modelos generativos de texto a imagen preentrenados . En ...

La personalización de texto a imagen es una tarea de aprendizaje profundo para gráficos por computadora que aumenta los modelos generativos de texto a imagen preentrenados . En esta tarea, un modelo generativo que fue entrenado con datos a gran escala (generalmente un modelo base ) se adapta de manera que pueda generar imágenes de conceptos nuevos proporcionados por el usuario. [ 1 ] [ 2 ] Estos conceptos generalmente no se ven durante el entrenamiento y pueden representar objetos específicos (como la mascota del usuario) o categorías más abstractas (nuevo estilo artístico [ 3 ] o relaciones de objetos [ 4 ] ).

Los métodos de personalización de texto a imagen suelen vincular el concepto novedoso (personal) a nuevas palabras en el vocabulario del modelo. Estas palabras pueden utilizarse posteriormente en indicaciones para evocar el concepto para la generación dirigida por el sujeto, [ 5 ] el relleno de imágenes , la transferencia de estilo [ 6 ] e incluso para corregir sesgos en el modelo. Para ello, los modelos optimizan las incrustaciones de palabras , ajustan el propio modelo generativo o emplean una combinación de ambos enfoques.

Tecnología

La personalización de texto a imagen fue propuesta por primera vez en agosto de 2022 por dos trabajos simultáneos, Textual Inversion [ 7 ] y DreamBooth . [ 8 ]

En ambos casos, el usuario proporciona algunas imágenes (normalmente entre 3 y 5) de un concepto, como su propio perro, junto con una descripción general de la clase de concepto (como la palabra "perro"). El modelo aprende entonces a representar al sujeto mediante un objetivo basado en la reconstrucción, donde se espera que las indicaciones que hacen referencia al sujeto reconstruyan imágenes del conjunto de entrenamiento.

En la inversión textual, los conceptos personalizados se introducen en el modelo de texto a imagen añadiendo nuevas palabras al vocabulario del modelo. Los modelos típicos de texto a imagen representan las palabras (y a veces partes de palabras) como tokens o índices en un diccionario predefinido. Durante la generación, una solicitud de entrada se convierte en dichos tokens, cada uno de los cuales se convierte en una "incrustación de palabra": una representación vectorial continua que se aprende para cada token como parte del entrenamiento del modelo. La inversión textual propone optimizar un nuevo vector de incrustación de palabra para representar el nuevo concepto. Este nuevo vector de incrustación se puede asignar a una cadena elegida por el usuario y se invoca cada vez que la solicitud del usuario contenga dicha cadena. [ 7 ]

En DreamBooth , en lugar de optimizar un nuevo vector de palabras, se ajusta el modelo generativo completo. El usuario primero selecciona un token existente, generalmente uno que rara vez aparece en las indicaciones. El sujeto se representa mediante una cadena que contiene este token, seguida de una descripción general de la clase del sujeto. Una indicación que describe al sujeto tendrá entonces el formato: "Una foto de <token> <clase>" (por ejemplo, "una foto de un gato sks" al aprender a representar un gato específico). El modelo de conversión de texto a imagen se ajusta para que las indicaciones de este formato generen imágenes del sujeto. [ 8 ]

Inversión textual

La idea clave en la Inversión Textual es agregar un nuevo término al vocabulario del modelo de difusión que corresponda al nuevo concepto (personalizado).

La inversión textual funciona invirtiendo los conceptos en nuevas pseudopalabras dentro del espacio de incrustación textual de un modelo de conversión de texto a imagen preentrenado. Estas pseudopalabras se pueden insertar en nuevas escenas mediante descripciones sencillas en lenguaje natural , lo que permite modificaciones simples e intuitivas. El método permite al usuario aprovechar la información multimodal, utilizando una interfaz basada en texto para facilitar la edición, pero proporcionando pistas visuales cuando se alcanzan los límites del lenguaje natural.

El modelo resultante es extremadamente ligero por concepto: solo 1K de longitud, pero logra codificar propiedades visuales detalladas del concepto. [ 9 ]

Extensiones

Se propusieron varios enfoques para refinar y mejorar los métodos originales. Estos incluyen los siguientes.

  1. Adaptación de bajo rango (LoRA) : una técnica basada en adaptadores para el ajuste fino eficiente de modelos. [ 10 ] En el caso de los modelos de texto a imagen , LoRA se utiliza típicamente para modificar las capas de atención cruzada de un modelo de difusión . [ 11 ]
  2. Perfusión: un método de actualización de bajo rango que también bloquea las activaciones de la matriz clave en las capas de atención cruzada del modelo de difusión a la clase gruesa del concepto. [ 12 ]
  3. Inversión textual extendida: una técnica que aprende una incrustación de palabra individual para cada capa en la red de eliminación de ruido del modelo de difusión. [ 13 ]
  4. Métodos basados ​​en codificadores que utilizan otra red neuronal para personalizar rápidamente un modelo [ 14 ] [ 15 ]

Desafíos y limitaciones

Los métodos de personalización de texto a imagen deben afrontar varios desafíos. Su objetivo principal es lograr una alta fidelidad al concepto personal, manteniendo al mismo tiempo una gran coherencia entre las nuevas indicaciones que contienen el tema y las imágenes generadas (lo que se conoce como "editabilidad").

Otro desafío al que se enfrentan los métodos de personalización son los requisitos de memoria. Las implementaciones iniciales de estos métodos requerían más de 20 gigabytes de memoria de GPU, y enfoques más recientes han reportado requisitos de más de 40 gigabytes. [ 14 ] Sin embargo, optimizaciones como Flash Attention [ 16 ] han reducido considerablemente este requisito.

Los enfoques que ajustan el modelo generativo completo también pueden crear puntos de control de varios gigabytes, lo que dificulta compartir o almacenar muchos modelos. Los enfoques basados ​​en incrustaciones requieren solo unos pocos kilobytes, pero suelen tener dificultades para preservar la identidad y, al mismo tiempo, mantener la capacidad de edición. Enfoques más recientes han propuesto objetivos de ajuste híbridos que optimizan tanto una incrustación como un subconjunto de pesos de la red. Estos pueden reducir los requisitos de almacenamiento a tan solo 100 kilobytes, logrando una calidad comparable a la de los métodos de ajuste completos. [ 12 ]

Finalmente, los procesos de optimización pueden ser largos, requiriendo varios minutos de ajuste para cada concepto nuevo. Los métodos de codificación y ajuste rápido buscan reducir este tiempo a segundos o menos. [ 17 ]

Referencias

  1. Murphy, Brendan Paul (12 de octubre de 2022). «La generación de imágenes mediante IA avanza a velocidades astronómicas. ¿Podemos aún distinguir si una imagen es falsa?» . The Conversation . Consultado el 14 de septiembre de 2023 .
  2. "「好きなキャラに近い絵をAIが量産」――ある概念を"単語"に圧縮し入力テキストに使える技術" . NOTICIAS ITmedia (en japonés) . Consultado el 14 de septiembre de 2023 .
  3. Baio, Andy (1 de noviembre de 2022). "Difusión invasiva: cómo una ilustradora involuntaria se vio convertida en un modelo de IA" . Waxy.org . Consultado el 14 de septiembre de 2023 .
  4. ^ Huang, Ziqi; Wu, Tianxing; Jiang, Yuming; Chan, Kelvin CK; Liu, Ziwei (2023). "ReVersion: inversión de relaciones basada en difusión a partir de imágenes". arXiv : 2303.13495 [ cs.CV ].
  5. Jr, Edward Ongweso (14 de octubre de 2022). "La gente ahora hace selfies falsas con IA" . Vice . Recuperado el 20 de septiembre de 2023 .
  6. Dave James (27/12/2022). "Exigí al máximo la RTX 4090 durante 8 horas seguidas entrenando Difusión Estable para pintar como mi tío Hermann" . PC Gamer . Consultado el 20/09/2023 .
  7. 1 2 Gal, Rinon; Alaluf, Yuval; Atzmon, Yuval; Patashnik, Or; Bermano, Amit Haim; Chechik, Gal; Cohen-or, Daniel (2022-09-29). "Una imagen vale más que una palabra: Personalización de la generación de texto a imagen mediante inversión textual" . arXiv : 2208.01618 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  8. 1 2 Ruiz, Nataniel; Li, Yuanzhen; Jampani, Varun; Pritch, Yael; Rubinstein, Michael; Aberman, Kfir (2023). "DreamBooth: Ajuste fino de modelos de difusión de texto a imagen para la generación dirigida por el sujeto" : 22500–22510 . arXiv : 2208.12242 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  9. "Página de papel: una imagen vale más que una palabra: personalización de la generación de texto a imagen mediante inversión textual" . huggingface.co . 9 de abril de 2025. Consultado el 29 de agosto de 2025 .
  10. Singh, Niharika (18 de febrero de 2023). "HuggingFace publica scripts de LoRA para un ajuste fino de difusión estable y eficiente" . MarkTechPost . Consultado el 14 de septiembre de 2023 .
  11. ^ Hu, Edward J.; Shen, Yelong; Wallis, Phillip; Allen-Zhu, Zeyuan; Li, Yuanzhi; Wang, Shean; Wang, Lu; Chen, Weizhu (6 de octubre de 2021). "LoRA: adaptación de bajo rango de modelos de lenguaje grandes" . arXiv : 2106.09685 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  12. 1 2 Tewel, Yoad; Gal, Rinon; Chechik, Gal; Atzmon, Yuval (23 de julio de 2023). "Edición de rango uno con bloqueo de clave para la personalización de texto a imagen" . Actas de la conferencia del Grupo de Interés Especial en Gráficos por Computadora y Técnicas Interactivas . SIGGRAPH '23. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 1–11 . arXiv : 2305.01644 . doi : 10.1145/3588432.3591506 . ISBN  979-8-4007-0159-7. S2CID 258436985 . 
  13. Lorenzi, Daniele (22 de julio de 2023). "Conoce P+: Un espacio de incrustaciones enriquecido para la inversión textual extendida en la generación de texto a imagen" . MarkTechPost . Recuperado el 29 de agosto de 2023 .
  14. 1 2 Gal, Rinon; Arar, Moab; Atzmon, Yuval; Bermano, Amit H.; Chechik, Gal; Cohen-Or, Daniel (2023-07-26). "Encoder-based Domain Tuning for Fast Personalization of Text-to-Image Models" . ACM Transactions on Graphics . 42 (4): 150:1–150:13. arXiv : 2302.12228 . doi : 10.1145/3592133 . ISSN 0730-0301 . S2CID 257364757 .  
  15. ^ Wei, Yuxiang; Zhang, Yabo; Ji, Zhilong; Bai, Jinfeng; Zhang, Lei; Zuo, Wangmeng (2023). "ELITE: codificación de conceptos visuales en incrustaciones textuales para una generación personalizada de texto a imagen". arXiv : 2302.13848 [ cs.CV ].
  16. Dao, Tri; Fu, Daniel Y.; Ermon, Stefano; Rudra, Atri; Ré, Christopher (2022). "FlashAttention: Atención exacta rápida y eficiente en memoria con conciencia de E/S". arXiv : 2205.14135 [ cs.LG ].
  17. Shi, Jing; Xiong, Wei; Lin, Zhe; Jung, Hyun Joon (2023). "InstantBooth: Generación personalizada de texto a imagen sin ajuste fino en tiempo de prueba". arXiv : 2304.03411 [ cs.CV ].