Articulo de referencia

DALL-E

DALL-E , DALL-E 2 y DALL-E 3 (estilizado como DALL·E ) son modelos de conversión de texto a imagen desarrollados por OpenAI que utilizan metodologías de aprendizaje profundo par...

DALL-E , DALL-E 2 y DALL-E 3 (estilizado como DALL·E ) son modelos de conversión de texto a imagen desarrollados por OpenAI que utilizan metodologías de aprendizaje profundo para generar imágenes digitales a partir de descripciones en lenguaje natural conocidas como indicaciones .

La primera versión de DALL-E se anunció en enero de 2021. Al año siguiente, se lanzó su sucesor, DALL-E 2. DALL-E 3 se lanzó de forma nativa en ChatGPT para los clientes de ChatGPT Plus y ChatGPT Enterprise en octubre de 2023, [ 1 ] con disponibilidad a través de la API de OpenAI [ 2 ] y la plataforma "Labs" proporcionada a principios de noviembre. [ 3 ] Microsoft implementó el modelo en la herramienta Image Creator de Bing y planea implementarlo en su aplicación Designer. [ 4 ] Con la herramienta Image Creator de Bing, Microsoft Copilot se ejecuta en DALL-E 3. [ 5 ] En marzo de 2025, DALL-E 3 fue reemplazado en ChatGPT por las capacidades nativas de generación de imágenes de GPT Image . [ 6 ]

Historia y antecedentes

DALL-E fue presentado por OpenAI en una publicación de blog el 5 de enero de 2021 y utiliza una versión de GPT-3 modificada para generar imágenes. [ 7 ]

El 6 de abril de 2022, OpenAI anunció DALL-E 2, un sucesor diseñado para generar imágenes más realistas en resoluciones más altas que "pueden combinar conceptos, atributos y estilos". [ 8 ] El 20 de julio de 2022, DALL-E 2 entró en una fase beta con invitaciones enviadas a 1 millón de personas en lista de espera; [ 9 ] los usuarios podían generar una cierta cantidad de imágenes gratis cada mes y podían comprar más. [ 10 ] El acceso había estado previamente restringido a usuarios preseleccionados para una vista previa de investigación debido a preocupaciones sobre ética y seguridad. [ 11 ] [ 12 ] El 28 de septiembre de 2022, DALL-E 2 se abrió a todos y se eliminó el requisito de la lista de espera. [ 13 ] En septiembre de 2023, OpenAI anunció su último modelo de imagen, DALL-E 3, capaz de comprender "detalles y matices significativamente más" que las iteraciones anteriores. [ 14 ] A principios de noviembre de 2022, OpenAI lanzó DALL-E 2 como una API , lo que permite a los desarrolladores integrar el modelo en sus propias aplicaciones. Microsoft presentó su implementación de DALL-E 2 en su aplicación Designer y en la herramienta Image Creator incluida en Bing y Microsoft Edge . [ 15 ] La API funciona con un modelo de pago por imagen, cuyos precios varían según la resolución de la imagen. Hay descuentos por volumen disponibles para las empresas que trabajan con el equipo empresarial de OpenAI. [ 16 ]

El nombre del software es una combinación de los nombres del personaje robot animado de Pixar , WALL-E, y del artista surrealista español Salvador Dalí . [ 17 ] [ 7 ]

En febrero de 2024, OpenAI comenzó a agregar marcas de agua a las imágenes generadas por DALL-E, que contienen metadatos en el estándar C2PA (Coalición para la Procedencia y Autenticidad del Contenido) promovido por la Iniciativa de Autenticidad del Contenido . [ 18 ]

Tecnología

El primer modelo transformador preentrenado generativo (GPT) fue desarrollado inicialmente por OpenAI en 2018, [ 19 ] utilizando una arquitectura Transformer . La primera iteración, GPT-1, [ 20 ] se amplió para producir GPT-2 en 2019; [ 21 ] en 2020, se amplió nuevamente para producir GPT-3 , con 175 mil millones de parámetros. [ 22 ] [ 7 ] [ 23 ]

DALL-E

DALL-E tiene tres componentes: un VAE discreto , un modelo Transformer autorregresivo decodificador (12 mil millones de parámetros) similar a GPT-3, y un par CLIP de codificador de imagen y codificador de texto. [ 24 ]

El VAE discreto puede convertir una imagen en una secuencia de tokens y, a la inversa, convertir una secuencia de tokens de nuevo en una imagen. Esto es necesario ya que el modelo Transformer no procesa directamente los datos de la imagen. [ 24 ]

La entrada al modelo Transformer es una secuencia de subtítulos de imagen tokenizados seguida de parches de imagen tokenizados. El subtítulo de la imagen está en inglés, tokenizado mediante codificación de pares de bytes (tamaño de vocabulario 16384), y puede tener hasta 256 tokens de longitud. Cada imagen es una imagen RGB de 256×256, dividida en parches de 32×32 de 4×4 cada uno. Cada parche se convierte luego mediante un autoencoder variacional discreto en un token (tamaño de vocabulario 8192). [ 24 ]

DALL-E se desarrolló y se presentó al público junto con CLIP (Contrastive Language-Image Pre-training) . [ 25 ] CLIP es un modelo independiente basado en el aprendizaje contrastivo que se entrenó con 400 millones de pares de imágenes con subtítulos de texto extraídos de Internet. Su función es "comprender y clasificar" la salida de DALL-E prediciendo cuál de una lista de 32 768 subtítulos seleccionados aleatoriamente del conjunto de datos (de los cuales uno era la respuesta correcta) es el más apropiado para una imagen. [ 26 ]

Se utiliza un par CLIP entrenado para filtrar una lista inicial más grande de imágenes generadas por DALL-E para seleccionar la imagen que esté más cerca del texto de indicación. [ 24 ]

DALL-E 2

DALL-E 2 utiliza 3.5 mil millones de parámetros, una cantidad menor que su predecesor. [ 24 ] En lugar de un Transformer autorregresivo, DALL-E 2 utiliza un modelo de difusión condicionado a incrustaciones de imágenes CLIP, que, durante la inferencia, se generan a partir de incrustaciones de texto CLIP mediante un modelo previo. [ 24 ] Esta es la misma arquitectura que la de Stable Diffusion , lanzado unos meses después.

DALL-E 3

Aunque se redactó un informe técnico para DALL-E 3, este no incluye detalles de capacitación o implementación del modelo, sino que se centra en las capacidades mejoradas de seguimiento de indicaciones desarrolladas para DALL-E 3. [ 27 ]

Capacidades

DALL-E puede generar imágenes en múltiples estilos, incluyendo imágenes fotorrealistas , pinturas y emojis . [ 7 ] Puede "manipular y reorganizar" objetos en sus imágenes, [ 7 ] y puede colocar correctamente elementos de diseño en composiciones novedosas sin instrucciones explícitas. Thom Dunn escribiendo para BoingBoing comentó que "Por ejemplo, cuando se le pide que dibuje un rábano daikon sonándose la nariz, tomando un café con leche o montando un monociclo, DALL-E a menudo dibuja el pañuelo, las manos y los pies en lugares plausibles". [ 28 ] DALL-E demostró la capacidad de "completar los espacios en blanco" para inferir detalles apropiados sin indicaciones específicas, como agregar imágenes navideñas a indicaciones comúnmente asociadas con la celebración, [ 29 ] y colocar sombras apropiadamente en imágenes que no las mencionaban. [ 30 ] Además, DALL-E exhibe una amplia comprensión de las tendencias visuales y de diseño.

DALL-E puede producir imágenes para una amplia variedad de descripciones arbitrarias desde diversos puntos de vista [ 31 ] con solo fallos poco frecuentes. [ 17 ] Mark Riedl, profesor asociado de la Escuela de Computación Interactiva de Georgia Tech , descubrió que DALL-E podía combinar conceptos (descritos como un elemento clave de la creatividad humana ). [ 32 ] [ 33 ]

Su capacidad de razonamiento visual es suficiente para resolver las Matrices de Raven (pruebas visuales que se administran frecuentemente a los humanos para medir la inteligencia). [ 34 ] [ 35 ]

Imagen generada por DALL-E 3 a partir del texto "Una ilustración de un aguacate sentado en la silla de un terapeuta, diciendo 'Me siento tan vacío por dentro', con un agujero del tamaño de una semilla en el centro. El terapeuta, una cuchara, toma notas".

DALL-E 3 sigue indicaciones complejas con mayor precisión y detalle que sus predecesores, y es capaz de generar texto más coherente y preciso. [ 36 ] [ 14 ] DALL-E 3 está integrado en ChatGPT Plus. [ 14 ]

Modificación de imagen

Dos "variaciones" de La joven de la perla generadas con DALL-E 2

A partir de una imagen existente, DALL-E 2 y DALL-E 3 pueden generar variaciones de la misma como resultados individuales basados ​​en la original, además de editarla para modificarla o ampliarla. Las funciones de relleno y ampliación de estos modelos utilizan el contexto de la imagen para rellenar las áreas faltantes con un medio compatible con el original, siguiendo una indicación específica.

Por ejemplo, esto se puede usar para insertar un nuevo sujeto en una imagen o expandir una imagen más allá de sus bordes originales. [ 37 ] Según OpenAI, "Outpainting tiene en cuenta los elementos visuales existentes de la imagen —incluidas sombras, reflejos y texturas— para mantener el contexto de la imagen original". [ 38 ]

Limitaciones técnicas

La comprensión del lenguaje de DALL-E 2 tiene limitaciones. A veces no puede distinguir entre "Un libro amarillo y un jarrón rojo" y "Un libro rojo y un jarrón amarillo" o entre "Un panda haciendo arte latte" y "Arte latte de un panda". [ 39 ] Genera imágenes de un astronauta montando a caballo cuando se le presenta la instrucción "un caballo montando a un astronauta". [ 40 ] También falla al generar las imágenes correctas en diversas circunstancias. Solicitar más de tres objetos, negaciones, números y oraciones conectadas puede resultar en errores, y las características de los objetos pueden aparecer en el objeto equivocado. [ 31 ] Otras limitaciones incluyen la generación de texto, ambigramas y otras formas de tipografía, lo que a menudo resulta en un galimatías onírico. El modelo también tiene una capacidad limitada para abordar información científica, como astronomía o imágenes médicas. [ 41 ]

Un intento de generar texto japonés usando el mensaje "una persona señalando un tanuki , con un bocadillo que dice 'これは狸です! ' " , lo que da como resultado que el texto se represente con kanji y kana sin sentido.

Preocupaciones éticas

La dependencia de DALL-E 2 de conjuntos de datos públicos influye en sus resultados y conduce a un sesgo algorítmico en algunos casos, como generar un mayor número de hombres que de mujeres para solicitudes que no mencionan el género. [ 41 ] Los datos de entrenamiento de DALL-E 2 se filtraron para eliminar imágenes violentas y sexuales, pero se descubrió que esto aumentaba el sesgo en algunos casos, como reducir la frecuencia de mujeres generadas. [ 42 ] OpenAI plantea la hipótesis de que esto puede deberse a que las mujeres eran más propensas a ser sexualizadas en los datos de entrenamiento, lo que provocó que el filtro influyera en los resultados. [ 42 ] En septiembre de 2022, OpenAI confirmó a The Verge que DALL-E inserta frases invisibles en las indicaciones del usuario para abordar el sesgo en los resultados; por ejemplo, "hombre negro" y "mujer asiática" se insertan en indicaciones que no especifican el género o la raza. [ 43 ] OpenAI afirma abordar las preocupaciones sobre el posible "contenido subido de tono" —que contiene desnudez o generación de contenido sexual— con DALL-E 3 mediante filtros de entrada/salida, listas de bloqueo, rechazos de ChatGPT e intervenciones a nivel del modelo. [ 44 ] Sin embargo, DALL-E 3 continúa representando desproporcionadamente a las personas como blancas, mujeres y jóvenes. Los usuarios pueden remediar esto en cierta medida mediante indicaciones más específicas para la generación de imágenes. 

Una preocupación sobre DALL-E 2 y modelos similares de generación de imágenes es que podrían usarse para propagar deepfakes y otras formas de desinformación. [ 45 ] [ 46 ] Para intentar mitigar esto, el software rechaza las indicaciones que involucran figuras públicas y las cargas que contienen rostros humanos. [ 47 ] Las indicaciones que contienen contenido potencialmente objetable se bloquean y las imágenes cargadas se analizan para detectar material ofensivo. [ 48 ] Una desventaja del filtrado basado en indicaciones es que es fácil eludirlo usando frases alternativas que dan como resultado una salida similar. Por ejemplo, la palabra "sangre" se filtra, pero "ketchup" y "líquido rojo" no. [ 49 ] [ 48 ]

Otra preocupación sobre DALL-E 2 y modelos similares es que podrían causar desempleo tecnológico para artistas, fotógrafos y diseñadores gráficos debido a su precisión y popularidad. [ 50 ] [ 51 ] DALL-E 3 está diseñado para impedir que los usuarios generen arte al estilo de artistas vivos. [ 14 ] Si bien OpenAI afirma que las imágenes producidas con estos modelos no requieren permiso para reimprimir, vender o comercializar, [ 52 ] se han planteado preocupaciones legales sobre quién posee esas imágenes. [ 53 ] [ 54 ]

En 2023, Microsoft propuso al Departamento de Defensa de los Estados Unidos el uso de modelos DALL-E para entrenar sistemas de gestión de campos de batalla . [ 55 ] En enero de 2024, OpenAI eliminó de sus políticas de uso la prohibición general sobre el uso militar y bélico. [ 56 ]

Recepción

Imágenes generadas por DALL-E a partir de la siguiente indicación: "una ilustración de un rábano daikon bebé con un tutú paseando a un perro".

La mayor parte de la cobertura de DALL-E se centra en un pequeño subconjunto de resultados "surrealistas" [ 25 ] o "peculiares" [ 32 ] . El resultado de DALL-E para "una ilustración de un rábano daikon bebé con un tutú paseando a un perro" fue mencionado en artículos de Input , [ 57 ] NBC , [ 58 ] Nature , [ 59 ] y otras publicaciones. [ 7 ] [ 60 ] [ 61 ] Su resultado para "un sillón con forma de aguacate" también fue ampliamente cubierto. [ 25 ] [ 33 ]

ExtremeTech afirmó que "se le puede pedir a DALL-E una foto de un teléfono o una aspiradora de un período de tiempo específico, y este comprende cómo han cambiado esos objetos". [ 29 ] Engadget también destacó su inusual capacidad para "comprender cómo cambian los teléfonos y otros objetos con el tiempo". [ 30 ]

Según MIT Technology Review , uno de los objetivos de OpenAI era "dar a los modelos de lenguaje una mejor comprensión de los conceptos cotidianos que los humanos usan para dar sentido a las cosas". [ 25 ]

Los inversores de Wall Street han tenido una recepción positiva de DALL-E 2, y algunas firmas creen que podría representar un punto de inflexión para una futura industria multimillonaria. A mediados de 2019, OpenAI ya había recibido más de mil millones de dólares en financiación de Microsoft y Khosla Ventures, [ 62 ] [ 63 ] [ 64 ] y en enero de 2023, tras el lanzamiento de DALL-E 2 y ChatGPT, recibió diez mil millones de dólares adicionales en financiación de Microsoft. [ 65 ]

La comunidad del anime de Japón ha tenido una reacción negativa a DALL-E 2 y modelos similares. [ 66 ] [ 67 ] [ 68 ] Los artistas suelen presentar dos argumentos en contra del software. El primero es que el arte de IA no es arte porque no es creado por un humano con intención. "La yuxtaposición de imágenes generadas por IA con su propio trabajo es degradante y socava el tiempo y la habilidad que invierten en su arte. Las herramientas de generación de imágenes impulsadas por IA han sido duramente criticadas por los artistas porque se entrenan con arte creado por humanos extraído de la web." [ 9 ] El segundo es el problema con la ley de derechos de autor y los datos con los que se entrenan los modelos de texto a imagen. OpenAI no ha publicado información sobre qué conjunto(s) de datos se utilizaron para entrenar a DALL-E 2, lo que ha generado preocupación en algunos de que el trabajo de los artistas se haya utilizado para el entrenamiento sin permiso. Las leyes de derechos de autor relacionadas con estos temas son inconclusas en este momento. [ 10 ]

Después de integrar DALL-E 3 en Bing Chat y ChatGPT, Microsoft y OpenAI recibieron críticas por el excesivo filtrado de contenido, y algunos críticos afirmaron que DALL-E había sido "lobotomizado". [ 69 ] Se citó como prueba el marcado de imágenes generadas por sugerencias como "hombre rompe rack de servidores con un mazo". Durante los primeros días de su lanzamiento, se informó que el filtrado aumentó hasta el punto de que se bloqueaban imágenes generadas por algunas de las propias sugerencias de Bing. [ 69 ] [ 70 ] TechRadar argumentó que inclinarse demasiado hacia la precaución podría limitar el valor de DALL-E como herramienta creativa. [ 70 ]

Alternativas de código abierto

Generación de imágenes DALL-E Mini en junio de 2022

Dado que OpenAI no ha publicado el código fuente ni los pesos de ninguno de los tres modelos, se han realizado varios intentos de crear modelos de código abierto que ofrezcan capacidades similares. [ 71 ] [ 72 ] Lanzado en 2022 en la plataforma Spaces de Hugging Face , Craiyon (anteriormente DALL-E Mini hasta que OpenAI solicitó un cambio de nombre en junio de 2022) es un modelo de IA basado en el DALL-E original que fue entrenado con datos sin filtrar de Internet. Atrajo una considerable atención de los medios a mediados de 2022, después de su lanzamiento, debido a su capacidad para producir imágenes humorísticas. [ 73 ] [ 74 ] [ 75 ] Otro ejemplo de un modelo de texto a imagen de código abierto es Stable Diffusion de Stability AI. [ 76 ]

Véase también

Referencias

  1. David, Emilia (20 de septiembre de 2023). "OpenAI lanza la tercera versión de DALL-E" . The Verge . Archivado del original el 20 de septiembre de 2023. Recuperado el 21 de septiembre de 2023 .
  2. "Plataforma OpenAI" . platform.openai.com . Archivado del original el 20 de marzo de 2023. Consultado el 10 de noviembre de 2023 .
  3. Niles, Raymond (10 de noviembre de 2023) [Actualizado esta semana]. "API DALL-E 3" . Centro de ayuda de OpenAI . Archivado del original el 10 de noviembre de 2023. Recuperado el 10 de noviembre de 2023 .
  4. Mehdi, Yusuf (21 de septiembre de 2023). "Presentamos Microsoft Copilot, tu compañero de IA para el día a día" . El blog oficial de Microsoft . Archivado del original el 21 de septiembre de 2023. Consultado el 21 de septiembre de 2023 .
  5. "Mejoras en el arte con IA gracias a DALL-E 3" . Microsoft . Consultado el 1 de octubre de 2024 .
  6. Zeff, Kyle; Wiggers, Maxwell (25 de marzo de 2025). "La función de generación de imágenes de ChatGPT se actualiza" . TechCrunch . Consultado el 12 de mayo de 2025 .
  7. 1 2 3 4 5 6 Johnson, Khari (5 de enero de 2021). "OpenAI presenta DALL-E para generar imágenes a partir de texto" . VentureBeat. Archivado del original el 5 de enero de 2021. Recuperado el 5 de enero de 2021 .
  8. "DALL·E 2" . OpenAI . Archivado del original el 6 de abril de 2022. Consultado el 6 de julio de 2022 .
  9. 1 2 "DALL·E ya está disponible en versión beta" . OpenAI . 20 de julio de 2022. Archivado del original el 20 de julio de 2022. Recuperado el 20 de julio de 2022 .
  10. 1 2 Allyn, Bobby (20 de julio de 2022). "¿Surrealista o demasiado real? La impresionante herramienta de IA DALL-E lleva sus imágenes a un escenario más grande" . NPR . Archivado del original el 20 de julio de 2022. Recuperado el 20 de julio de 2022 .
  11. "Lista de espera de DALL·E" . labs.openai.com . Archivado del original el 4 de julio de 2022. Consultado el 6 de julio de 2022 .
  12. "De los bebés de Trump Nevermind a los deepfakes: DALL-E y la ética del arte de la IA" . The Guardian . 18 de junio de 2022. Archivado del original el 6 de julio de 2022. Recuperado el 6 de julio de 2022 .
  13. "DALL·E ya está disponible sin lista de espera" . OpenAI . 28 de septiembre de 2022. Archivado del original el 4 de octubre de 2022. Consultado el 5 de octubre de 2022 .
  14. 1 2 3 4 "DALL·E 3" . OpenAI . Archivado del original el 20 de septiembre de 2023. Recuperado el 21 de septiembre de 2023 .
  15. "API DALL·E ya disponible en beta pública" . OpenAI . 3 de noviembre de 2022. Archivado del original el 19 de noviembre de 2022. Consultado el 19 de noviembre de 2022 .
  16. Wiggers, Kyle (3 de noviembre de 2022). "Ahora cualquiera puede crear aplicaciones que utilicen DALL-E 2 para generar imágenes" . TechCrunch . Archivado del original el 19 de noviembre de 2022. Recuperado el 19 de noviembre de 2022 .
  17. 1 2 Coldewey, Devin (5 de enero de 2021). "DALL-E de OpenAI crea imágenes plausibles de prácticamente cualquier cosa que se le pida" . Archivado del original el 6 de enero de 2021. Recuperado el 5 de enero de 2021 .
  18. Growcoot, Matt (8 de febrero de 2024). "Las imágenes de IA generadas en DALL-E ahora contienen la etiqueta de autenticidad del contenido" . PetaPixel . Recuperado el 4 de abril de 2024 .
  19. Radford, Alec; Narasimhan, Karthik; Salimans, Tim; Sutskever, Ilya (11 de junio de 2018). "Mejora de la comprensión del lenguaje mediante preentrenamiento generativo" (PDF) . OpenAI . pág. 12. Archivado (PDF) del original el 26 de enero de 2021. Recuperado el 23 de enero de 2021 . 
  20. "GPT-1 a GPT-4: Explicación y comparación de cada uno de los modelos GPT de OpenAI" . 11 de abril de 2023. Archivado del original el 15 de abril de 2023. Consultado el 29 de abril de 2023 .
  21. Radford, Alec; Wu, Jeffrey; Child, Rewon; et al. (14 de febrero de 2019). "Los modelos de lenguaje son aprendices multitarea no supervisados" (PDF) . cdn.openai.com . 1 (8). Archivado (PDF) del original el 6 de febrero de 2021. Recuperado el 19 de diciembre de 2020 . 
  22. Brown, Tom B.; Mann, Benjamin; Ryder, Nick; et al. (22 de julio de 2020). "Los modelos de lenguaje son aprendices con pocos ejemplos". arXiv : 2005.14165 [ cs.CL ]. 
  23. Ramesh, Aditya; Pavlov, Mikhail; Goh, Gabriel; et al. (24 de febrero de 2021). "Generación de texto a imagen sin datos previos". arXiv : 2102.12092 [ cs.LG ]. 
  24. 1 2 3 4 5 6 Ramesh, Aditya; Dhariwal, Prafulla; Nichol, Alex; Chu, Casey; Chen, Mark (12 de abril de 2022). "Generación jerárquica de imágenes condicionales al texto con latentes CLIP". arXiv : 2204.06125 [ cs.CV ].
  25. 1 2 3 4 Heaven, Will Douglas (5 de enero de 2021). "Este sillón de aguacate podría ser el futuro de la IA" . MIT Technology Review. Archivado del original el 5 de enero de 2021. Recuperado el 5 de enero de 2021 .
  26. Radford, Alec; Kim, Jong Wook; Hallacy, Chris; et al. (1 de julio de 2021). Aprendizaje de modelos visuales transferibles a partir de la supervisión del lenguaje natural . Actas de la 38.ª Conferencia Internacional sobre Aprendizaje Automático. PMLR. págs. 8748–8763 .  
  27. Shi, Zhan; Zhou, Xu; Qiu, Xipeng; Zhu, Xiaodan (2020). "Mejora de los subtítulos de imágenes con un mejor uso de los subtítulos". arXiv : 2006.11807 [ cs.CV ].
  28. Dunn, Thom (10 de febrero de 2021). "Esta red neuronal de IA transforma los subtítulos de texto en arte, como un Pikachu medusa" . BoingBoing . Archivado del original el 22 de febrero de 2021. Recuperado el 2 de marzo de 2021 .
  29. 1 2 Whitwam, Ryan (6 de enero de 2021). "'DALL-E' de OpenAI genera imágenes a partir de descripciones de texto" . ExtremeTech . Archivado del original el 28 de enero de 2021. Recuperado el 2 de marzo de 2021 .
  30. 1 2 Dent, Steve (6 de enero de 2021). "La aplicación DALL-E de OpenAI genera imágenes a partir de una simple descripción" . Engadget . Archivado del original el 27 de enero de 2021. Recuperado el 2 de marzo de 2021 .
  31. 1 2 Marcus, Gary; Davis, Ernest; Aaronson, Scott (2 de mayo de 2022). "Un análisis muy preliminar de DALL-E 2". arXiv : 2204.13807 [ cs.CV ].
  32. 1 2 Shead, Sam (8 de enero de 2021). "Por qué todo el mundo habla de un generador de imágenes lanzado por un laboratorio de IA respaldado por Elon Musk" . CNBC . Archivado del original el 16 de julio de 2022. Recuperado el 2 de marzo de 2021 .
  33. 1 2 Wakefield, Jane (6 de enero de 2021). "La IA dibuja un rábano bebé paseando a un perro con un tutú" . British Broadcasting Corporation . Archivado del original el 2 de marzo de 2021. Recuperado el 3 de marzo de 2021 .
  34. Markowitz, Dale (10 de enero de 2021). "Así funciona el mágico generador de imágenes DALL-E de OpenAI" . TheNextWeb . Archivado del original el 23 de febrero de 2021. Consultado el 2 de marzo de 2021 .
  35. "DALL·E: Creación de imágenes a partir de texto" . OpenAI . 5 de enero de 2021. Archivado del original el 27 de marzo de 2021. Consultado el 13 de agosto de 2022 .
  36. Edwards, Benj (20 de septiembre de 2023). "El nuevo generador de imágenes de IA de OpenAI supera los límites en detalle y fidelidad instantánea" . Ars Technica . Archivado del original el 21 de septiembre de 2023. Recuperado el 21 de septiembre de 2023 .
  37. Coldewey, Devin (6 de abril de 2022). "Nueva herramienta de OpenAI dibuja cualquier cosa, más grande y mejor que nunca" . TechCrunch . Archivado del original el 6 de mayo de 2023. Recuperado el 26 de noviembre de 2022 .
  38. "DALL·E: Presentación de Outpainting" . OpenAI . 31 de agosto de 2022. Archivado del original el 26 de noviembre de 2022. Consultado el 26 de noviembre de 2022 .
  39. Saharia, Chitwan; Chan, William; Saxena, Saurabh; et al. (23 de mayo de 2022). "Modelos de difusión fotorrealistas de texto a imagen con comprensión profunda del lenguaje". arXiv : 2205.11487 [ cs.CV ]. 
  40. Marcus, Gary (28 de mayo de 2022). "Caballo monta a astronauta" . El camino hacia una IA en la que podemos confiar . Archivado del original el 19 de junio de 2022. Recuperado el 18 de junio de 2022 .
  41. 1 2 Strickland, Eliza (14 de julio de 2022). "Los fallos de DALL-E 2 son lo más interesante de ello" . IEEE Spectrum . Archivado del original el 15 de julio de 2022. Recuperado el 16 de agosto de 2022 .
  42. 1 2 "DALL·E 2 Mitigaciones de preentrenamiento" . OpenAI . 28 de junio de 2022. Archivado del original el 19 de julio de 2022. Recuperado el 18 de julio de 2022 .
  43. James Vincent (29 de septiembre de 2022). "El generador de imágenes DALL-E de OpenAI está disponible para que cualquiera lo use de inmediato" . The Verge . Archivado del original el 29 de septiembre de 2022. Recuperado el 29 de septiembre de 2022 .
  44. OpenAI (3 de octubre de 2023). "Tarjeta del sistema DALL-E 3" (PDF) .
  45. Taylor, Josh (18 de junio de 2022). "De los bebés de Trump Nevermind a los deepfakes: DALL-E y la ética del arte de la IA" . The Guardian . Archivado del original el 6 de julio de 2022. Recuperado el 2 de agosto de 2022 .
  46. Knight, Will (13 de julio de 2022). "Cuando la IA crea arte, los humanos aportan la chispa creativa" . Wired . Archivado del original el 2 de agosto de 2022. Recuperado el 2 de agosto de 2022 .
  47. Rose, Janus (24 de junio de 2022). "DALL-E ahora genera rostros realistas de personas falsas" . Vice . Archivado del original el 30 de julio de 2022. Recuperado el 2 de agosto de 2022 .
  48. 1 2 OpenAI (19 de junio de 2022). "DALL·E 2 Preview – Riesgos y limitaciones" . GitHub . Archivado del original el 2 de agosto de 2022. Recuperado el 2 de agosto de 2022 .
  49. Lane, Laura (1 de julio de 2022). "DALL-E, hazme otro Picasso, por favor" . The New Yorker . Archivado del original el 2 de agosto de 2022. Recuperado el 2 de agosto de 2022 .
  50. Goldman, Sharon (26 de julio de 2022). "OpenAI: ¿Acabará DALL-E 2 con las carreras creativas?" . Archivado del original el 15 de agosto de 2022. Recuperado el 16 de agosto de 2022 .
  51. Blain, Loz (29 de julio de 2022). "DALL-E 2: Una herramienta onírica y una amenaza existencial para los artistas visuales" . Archivado del original el 17 de agosto de 2022. Recuperado el 16 de agosto de 2022 .
  52. «DALL·E 3» . openai.com . Consultado el 10 de abril de 2025 .
  53. centerforartlaw (21 de noviembre de 2022). "¿Artístico o artificial? Problemas de propiedad y derechos de autor en obras de arte generadas por IA - Centro de Derecho del Arte" . itsartlaw.org . Consultado el 10 de abril de 2025 .
  54. "La IA generativa tiene un problema de propiedad intelectual" . Harvard Business Review . 7 de abril de 2023. ISSN 0017-8012 . Consultado el 10 de abril de 2025 . 
  55. Biddle, Sam (10 de abril de 2024). "Microsoft presentó DALL-E de OpenAI como herramienta de campo de batalla para el ejército estadounidense" . The Intercept .
  56. Biddle, Sam (12 de enero de 2024). "OpenAI elimina discretamente la prohibición de usar ChatGPT para 'Military and Warfare'"" . The Intercept .
  57. Kasana, Mehreen (7 de enero de 2021). "Esta IA convierte texto en arte surrealista basado en sugerencias" . Entrada. Archivado del original el 29 de enero de 2021. Recuperado el 2 de marzo de 2021 .
  58. Ehrenkranz, Melanie (27 de enero de 2021). "Aquí está DALL-E: un algoritmo que aprendió a dibujar cualquier cosa que le pidas" . NBC News . Archivado del original el 20 de febrero de 2021. Consultado el 2 de marzo de 2021 .
  59. Stove, Emma (5 de febrero de 2021). "Circo de tardígrados y un árbol de la vida: las mejores imágenes científicas de enero" . Nature . Archivado del original el 8 de marzo de 2021. Recuperado el 2 de marzo de 2021 .
  60. Knight, Will (26 de enero de 2021). "Esta IA podría pasar del 'arte' a la conducción de un coche autónomo" . Wired . Archivado del original el 21 de febrero de 2021. Consultado el 2 de marzo de 2021 .
  61. Metz, Rachel (2 de febrero de 2021). "¿Un rábano con tutú paseando a un perro? Esta IA puede dibujarlo muy bien" . CNN. Archivado del original el 16 de julio de 2022. Recuperado el 2 de marzo de 2021 .
  62. Leswing, Kif (8 de octubre de 2022). "Por qué Silicon Valley está tan entusiasmado con los dibujos extraños hechos por inteligencia artificial" . CNBC . Archivado del original el 29 de julio de 2023. Recuperado el 1 de diciembre de 2022 .
  63. Etherington, Darrell (22 de julio de 2019). "Microsoft invierte mil millones de dólares en OpenAI en una nueva asociación plurianual" . TechCrunch . Archivado del original el 22 de julio de 2019. Consultado el 21 de septiembre de 2023 .
  64. "El primer inversor de capital riesgo de OpenAI opina sobre la IA generativa" Fortune . Archivado del original el 23 de octubre de 2023. Consultado el 21 de septiembre de 2023 .
  65. Metz, Cade; Weise, Karen (23 de enero de 2023). "Microsoft invertirá 10 mil millones de dólares en OpenAI, el creador de ChatGPT" . The New York Times . ISSN 0362-4331 . Archivado del original el 21 de septiembre de 2023. Consultado el 21 de septiembre de 2023 . 
  66. "El arte generado por IA provoca una reacción furiosa de la comunidad del anime en Japón" . Resto del mundo . 27 de octubre de 2022. Archivado del original el 31 de diciembre de 2022. Consultado el 3 de enero de 2023 .
  67. Roose, Kevin (2 de septiembre de 2022). "Una imagen generada por IA ganó un premio de arte. Los artistas no están contentos" . The New York Times . ISSN 0362-4331 . Archivado del original el 31 de mayo de 2023. Consultado el 3 de enero de 2023 . 
  68. Daws, Ryan (15 de diciembre de 2022). "Aumenta la reacción negativa contra ArtStation tras la respuesta a la protesta del arte con IA" . Noticias sobre IA . Archivado del original el 3 de enero de 2023. Recuperado el 3 de enero de 2023 .
  69. 1 2 Corden, Jez (8 de octubre de 2023). "La creación de imágenes de Bing Dall-E 3 fue genial durante unos días, pero ahora Microsoft, como era de esperar, la ha lobotomizado" . Windows Central . Archivado del original el 10 de octubre de 2023. Recuperado el 11 de octubre de 2023 .
  70. 1 2 Allan, Darren (9 de octubre de 2023). "Microsoft pone freno al Creador de imágenes de Bing AI, y los resultados no tienen mucho sentido" . TechRadar . Archivado del original el 10 de octubre de 2023. Recuperado el 11 de octubre de 2023 .
  71. Sahar Mor, Stripe (16 de abril de 2022). "Cómo DALL-E 2 podría resolver los principales desafíos de la visión artificial" . VentureBeat . Archivado del original el 24 de mayo de 2022. Consultado el 15 de junio de 2022 .
  72. "jina-ai/dalle-flow" . Jina AI. 17 de junio de 2022. Archivado del original el 17 de junio de 2022. Recuperado el 17 de junio de 2022 .
  73. Carson, Erin (14 de junio de 2022). "Todo lo que necesitas saber sobre Dall-E Mini, el creador de arte con IA que desafía la mente" . CNET . Archivado del original el 15 de junio de 2022. Consultado el 15 de junio de 2022 .
  74. Schroeder, Audra (9 de junio de 2022). "El programa de IA DALL-E mini genera imágenes verdaderamente perturbadoras" . Daily Dot . Archivado del original el 10 de junio de 2022. Recuperado el 15 de junio de 2022 .
  75. Diaz, Ana (15 de junio de 2022). "La gente está usando DALL-E mini para crear memes abominables, como un Pikachu pug" . Polygon . Archivado del original el 15 de junio de 2022. Recuperado el 15 de junio de 2022 .
  76. Stability-AI/stablediffusion , Stability AI, 7 de abril de 2025 , consultado el 8 de abril de 2025
  • Ramesh, Aditya; Pavlov, Mikhail; Goh, Gabriel; Gray, Scott; Voss, Chelsea; Radford, Alec; Chen, Mark; Sutskever, Ilya (26 de febrero de 2021). "Generación de texto a imagen sin datos previos". arXiv : 2102.12092 [ cs.CV ].El informe original sobre DALL-E.
  • Tarjeta del sistema DALL-E 3
  • Artículo DALL-E 3 de OpenAI
  • Sitio web de DALL-E 2
  • Sitio web de Craiyon