ComfyUI es un programa de código abierto basado en nodos que permite a los usuarios generar imágenes a partir de una serie de textos . Utiliza modelos de difusión gratuitos , como la Difusión Estable , como modelo base para sus capacidades de imagen, combinados con otras herramientas como ControlNet y la adaptación de rango bajo LCM , estando cada herramienta representada por un nodo en el programa.
Historia
ComfyUI se lanzó en GitHub en enero de 2023. Según comfyanonymous, el creador, un objetivo principal del proyecto era mejorar los diseños de software existentes en términos de la interfaz de usuario . [ 3 ] El creador había estado involucrado con Stability AI pero para el 3 de junio de 2024 esa participación había terminado y se había creado una organización llamada Comfy Org junto con los desarrolladores principales. [ 4 ] En julio de 2024, Nvidia anunció soporte para ComfyUI dentro de su software de modificación RTX Remix . [ 5 ] En agosto de 2024, se agregó soporte para el modelo de difusión Flux desarrollado por Black Forest Labs, y Comfy Org se unió a la Open Model Initiative creada por la Linux Foundation . [ 6 ] [ 7 ] A julio de 2026, el proyecto tiene 122k estrellas en GitHub. [ 8 ] ComfyUI es una de las interfaces de usuario más populares para Stable Diffusion, junto con Automatic1111 . [ 9 ]
Características
La característica principal de ComfyUI es que está basado en nodos. [ 10 ] [ 11 ] Cada nodo tiene una función como "Cargador de modelo" o "Codificación de texto CLIP". [ 12 ] Los nodos están conectados para formar un grafo de flujo de control llamado flujo de trabajo. [ 13 ] Cuando se pone en cola una solicitud, aparece un marco resaltado alrededor del nodo que se está ejecutando actualmente, comenzando desde "punto de control de carga" y terminando con la imagen final y su ubicación de guardado. [ 12 ] Los flujos de trabajo suelen constar de decenas de nodos, formando un grafo acíclico dirigido complejo . [ 13 ] Los tipos de nodos incluyen carga de un modelo, especificación de solicitudes, muestreadores, planificadores, decodificadores VAE , modelos de restauración y escalado facial, LoRA , incrustaciones y ControlNets. [ 14 ] [ 15 ]
Se admiten varios muestreadores, como Euler , Euler_a, dpmpp_2m_sde y dpmpp_3m_sde. [ 15 ] Los flujos de trabajo se pueden guardar en un archivo, lo que permite a los usuarios reutilizar los flujos de trabajo de los nodos y compartirlos con otros usuarios. [ 14 ] [ 16 ] [ 17 ] El formato de archivo para los flujos de trabajo es JSON y se puede incrustar en las imágenes generadas. [ 18 ] Los usuarios también han creado extensiones personalizadas para el sistema base que se exponen como nuevos nodos, [ 14 ] [ 19 ] como la extensión para AnimateDiff, que tiene como objetivo crear vídeos. [ 20 ] [ 21 ] ComfyUI se ha descrito como más complejo en comparación con otras interfaces de usuario de difusión como Automatic1111. [ 22 ] [ 23 ] También se incluye un grupo de nodos predeterminado con el programa. [ 12 ]
A diciembre de 2024, se admitían 1674 nodos. [ 24 ] ComfyUI admite múltiples modelos de texto a imagen, incluidos Stable Diffusion, Flux y Hunyuan-DiT de Tencent , así como modelos personalizados de Civitai como Pony . [ 24 ]
Compromiso de extensión de LLMVision
En junio de 2024, un grupo de hackers llamado "Nullbulge" comprometió una extensión de ComfyUI para agregarle código malicioso. [ 25 ] La extensión comprometida, llamada ComfyUI_LLMVISION, se usaba para integrar la interfaz con los modelos de lenguaje de IA GPT-4 y Claude 3 , y estaba alojada en GitHub . Nullbulge publicó en su sitio web una lista con los datos de inicio de sesión de cientos de usuarios de ComfyUI en múltiples servicios, mientras que los usuarios de la extensión informaron haber recibido numerosas notificaciones de inicio de sesión. vpnMentor realizó una investigación de seguridad sobre la extensión y afirmó que podía "robar billeteras de criptomonedas , tomar capturas de pantalla de la pantalla del usuario, exponer información del dispositivo y direcciones IP , y robar archivos que contuvieran ciertas palabras clave o extensiones".
El sitio web de Nullbulge afirma que se dirigieron a usuarios que cometieron "uno de nuestros pecados", que incluía la generación de arte mediante IA, el robo de arte, la promoción de criptomonedas y cualquier otro tipo de robo a artistas, como el de Patreon . Afirmaron ser "un colectivo de individuos que creen en la importancia de proteger los derechos de los artistas y garantizar una compensación justa por su trabajo" y que creían que "el arte generado por IA es perjudicial para la industria creativa y debería desalentarse". [ 25 ]
Referencias
- ↑ comfyanonymous. "Commit inicial" . github . Consultado el 10 de julio de 2024 .
- ↑ comfyanonymous. "LICENCIA" . github . Consultado el 10 de julio de 2024 .
- ↑ comfyanonymous (18 de mayo de 2023). "¡ComfyUI ya tiene 4 meses!" . Blog de ComfyUI . Consultado el 11 de julio de 2024 .
- ^ "ComfyUI 作者团队成立 Comfy Org- DoNews快讯" . Noticias.
- ↑ Harper, Christopher (4 de julio de 2024). "RTX Remix de Nvidia se vuelve de código abierto: el fabricante de chips agrega una API REST para interactuar con ComfyUI para la remasterización con IA o la generación de nuevos gráficos en tiempo real" . Tom's Hardware . Recuperado el 11 de julio de 2024 .
- ↑田口和裕 (7 de agosto de 2024). "画像生成AI「Difusión estable」の代替に? 話題の「FLUX.1」を試した (1/7)" . ASCII.jp (en japonés).
- ↑ Wheatley, Mike (12 de agosto de 2024). "La última iniciativa de la Fundación Linux tiene como objetivo promover modelos de IA de código abierto 'irrevocables'" . SiliconANGLE .
- ↑ comfyanonymous. "ComfyUI" . github . Consultado el 10 de julio de 2024 .
- ↑ Hu, Qihan; Xu, Zhenghui; Du, Peng; Zeng, Hao; Ma, Tongqing; Zhao, Youbing; Xie, Hao; Zhang, Peng; Liu, Shuting; Zang, Tongnian; Wang, Xuemei (2024). "CanFuUI: Una interfaz de usuario web centrada en lienzo para la generación iterativa de imágenes con modelos de difusión y ControlNet" . Contenido generado por IA . Communications in Computer and Information Science. Vol. 1946. Springer Nature Singapore. pp. 128–138 . doi : 10.1007/978-981-99-7587-7_11 . ISBN 978-981-99-7586-0Actualmente ,
las interfaces de usuario más populares para Stable Diffusion son Stable Diffusion WebUI y ComfyUI.
- ↑ Zhu, Andrew (2024). Uso de la difusión estable con Python: Aproveche Python para controlar y automatizar la generación de imágenes de IA de alta calidad mediante la difusión estable . Packt Publishing. ISBN 978-1835084311
ComfyUI es una interfaz de usuario basada en nodos que utiliza Stable Diffusion. Permite a los usuarios crear flujos de trabajo personalizados, incluyendo el posprocesamiento y la conversión de imágenes. Se trata de una interfaz gráfica de usuario potente y adaptable para Stable Diffusion, caracterizada por su diseño basado en nodos
. - ↑故渊 (25 de noviembre de 2023). "7 年老显卡 GTX 1080 能跑,图片生成视频模型 Difusión de video estable 更新 - IT之家" . ithome .
- 1 2 3田口, 和裕. "画像生成AI「Difusión estable」使い倒すならコレ! 「ComfyUI」基本の使い方 (1/3)" . ascii.jp (en japonés).
- 1 2 Xue, Xiangyuan; Lu, Zeyu; Huang, Di; Ouyang, Wanli; Bai, Lei (2 de septiembre de 2024). "GenAgent: Construya sistemas de IA colaborativos con generación automatizada de flujos de trabajo: estudios de caso en ComfyUI". arXiv : 2409.01392 [ cs.CL ].
- 1 2 3 Gal, Rinon; Haviv, Adi; Alaluf, Yuval; Bermano, Amit H.; Cohen-Or, Daniel; Chechik, Gal (2024). "ComfyGen: Flujos de trabajo adaptativos a las indicaciones para la generación de texto a imagen". arXiv : 2410.01731 [ cs.CL ].
- 1 2 Zeman, Benjamin (4 de diciembre de 2024). "Cómo crear flujos de trabajo básicos en ComfyUI" . XDA .
- ↑白鲸出海 (23 de mayo de 2024). "一家成都游戏公司,做出了一款千万月访问量的AI图像产品-36氪" . 36°(en chino).
- ↑田口, 和裕 (27 de marzo de 2024). "Macで始める画像生成AI 「Difusión estable」ComfyUIの使い方 (3/5)" . ascii.jp (en japonés).
- ↑しらいはかせ (18 de diciembre de 2023). "画像生成AIを使い倒す!「Matriz de estabilidad」で使えるWebUIを紹介【生成AIストリーム】" . Reloj Impress (en japonés).
- ↑机器之心 (16 de noviembre de 2023). "当韩国女团BLACKPINK进军二次元,清华叉院AI神器原来还能这么玩-36氪" . 36°(en chino).
- ↑新, 清士. "アニメの常識、画像生成AIが変える可能性「AnimateDiff」のすごい進化" . ascii.jp (en japonés).
- ^ Guo, Yuwei; Yang, Ceyuan; Rao, Anyi; Liang, Zhengyang; Wang, Yaohui; Qiao, Yu; Agrawala, Maneesh; Lin, Dahua; Dai, Bo (mayo de 2024). "AnimateDiff: anime sus modelos personalizados de difusión de texto a imagen sin ajustes específicos" . Conferencia Internacional sobre Representaciones del Aprendizaje . arXiv : 2307.04725 .
- ↑ Phoenix, James; Taylor, Mike (2024). «Interfaz de usuario web AUTOMATIC1111». Ingeniería de avisos para IA generativa: entradas a prueba de futuro para salidas de IA fiables a escala (Primera ed.). Pekín Boston: O'Reilly. ISBN 978-1098153434Los usuarios avanzados también
pueden explorar ComfyUI, ya que admite flujos de trabajo más avanzados y una mayor flexibilidad (incluida la conversión de imagen a vídeo), pero consideramos que es demasiado complejo para la mayoría de los casos de uso, que pueden ser gestionados fácilmente por AUTOMATIC1111.
- ↑ Pérez-Colado, Iván J.; Freire-Morán, Manuel; Calvo-Morata, Antonio; Pérez-Colado, Víctor M.; Fernández-Manjón, Baltasar (8 de mayo de 2024). "AI Asyet Otra herramienta en proyectos de estudiantes de pregrado: resultados preliminares". Conferencia Global de Educación en Ingeniería de IEEE 2024 (EDUCON) . págs. 1– 7. doi : 10.1109/EDUCON60312.2024.10578883 . ISBN 979-8-3503-9402-3.
- 1 2 Zeman, Benjamin (6 de diciembre de 2024). "Firefly de Adobe Photoshop frente a ComfyUI y Stable Diffusion" . XDA .
- 1 2 Maiberg, Emanuel (2024-06-11). "Los hackers atacan a usuarios de IA con una herramienta de difusión estable maliciosa en GitHub para protestar por el 'robo de arte'"" . 404 Media . Consultado el 14-06-2024 .
- Software libre programado en Python
- Inteligencia artificial de código abierto
- Software que utiliza la Licencia Pública General de GNU.