Articulo de referencia

Modelo mundial (inteligencia artificial)

En inteligencia artificial, un modelo del mundo es un sistema de aprendizaje automático que construye una representación interna de un entorno. A menudo, esto se logra mediante ...

En inteligencia artificial, un modelo del mundo es un sistema de aprendizaje automático que construye una representación interna de un entorno. A menudo, esto se logra mediante la comprensión de objetos en un video, algo que los modelos predictivos de aprendizaje automático no pueden hacer. El modelo predice cómo cambia ese entorno con el tiempo en respuesta a las acciones. Los investigadores diseñan modelos del mundo para ayudar a los agentes a planificar, razonar y actuar sin la constante experimentación del mundo real. Los modelos del mundo se diferencian de los sistemas que simplemente clasifican o generan resultados. Simulan dinámicas como la física, las interacciones entre objetos y la causalidad. Las primeras ideas datan de la década de 1990. Las versiones modernas impulsan la robótica, la conducción autónoma y la generación de video interactivo.

Historia

Jürgen Schmidhuber introdujo el término modelo del mundo en el aprendizaje automático en 1990. [ 1 ] Propuso redes neuronales recurrentes que predicen estados futuros a partir de observaciones y utilizan esas predicciones para entrenar agentes. David Ha y Schmidhuber retomaron el concepto en un artículo de 2018. Sus agentes aprendieron a conducir coches virtuales y jugar videojuegos dentro de simulaciones autogeneradas. [ 2 ]

Yann LeCun impulsó la idea en un documento de posición de 2022 titulado "Un camino hacia la inteligencia artificial autónoma". [ 3 ] Argumentó que la inteligencia requiere modelos predictivos del mundo en lugar de la mera coincidencia de patrones. LeCun propuso la arquitectura predictiva de incrustación conjunta (JEPA) como una base práctica. LeCun y sus colaboradores desarrollaron varias variantes de JEPA. V-JEPA 2 alcanzó un rendimiento de vanguardia en comprensión de vídeo y razonamiento físico en ese momento. [ 4 ] Admite el control de robots sin entrenamiento previo en entornos desconocidos. [ 4 ] Introducido en marzo de 2026, LeWorldModel se entrena de forma estable de extremo a extremo a partir de píxeles sin procesar y utiliza dos términos de pérdida y evita heurísticas diseñadas manualmente. [ 5 ] LeCun fundó Advanced Machine Intelligence Labs en 2026 para seguir desarrollando modelos del mundo. [ 6 ] [ 7 ]

Google DeepMind presentó Genie en 2024. Este modelo aprendía entornos interactivos a partir de vídeos de internet sin etiquetar. Genie 2 llegó a finales de 2024 e incorporó la generación tridimensional. La serie Genie estableció nuevos estándares para la simulación de propósito general.

Genie 3 se presentó en agosto de 2025. Produce mundos interactivos fotorrealistas en tiempo real a partir de indicaciones de texto que se muestran a 24 fotogramas por segundo y se exploran en tiempo real con indicaciones de texto o imágenes. El modelo admite mundos tridimensionales persistentes e interacción en tiempo real. [ 8 ] Waymo adoptó Genie 3 en febrero de 2026 y lo utilizó para crear un modelo de mundo especializado para la simulación de conducción autónoma, llamado Waymo World Model . Produce salidas de cámara y lidar sincronizadas y crea casos límite que los robotaxis reales rara vez encuentran. PCMag informó que los casos límite eran inusuales . [ 9 ]

General Intuition anunció una ronda de financiación inicial de 133,7 millones de dólares. [ 10 ] World Labs recaudó 1.000 millones de dólares. AMI recaudó 1.030 millones de dólares. [ 11 ]

En abril de 2026, Alibaba anunció Happy Oyster, su modelo de mundo diseñado para un entorno en tiempo real y fluido. Incluye un modo de dirección para la construcción de mundos basado en indicaciones de texto e imágenes, y un modo de exploración libre para descubrir el mundo resultante. Puede generar videoclips de 3 minutos dentro del mundo virtual. [ 12 ]

También en abril, World Labs, cofundada por Li Fei Fei , presentó Spark 2.0, un motor de renderizado 3D de dispersión gaussiana de código abierto dirigido a dispositivos de la clase de los teléfonos inteligentes. [ 12 ]

En junio de 2026, Nvidia lanzó Cosmos 3, una familia de modelos de peso abierto. Combina razonamiento físico, simulación del mundo y generación de acciones, previamente independientes. Cosmos 3 integra y puede procesar y generar texto, imágenes, video, audio y secuencias de acciones. El modelo emplea un enfoque de "Mezcla de Transformadores" (MoT). Un transformador autorregresivo (AR) maneja el razonamiento y la predicción del siguiente token, mientras que un transformador de difusión (DT) realiza la generación multimodal. Los codificadores ( ViT para visión, VAE para visual/audio y específicos del dominio para acciones) generan un espacio de representación compartido utilizando incrustación de posición rotatoria multidimensional 3D (mRoPE) para información espacial y temporal. La familia incluye Cosmos3-Nano (16 mil millones de parámetros) para estaciones de trabajo; Cosmos3-Super (64 mil millones de parámetros) para investigación. [ 13 ]

Arquitectura

Los modelos del mundo procesan datos sensoriales brutos, como fotogramas de vídeo o escaneos lidar. Comprimen esta información en representaciones latentes compactas. El sistema predice entonces representaciones futuras en lugar de realizar reconstrucciones píxel a píxel.

Muchos modelos del mundo moderno utilizan la arquitectura predictiva de incrustación conjunta (JEPA). Un codificador convierte las observaciones en incrustaciones . Un predictor estima una o varias incrustaciones a partir de la actual y una acción. En algunos casos, un crítico elige una incrustación como el mejor resultado. Un regularizador mantiene las incrustaciones con un comportamiento adecuado. [ 4 ]

El modelo se entrena minimizando el error de predicción en el espacio de incrustación. Este enfoque evita el alto costo de generar cada detalle. Algunas arquitecturas incorporan componentes explícitos. Una ruta reactiva rápida gestiona las respuestas inmediatas. Una ruta deliberativa más lenta realiza una planificación a largo plazo. La precisión de la predicción de vídeo o las tasas de éxito del robot son métricas clave, pero no siempre predicen el rendimiento en el mundo real.

Los modelos generativos de mundos, como Genie 3, combinan estas funciones con un simulador . Aceptan indicaciones de texto o diseños y generan escenas consistentes en vídeo, LiDAR o tres dimensiones. Estos modelos suelen entrenarse mediante aprendizaje autosupervisado, utilizando grandes conjuntos de datos sin etiquetar de interacciones de vídeo o robots. El aprendizaje autosupervisado puede acelerar el aprendizaje, mientras que el aprendizaje por refuerzo permite ajustar un modelo para tareas específicas.

Aplicaciones

Los modelos del mundo real apoyan el aprendizaje robótico. Los agentes se entrenan dentro de simulaciones y transfieren habilidades al mundo físico. Esto reduce la necesidad de pruebas peligrosas o costosas en el mundo real. Los vehículos autónomos utilizan modelos del mundo real para probar eventos poco comunes. [ 14 ] El sistema de Waymo simula tornados o comportamientos peatonales inusuales. Las empresas capacitan a planificadores sin poner vehículos en vías públicas. El entretenimiento interactivo se beneficia de los modelos del mundo real. Genie 3 permite a los usuarios generar entornos jugables a partir de descripciones simples. Los estudios de juegos prototipan niveles más rápido. La simulación científica se beneficia de estos modelos. Los investigadores modelan sistemas físicos o procesos biológicos a escala. Los planificadores en logística o diseño urbano prueban estrategias dentro de gemelos digitales precisos.

Comparación con modelos de lenguaje de gran tamaño

Tanto los modelos del mundo como los grandes modelos de lenguaje (LLM, por sus siglas en inglés) utilizan la inferencia sobre sus entradas para hacer predicciones.

Los modelos de lenguaje natural (LLM) procesan textos. Predicen el siguiente token en secuencias de texto. Destacan en tareas lingüísticas como la traducción o el resumen. Sin embargo, carecen de conocimientos de física.

Los modelos del mundo funcionan con datos de sensores, como píxeles. Predicen cambios de estado en esos datos en el espacio latente. Este diseño facilita la planificación y el razonamiento causal .

Los LLM generan texto fluido, pero a menudo fallan en predicciones físicas consistentes. Su arquitectura emplea transformadores con refinamientos como la mezcla de expertos .

Los modelos del mundo dividen la tarea de inferencia en el trabajo realizado por codificadores, predictores, simuladores y otros componentes. Por lo general, procesan entradas multimodales como vídeo, lidar, radar y audio, guiados por indicaciones textuales.

Los LLM impulsan los chatbots y los asistentes de código. Los modelos del mundo impulsan agentes encarnados que actúan en entornos dinámicos, como la conducción autónoma. Ambos pueden combinarse en sistemas híbridos. Por ejemplo, un LLM gestiona las instrucciones, mientras que un modelo del mundo administra el control de bajo nivel. Los defensores de los modelos del mundo, como LeCun, afirman que, dado que los LLM se entrenan solo con texto, no tienen la capacidad de predecir nada más allá del texto, como eventos del mundo real. [ 3 ] [ 15 ]

Puntos de referencia

Las pruebas de referencia del modelo mundial ponen a prueba la comprensión física, la coherencia a largo plazo, la planificación y la generalización a partir de datos de sensores.

Meta introdujo tres puntos de referencia para V-JEPA 2. [ 16 ]

  • IntPhys 2 mide la capacidad de un modelo para detectar violaciones de las leyes de la física. Presenta pares de vídeos que divergen cuando uno de ellos infringe las reglas físicas. Los humanos obtienen una precisión cercana al 100 %. V-JEPA 2 apenas logra resultados mejores que el azar en muchas condiciones. [ 17 ]
  • El método Minimal Video Pairs (MVPBench) evalúa la comprensión física mediante preguntas de opción múltiple basadas en videoclips cortos. Explora las interacciones entre objetos y la causalidad. [ 18 ]
  • Pruebas de reconocimiento de acciones Something-Something. [ 19 ]
  • Epic Kitchens-100 pone a prueba la capacidad de anticipación de las acciones humanas.

Prueba de rendimiento de DeepMind:

  • La evaluación interactiva mide la consistencia a lo largo de minutos de interacción, la memoria de objetos fuera de la pantalla y la respuesta a las acciones del usuario o las indicaciones de texto. [ 20 ]

Prueba comparativa de Waymo:

  • Calidad de la generación de resultados: Las métricas incluyen realismo, controlabilidad (mediante indicaciones de texto) y utilidad para entrenar planificadores en mundos simulados. Sin embargo, la tasa de error de reconstrucción de píxeles con recompensas episódicas suele ser deficiente.

Otro:

  • Epic-Kitchens-100 (a menudo medido con Recall@5) [ 21 ]
  • Ego4D
  • 50 ensaladas, desayunos, etc.

Posibles puntos de referencia:

  • Transferencia de cero disparos a robots
  • Planificación a largo plazo
  • Tasa de predicción inverosímil

Véase también

Referencias

  1. "1990: Planificación y aprendizaje por refuerzo con modelos de mundo recurrentes y curiosidad artificial" . people.idsia.ch . Archivado del original el 8 de marzo de 2026. Consultado el 25 de marzo de 2026 .
  2. Ha, David; Schmidhuber, Jürgen (2018). "Los modelos de mundo recurrentes facilitan la evolución de las políticas" . Advances in Neural Information Processing Systems 31 (NeurIPS 2018) . Curran Associates. pp. 2451–2463 . arXiv : 1809.01999 . 
  3. 1 2 LeCun, Yann (27 de junio de 2022). "Un camino hacia la inteligencia de máquinas autónomas Versión 0.9.2" (PDF) .
  4. 1 2 3 "Presentación del modelo mundial V-JEPA 2 y nuevos puntos de referencia para el razonamiento físico" . Meta AI. 11 de junio de 2025. Recuperado el 25 de marzo de 2026 .
  5. Maes, Lucas; Lidec, Quentin Le; Scieur, Damien; LeCun, Yann; Balestriero, Randall (2026-03-13). "LeWorldModel: Arquitectura predictiva estable de incrustación conjunta de extremo a extremo a partir de píxeles". arXiv : 2603.19312 [ cs.LG ].
  6. Metz, Cade (10 de marzo de 2026). "La empresa emergente del exdirector de Meta AI está valorada en 3.500 millones de dólares" . The New York Times vía NYTimes.com.
  7. Orru, Mauro (10 de marzo de 2026). "El ex pionero de Meta AI, Yann LeCun, recauda más de mil millones de dólares para una nueva empresa emergente" . The Wall Street Journal .
  8. Whitwam, Ryan (05-08-2025). "DeepMind revela el "modelo del mundo" de Genie 3 que crea simulaciones interactivas en tiempo real" . Ars Technica .
  9. Martindale, Jon (6 de febrero de 2026). "Waymo está utilizando la IA Genie 3 de Google para practicar el manejo de tornados y elefantes" . PCMag . Consultado el 6 de abril de 2026 .
  10. Bellan, Rebecca (16 de octubre de 2025). "General Intuition consigue una financiación inicial de 134 millones de dólares para enseñar a los agentes razonamiento espacial mediante fragmentos de videojuegos" . TechCrunch . Consultado el 30 de junio de 2026 .
  11. McCormick, Packy. "Modelos mundiales: Computando lo incalculable" . www.notboring.co . Consultado el 9 de abril de 2026 .
  12. 1 2 "Los gigantes tecnológicos chinos y la 'madrina' de la IA, Li Fei-Fei, se lanzan a la carrera por convertirse en modelos mundiales" . South China Morning Post . 16 de abril de 2026. Consultado el 18 de abril de 2026 .
  13. "Bienvenido NVIDIA Cosmos 3: El primer modelo omni abierto para el razonamiento y la acción de la IA física" . huggingface.co . 1 de junio de 2026. Consultado el 1 de junio de 2026 .
  14. Yin, Tenny; Mei, Zhiting; Zheng, Zhonghe; Yamane, Miyu; Wang, David; Sceats, Jade; Bateman, Samuel M.; Zha, Lihan; Badithela, Apurva; Shorinwa, Ola; Majumdar, Anirudha. "PlayWorld: Aprendizaje de modelos del mundo robótico a partir del juego autónomo" . arxiv.org . Consultado el 25 de marzo de 2026 .
  15. Weldon, Marcus (2 de abril de 2025). "Yann LeCun, el 'padrino' de la IA: Los másteres en Derecho están llegando a su fin, pero se avecina una IA mejor" . Newsweek . Consultado el 30 de junio de 2026 .
  16. "Presentación del modelo mundial V-JEPA 2 y nuevos puntos de referencia para el razonamiento físico" . Meta AI. 11 de junio de 2025. Consultado el 26 de marzo de 2026 .
  17. Bordes, Florian; Garrido, Quentin; Kao, Justine T.; Williams, Adina; Rabbat, Michael; Dupoux, Emmanuel (2025), IntPhys 2: Benchmarking Intuitive Physics Understanding in Complex Synthetic Environments , arXiv : 2506.09849
  18. Krojer, Ben (2025). "Un punto de referencia de preguntas y respuestas sobre vídeo consciente de los atajos para la comprensión física mediante pares de vídeo mínimos". arXiv : 2506.09987 [ cs.CV ].
  19. Goyal, Raghav (2017). "La base de datos de vídeo "algo algo" para aprender y evaluar el sentido común visual". Actas de la Conferencia Internacional IEEE sobre Visión por Computadora (ICCV) . arXiv : 1706.04261 .
  20. "Genie 3: Una nueva frontera para los modelos del mundo" . Google DeepMind. 5 de agosto de 2025. Consultado el 26 de marzo de 2026 .
  21. "Conjunto de datos EPIC-KITCHENS-100" . Consultado el 26 de marzo de 2026 .
  • Carmack, John (31 de marzo de 2026). "Revisión de artículo: LeWorldModel: Arquitectura predictiva estable de incrustación conjunta de extremo a extremo a partir de píxeles" . X. Recuperado el 1 de abril de 2026 .