Articulo de referencia

Modelo visión-lenguaje-acción

Arquitectura general de un modelo de visión-lenguaje-acción. El modelo recibe como entrada una instrucción de texto y una observación de imagen, codificadas en una representació...

Arquitectura general de un modelo de visión-lenguaje-acción. El modelo recibe como entrada una instrucción de texto y una observación de imagen, codificadas en una representación latente. El decodificador de acciones recibe esta representación y genera una secuencia de acciones robóticas de bajo nivel.

En el aprendizaje robótico , un modelo de visión-lenguaje-acción ( VLA ) es una clase de modelos fundamentales multimodales que integra visión , lenguaje y acciones. A partir de una imagen (o vídeo) del entorno del robot y una instrucción de texto, un VLA genera directamente acciones de bajo nivel que el robot puede ejecutar para completar la tarea solicitada. [ 1 ]

Los VLA generalmente se construyen ajustando un modelo de lenguaje-visión (VLM) (es decir, un modelo de lenguaje grande extendido con capacidades de visión ) en un conjunto de datos a gran escala que combina la observación visual y las instrucciones de lenguaje con las trayectorias del robot. [ 2 ] Estos modelos combinan un codificador de lenguaje-visión ( transformador de visión ), que traduce una observación de imagen y una descripción en lenguaje natural en una distribución dentro de un espacio latente , con un decodificador de acciones que transforma esta representación en acciones de salida continuas, directamente ejecutables en el robot. [ 3 ]

El concepto fue desarrollado por primera vez en julio de 2023 por Google DeepMind con RT -2, un VLM adaptado para tareas de manipulación de extremo a extremo, capaz de unificar percepción , razonamiento y control . [ 4 ]

Panorama general de la arquitectura

Las VLA comparten una arquitectura común de alto nivel articulada en dos etapas:

  • En la primera etapa, un VLM preentrenado sirve como núcleo de percepción y razonamiento. Codifica una o más imágenes de cámara junto con una instrucción lingüística en una secuencia de tokens de lenguaje en un espacio latente compartido. Los VLM se entrenan específicamente con grandes conjuntos de datos multimodales y pueden realizar diversas tareas, como comprensión de imágenes , respuesta a preguntas visuales y razonamiento . Para controlar directamente a los robots, los VLM deben ampliarse para generar acciones robóticas. [ 5 ]
  • En la segunda etapa, un decodificador de acciones asigna esos tokens a símbolos discretos que luego se destokenizan en comandos continuos del robot. Estas acciones de salida se representan de la misma manera que los tokens del lenguaje, pero se refieren específicamente al número de grados de libertad (DoF) del efector final del robot . Considerando un efector final de 6 DoF, el espacio de acciones generalmente incluye desplazamientos del efector final (posicionales y rotacionales) y posiciones de la pinza. Por ejemplo, en RT-2, cada vector de acción cubre 6 DoF además del estado de la pinza y un indicador de terminación, todo cuantificado en 256 bins. [ 2 ]

Los VLA suelen basarse en VLM comerciales, lo que proporciona al robot una comprensión previa de imágenes y texto. Durante el proceso de entrenamiento, el modelo se ajusta con datos en forma de (instrucciones de texto, observaciones visuales, trayectorias de acción), aprendiendo así a mapear observaciones visuales e instrucciones de texto a acciones del robot. El conjunto de datos de entrenamiento consiste en demostraciones del robot que pueden obtenerse de robots reales, teleoperación humana o incluso generarse sintéticamente en un entorno de simulación. Gracias al aprendizaje de extremo a extremo, los VLA aprenden inherentemente a asociar conceptos de alto nivel (por ejemplo, categorías de objetos y relaciones espaciales) con acciones de bajo nivel, eliminando la partición típica de los sistemas robóticos tradicionales. [ 2 ] [ 6 ]

Representación de la acción

Una decisión de diseño crucial para la arquitectura de un robot virtual automatizado (VLA) es el formato en el que se codifican las acciones del robot.

La "Salida de Tokens Discretos" es el enfoque más común, utilizado por VLA como RT-2 y OpenVLA, y representa cada primitiva de movimiento como una secuencia de tokens discretos. De esta manera, el modelo codifica las acciones del robot como una cadena de acciones, y el modelo VLA aprende a generar estas secuencias del mismo modo que un modelo de lenguaje genera texto. Este enfoque basado en tokens mantiene la misma capa de salida y simplifica el entrenamiento. Sin embargo, la conversión de trayectorias continuas en símbolos de vocabulario puede limitar la precisión espacial o la resolución temporal. RT-2 demuestra que esto se puede mitigar utilizando tokens especiales que, por ejemplo, marcan el final de un segmento de acción. [ 2 ] [ 7 ]

La «salida continua» (difusión/flujo) es un enfoque alternativo utilizado por robots virtuales como π 0 que, para lograr una destreza precisa y un control de alta frecuencia, prescinden de tokens discretos y generan directamente acciones continuas. Esto se consigue mediante el uso de modelos de difusión o redes de coincidencia de flujo que actúan como decodificador de acciones. π 0 aprovechó esta estrategia para generar trayectorias articulares continuas de hasta 50 Hz . En la práctica, la salida continua tiende a ser más escalable para robots con muchos grados de libertad, donde la discretización para cada grado de libertad sería impracticable. [ 8 ]

Diseño de modelo único frente a diseño de sistema dual

Comparación entre arquitecturas de sistema único y dual en un modelo de visión-lenguaje-acción. La arquitectura de sistema único (arriba) es una arquitectura integral que combina un modelo de visión-lenguaje-acción (VLM) preentrenado con un decodificador de acciones. Este modelo procesa texto, imágenes, el estado del robot y las acciones de salida. La arquitectura de sistema dual (abajo) es una arquitectura modular en la que el VLM preentrenado y el decodificador de acciones son dos subsistemas independientes. Se comunican a través de un espacio latente compartido. Cabe destacar que cada sistema puede ejecutarse de forma independiente, incluso en diferentes GPU.

Los VLA pueden organizarse como una única red de extremo a extremo o como un sistema dual que emplea dos modelos acoplados.

El diseño de modelo único, empleado por RT-2, OpenVLA y π 0 , comprende simultáneamente la escena y la instrucción de lenguaje para producir acciones del robot en una sola pasada hacia adelante, manteniendo la arquitectura simple y reduciendo la latencia . [ 2 ] [ 7 ] [ 8 ]

El diseño de sistema dual, adoptado por Helix y Groot N1, divide la arquitectura en dos componentes. El primer componente suele ser más lento y se encarga de la observación de imágenes y las instrucciones de texto recibidas como entrada. El segundo componente funciona a mayor velocidad y genera las acciones del robot. Ambos componentes se entrenan de extremo a extremo para comunicarse. Esta división mejora la destreza y reduce la latencia a costa de una mayor complejidad computacional. [ 9 ] [ 10 ]

Historia

2023

Robot Transformer 2 (RT-2)

El Robotic Transformer 2 (RT-2) fue desarrollado por Google DeepMind a mediados de 2023 y estableció el paradigma del modelo visión-lenguaje-acción en robótica. Se basa en dos VLM de última generación, PaLI-X [ 11 ] y PaLM-E [ 12 ] , respectivamente , ajustándolos con datos reales de demostración de robots. RT-2 toma como entrada imágenes de cámara junto con una descripción de texto y genera acciones de robot discretizadas codificadas como tokens discretos. En comparación con su predecesor RT-1 [ 13 ] , que fue entrenado solo con datos robóticos, RT-2 muestra una mayor capacidad de generalización para nuevas tareas, siendo también capaz de realizar razonamientos de múltiples pasos utilizando cadenas de pensamiento [ 4 ] .

2024

OpenVLA

Arquitectura del modelo OpenVLA. Partiendo de la observación de una imagen y una descripción en lenguaje natural de una tarea, el sistema genera acciones robóticas en 7D. [ 7 ]

OpenVLA es un modelo VLA de código abierto con 7 mil millones de parámetros, presentado en junio de 2024 por investigadores de Stanford . Fue entrenado con el conjunto de datos Open X-Embodiment, una colaboración entre 21 instituciones que recopiló más de un millón de episodios de 22 encarnaciones diferentes. El modelo fusiona características de imagen mediante DINOv2 [ 14 ] y CLIP , con una arquitectura de lenguaje Llama-2 , y genera tokens de acciones discretas. A pesar de su menor tamaño en comparación con RT-2 de Google DeepMind, OpenVLA supera a RT-2 en un conjunto de tareas de manipulación. También admite métodos de ajuste fino eficientes en parámetros y cuantización para implementaciones con recursos limitados. [ 7 ] [ 15 ] [ 16 ]

Octo (Política generalista abierta)

Octo es una política robótica generalista de código abierto y ligera desarrollada por la UC Berkeley . Entrenada originalmente en Open X-Embodiment, se lanzó en configuraciones más pequeñas (27M y 93M parámetros). Octo codifica instrucciones de texto y observaciones de imágenes, respectivamente, con un modelo de lenguaje y una red neuronal convolucional ligera . Además, en lugar de un decodificador autorregresivo, Octo utiliza una política de difusión que genera trayectorias articulares continuas, lo que permite un movimiento más suave y una rápida adaptación a la tarea. Durante el ajuste fino, la estructura de atención por bloques de la arquitectura empleada por Octo permite añadir nuevas observaciones sin modificar los parámetros. [ 17 ]

TinyVLA

TinyVLA es un VLA compacto diseñado para una inferencia rápida y un entrenamiento eficiente. TinyVLA aborda los requisitos computacionales y la gran dependencia de conjuntos de datos extensos de sus predecesores inicializando la política con una estructura multimodal más pequeña y luego ajustándola con precisión en datos de robótica. Este trabajo demostró el potencial de VLA más eficientes, centrándose en la arquitectura y la curación de datos sin el costo computacional de modelos muy grandes. [ 18 ]

π 0 (pi-cero)

π 0 (pi-zero) es un VLA generalista a gran escala, anunciado a finales de 2024 por la startup Physical Intelligence. [ 8 ] π 0 incorpora Paligemma [ 19 ] como una estructura VLM preentrenada, construida a partir de codificadores SigLIP [ 20 ] y Gemma [ 21 ] , con un experto en acciones entrenado en trayectorias de robots de Open X-Embodiment. Entrenado en trayectorias de robots de 8 encarnaciones diferentes, es capaz de generalizar entre encarnaciones, controlar diferentes brazos robóticos (de un solo brazo, de doble brazo) y abordar una amplia variedad de tareas. π 0 también introdujo un modelo de coincidencia de flujo para generar acciones continuas de alta frecuencia, hasta 50 Hz, mientras que el cabezal de acción aprovecha una política de difusión. [ 22 ] [ 23 ] π 0 -FAST, una extensión de π 0 , aprovecha la tokenización de secuencias de acciones en el espacio de frecuencia (FAST), [ 24 ] un nuevo enfoque de compresión de series temporales que transforma tokens continuos del dominio del tiempo al dominio de la frecuencia utilizando la transformada discreta del coseno .

2025

Hélice

Helix, presentado en febrero de 2025 por Figure AI , es un VLA generalista diseñado específicamente para robots humanoides. Es el primer VLA capaz de controlar a alta frecuencia la parte superior del cuerpo de un humanoide (brazos, manos, torso, cabeza y dedos). Utiliza una arquitectura de sistema dual, con dos sistemas complementarios entrenados para comunicarse de extremo a extremo. El Sistema 2 (S2) es un VLM a escala de internet especializado en la comprensión de escenas y lenguaje, mientras que el Sistema 1 (S1) es una política visuomotora que traduce las representaciones latentes producidas por S2 en acciones continuas del robot. Esta arquitectura desacoplada permite lograr tanto una amplia generalización como un control rápido de bajo nivel. Helix se entrenó con aproximadamente 500 horas de teleoperación robótica combinadas con descripciones de texto generadas automáticamente. El modelo Helix puso de manifiesto la capacidad de los VLA para adaptarse a representaciones complejas como los humanoides. [ 9 ]

GR00T N1

GR00T N1, lanzado por NVIDIA en marzo de 2025, es un VLA para robots humanoides que adopta la misma arquitectura de sistema dual empleada por Helix. Está compuesto por un Sistema 2, un VLM responsable de la percepción del entorno, y un Sistema 1, que genera la acción motora. A diferencia de otros VLA, incluye una mezcla heterogénea de datos que comprende trayectorias de robots, vídeos de humanos y conjuntos de datos sintéticos. [ 10 ]

Géminis Robotics

Gemini Robotics , presentado en 2025 por Google DeepMind , es un VLA que se basa en las capacidades de Gemini 2.0. Si bien Gemini es inherentemente capaz de procesar datos multimodales como texto, imágenes, videos y audio, Gemini Robotics extiende estas capacidades al mundo físico, permitiendo que los robots realicen acciones. Las capacidades de razonamiento de la arquitectura VLM de Gemini 2.0, junto con las acciones robóticas de bajo nivel aprendidas, permiten que el robot realice tareas de gran destreza, como doblar origami y jugar a las cartas. El modelo exhibe un alto grado de generalización y es capaz de adaptarse a plataformas completamente nuevas. En junio de 2025, los autores lanzaron Gemini Robotics On-Device, una versión ligera del modelo anterior, optimizada para ejecutarse localmente en un robot real con baja latencia y alta fiabilidad, preservando la destreza. [ 6 ] [ 25 ]

SmolVLA

SmolVLA es un VLA compacto de código abierto con 450 millones de parámetros, publicado por Hugging Face . Representa un esfuerzo por democratizar la investigación sobre VLA. Fue entrenado completamente con LeRobot, un conjunto de datos de código abierto recopilado y curado por la comunidad. A pesar de su tamaño compacto, SmolVLA logró un rendimiento comparable al de VLA mucho más grandes como Octo, OpenVLA y π 0. La arquitectura de SmolVLA emplea coincidencia de flujo para el control continuo e inferencia asíncrona para desacoplar la estructura base del VLM de la ejecución de la acción. SmolVLA se puede ajustar y usar en una sola GPU de consumo. [ 26 ] [ 27 ] [ 28 ]

Véase también

Referencias

  1. ^ Jeong, Hyeongyo; Lee, Haechan; Kim, Changwon; Shin, Sungta (octubre de 2024). "Un estudio de la inteligencia robótica con grandes modelos de lenguaje" . Ciencias Aplicadas . 14 (19): 8868. doi : 10.3390/app14198868 .
  2. ^ a b c d e Brohan, Anthony; Brown, Noah; Carbajal, Justice; Chebotar, Yevgen; Chen, Xi; Choromanski, Krzysztof; Ding, Tianli; Driess, Danny; Dubey, Avinava (28 de julio de 2023), RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control , Actas de la 7.ª Conferencia sobre Aprendizaje Robótico: PLMR, págs.  2165–2183 , arXiv : 2307.15818{{citation}}: CS1 mantenimiento: ubicación ( enlace )
  3. ^ Fan, L.; Chen, Z.; Xu, M.; Yuan, M.; Huang, P.; Huang, W. (2024). "Razonamiento lingüístico en el modelo visión-lenguaje-acción para el agarre robótico". Congreso de Automatización de China (CAC) 2024. pp.  6656–6661 . doi : 10.1109/CAC63892.2024.10865585 . ISBN 979-8-3503-6860-4.
  4. ^ a b Zitkovich, Brianna; Yu, Tianhe; Xu, Sichun; Xu, Peng; Xiao, Ted; Xia, Fei; Wu, Jialin; Wohlhart, Paul; Welker, Stefan; Wahid, Ayzaan; Vuong, Quan; Vanhoucke, Vincent; Tran, Huong; Soricut, Radu; Singh, Anikait (2 de diciembre de 2023). "RT-2: Los modelos de visión, lenguaje y acción transfieren el conocimiento web al control robótico" . Actas de la 7.ª Conferencia sobre Aprendizaje Robótico . PMLR: 2165–2183 .
  5. ^ Zhang, Jingyi; Huang, Jiaxing; Jin, Sheng; Lu, Shijian (agosto de 2024). "Modelos de lenguaje de visión para tareas de visión: una revisión". IEEE Transactions on Pattern Analysis and Machine Intelligence . 46 (8): 5625– 5644. Bibcode : 2024ITPAM..46.5625Z . doi : 10.1109/TPAMI.2024.3369699 . ISSN 0162-8828 . PMID 38408000 .  
  6. ^ Equipo a b , Gemini Robotics; Abeyruwan, Saminda; Ainslie, Josué; Alayrac, Jean-Baptiste; Arenas, Montserrat González; Armstrong, Travis; Balakrishna, Ashwin; Baruc, Robert; Bauza, Maria (25 de marzo de 2025), Gemini Robotics: Llevando la IA al mundo físico , arXiv : 2503.20020
  7. ^ a b c d Kim, Moo Jin; Pertsch, Karl; Karamcheti, Siddharth; Xiao, Ted; Balakrishna, Ashwin; Nair, Suraj; Rafailov, Rafael; Foster, Ethan; Lam, Grace (5 de septiembre de 2024), OpenVLA: Un modelo de visión, lenguaje y acción de código abierto , 8.ª Conferencia Anual sobre Aprendizaje Robótico, arXiv : 2406.09246{{citation}}: CS1 maint: ubicación ( enlace ) CS1 maint: falta el editor de ubicación ( enlace )
  8. ^ a b c Negro, Kevin; Marrón, Noé; Seque, Danny; Esmail, Adnan; Equi, Michael; finlandés, Chelsea; Fusai, Nicolás; Novio, Lachy; Hausman, Karol (13 de noviembre de 2024), $π_0$: Un modelo de flujo de visión-lenguaje-acción para el control general de robots , arXiv : 2410.24164
  9. ^ a b "Helix: Un modelo de visión-lenguaje-acción para el control humanoide generalista" . FigureAI . 20 de febrero de 2025. Recuperado el 9 de julio de 2025 .
  10. ^ a b NVIDIA; Bjorck, Johan; Castañeda, Fernando; Cherniadev, Nikita; Da, Xingye; Ding, Runyu; Fan, Linxi "Jim"; Fang, Yu; Fox, Dieter (27 de marzo de 2025), GR00T N1: Un modelo de base abierta para robots humanoides generalistas , arXiv : 2503.14734
  11. ^ Chen, Xi; et al. (2024). "Sobre la ampliación de un modelo de visión y lenguaje multilingüe" . Conferencia IEEE/CVF 2024 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs.  14432–14444 . arXiv : 2305.18565v1 . doi : 10.1109/CVPR52733.2024.01368 . ISBN 979-8-3503-5300-6– vía acceso abierto.
  12. ^ Driess, Danny (23 de julio de 2023). "PaLM-E: un modelo de lenguaje multimodal encarnado" . Actas de la 40.ª Conferencia Internacional sobre Aprendizaje Automático (ICML) . 340 : 8469–8488 . arXiv : 2303.03378v1 – vía ACM DL.
  13. ^ Brohan, Anthony; Brown, Noah; Carbajal, Justice; Chebotar, Yevgen; Dabis, Joseph; Finn, Chelsea; Gopalakrishnan, Keerthana; Hausman, Karol; Herzog, Alex (11 de agosto de 2023), RT-1: Robotics Transformer for Real-World Control at Scale , arXiv : 2212.06817
  14. ^ Oquab, Maxime; Darcet, Timothée; Moutakani, Théo; Vo, Huy; Szafraniec, Marc; Khalidov, Vasil; Fernández, Pierre; Haziza, Daniel; Massa, Francisco (2 de febrero de 2024), DINOv2: Aprendizaje de funciones visuales sólidas sin supervisión , Transactions on Machine Learning Research Journal, arXiv : 2304.07193{{citation}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  15. ^ Radford, Alec; Kim, Jong Wook; Hallacy, Chris; Ramesh, Aditya; Goh, Gabriel; Agarwal, Sandhini; Sastry, Girish; Askell, Amanda; Mishkin, Pamela (26 de febrero de 2021), Aprendizaje de modelos visuales transferibles a partir de la supervisión del lenguaje natural , Actas de la 38.ª Conferencia Internacional sobre Aprendizaje Automático, arXiv : 2103.00020{{citation}}: CS1 maint: ubicación ( enlace ) CS1 maint: falta el editor de ubicación ( enlace )
  16. ^ O'Neill, Abby; Rehman, Abdul; Maddukuri, Abhiram; Gupta, Abhishek; Padalkar, Abhishek; Lee, Abraham; Pooley, Acorn; Gupta, Agrim; Mandlekar, Ajay; Jain, Ajinkya; Tung, Albert; Bewley, Alex; Herzog, Alex; Irpan, Alex; Khazatsky, Alexander (mayo de 2024). "Open X-Embodiment: Conjuntos de datos de aprendizaje robótico y modelos RT-X: Colaboración Open X-Embodiment 0 ". Conferencia Internacional IEEE de Robótica y Automatización (ICRA) de 2024. págs.  6892–6903 . doi : 10.1109/ICRA57147.2024.10611477 . ISBN 979-8-3503-8457-4.
  17. ^ Equipo, modelo Octo; Ghosh, Dibya; Walke, Homero; Pertsch, Karl; Negro, Kevin; Mées, Oier; Dasari, Sudeep; Hejna, Joey; Kreiman, Tobias (26 de mayo de 2024), Octo: una política de robots generalistas de código abierto , arXiv : 2405.12213
  18. ^ Wen, Junjie; Zhu, Yichen; Li, Jinming; Zhu, Minjie; Tang, Zhibin; Wu, Kun; Xu, Zhiyuan; Liu, Ning; Cheng, Ran; Shen, Chaomin; Peng, Yaxin; Feng, Feifei; Tang, Jian (abril de 2025). "TinyVLA: hacia modelos de visión, lenguaje y acción rápidos y eficientes en datos para la manipulación robótica". Cartas de robótica y automatización IEEE . 10 (4): 3988–3995 . arXiv : 2409.12514 . Código Bib : 2025IRAL...10.3988W . doi : 10.1109/LRA.2025.3544909 . ISSN 2377-3766 . 
  19. ^ Beyer, Lucas; Steiner, Andreas; Pinto, André Susano; Kolesnikov, Alejandro; Wang, Xiao; Salz, Daniel; Neumann, Maxim; Alabdulmohsin, Ibrahim; Tschannen, Michael (10 de octubre de 2024), PaliGemma: un VLM 3B versátil para transferencia , arXiv : 2407.07726
  20. ^ Zhai, Xiaohua; Mustafa, Basil; Kolesnikov, Alexander; Beyer, Lucas (1 de octubre de 2023). "Pérdida sigmoide para el preentrenamiento de imágenes de lenguaje". Conferencia Internacional IEEE/CVF de Visión por Computadora (ICCV) de 2023. IEEE. págs.  11941–11952 . doi : 10.1109/ICCV51070.2023.01100 . ISBN 979-8-3503-0718-4.
  21. ^ Equipo, Gemma; Mesnard, Thomas; Hardin, Cassidy; Dadashi, Robert; Bhupatiraju, Surya; Pathak, Shreya; Sifré, Laurent; Rivière, Morgane; Kale, Mihir Sanjay (16 de abril de 2024), Gemma: modelos abiertos basados ​​en la investigación y la tecnología de Gemini , arXiv : 2403.08295
  22. ^ Beyer, Lucas; Steiner, Andreas; Pinto, André Susano; Kolesnikov, Alejandro; Wang, Xiao; Salz, Daniel; Neumann, Maxim; Alabdulmohsin, Ibrahim; Tschannen, Michael (10 de octubre de 2024), PaliGemma: un VLM 3B versátil para transferencia , arXiv : 2407.07726
  23. ^ Negro, Kevin; Marrón, Noé; Seque, Danny; Esmail, Adnan; Equi, Michael; finlandés, Chelsea; Fusai, Nicolás; Novio, Lachy; Hausman, Karol (2024), $π_0$: Un modelo de flujo de visión-lenguaje-acción para el control general de robots , arXiv : 2410.24164
  24. ^ Pertsch, Karl; Stachowicz, Kyle; Ichter, Brian; Seque, Danny; Nair, Suraj; Vuong, Quan; Mées, Oier; finlandés, Chelsea ; Levine, Sergey (16 de enero de 2025), FAST: Tokenización de acción eficiente para modelos de visión-lenguaje-acción , arXiv : 2501.09747
  25. ^ "Gemini Robotics" . Google DeepMind . Consultado el 9 de julio de 2025 .
  26. ^ "SmolVLA: Modelo eficiente de visión, lenguaje y acción entrenado con datos de la comunidad Lerobot" . huggingface.co . 3 de junio de 2025. Consultado el 9 de julio de 2025 .
  27. ^ "lerobot (LeRobot)" . huggingface.co . 24 de junio de 2025. Consultado el 9 de julio de 2025 .
  28. ^ Shukor, Mustafa; Aubakirova, Dana; Capuano, Francisco; Kooijmans, Pepijn; Palma, Steven; Zouitine, Adil; Aractingi, Michel; Pascal, Carolina; Russi, Martino (2 de junio de 2025), SmolVLA: un modelo de visión, lenguaje y acción para robótica asequible y eficiente , arXiv : 2506.01844

Lecturas adicionales

  • Brohan, Anthony; Brown, Noah; Carbajal, Justice; Chebotar, Yevgen; Chen, Xi; Choromanski, Krzysztof; Ding, Tianli; Driess, Danny; Dubey, Avinava (28 de julio de 2023), RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control , arXiv : 2307.15818
  • Negro, Kevin; Marrón, Noé; Seque, Danny; Esmail, Adnan; Equi, Michael; finlandés, Chelsea; Fusai, Nicolás; Novio, Lachy; Hausman, Karol (2024), $π_0$: Un modelo de flujo de visión-lenguaje-acción para el control general de robots , arXiv : 2410.24164
  • Mamá, Yueen; Canción, Zixing; Zhuang, Yuzheng; Hao, Jianye; King, Irwin (4 de marzo de 2025), Una encuesta sobre modelos de visión-lenguaje-acción para la IA incorporada , arXiv : 2405.14093
Obtenido de " https://en.wikipedia.org/w/index.php?title=Vision–language–action_model&oldid=1359788720 "