Modelo Visión-Lenguaje-Acción (VLA)
Modelo de IA que traduce imagen + lenguaje directamente en acciones del robot.
Un modelo Visión-Lenguaje-Acción (VLA) procesa imágenes de cámara (Vision) e instrucciones en lenguaje natural (Language) y produce directamente acciones de control (Action). Los VLA son actualmente la arquitectura dominante para el control general de robots y el tipo más común de modelo fundacional de robótica.
Funcionamiento
Por lo general, un VLA se construye sobre un modelo de visión-lenguaje (VLM) preentrenado y se reentrena con datos de demostraciones de robots. De este modo, el conocimiento procedente de la web (objetos, lenguaje, relaciones) se transfiere al control físico: el robot puede deducir nuevas tareas a partir del lenguaje natural en lugar de ser programado de forma fija.
Ejemplos importantes
- Gemini Robotics (Google DeepMind) y sus predecesores RT-2 / RT-X.
- π0 / π0.5 (Physical Intelligence).
- Helix (Figure AI) con «System 1 / System 2».
- GR00T N1 (NVIDIA), abierto.
- SmolVLA (Hugging Face) y OpenVLA/Octo — modelos de referencia abiertos.
Una visión de conjunto con el estado actual de las versiones se ofrece en el panorama de modelos fundacionales.
Stand: 26/6/2026