H Humanoid World
← Wiki

Modelo Visión-Lenguaje-Acción (VLA)

Modelo de IA que traduce imagen + lenguaje directamente en acciones del robot.

Un modelo Visión-Lenguaje-Acción (VLA) procesa imágenes de cámara (Vision) e instrucciones en lenguaje natural (Language) y produce directamente acciones de control (Action). Los VLA son actualmente la arquitectura dominante para el control general de robots y el tipo más común de modelo fundacional de robótica.

Funcionamiento

Por lo general, un VLA se construye sobre un modelo de visión-lenguaje (VLM) preentrenado y se reentrena con datos de demostraciones de robots. De este modo, el conocimiento procedente de la web (objetos, lenguaje, relaciones) se transfiere al control físico: el robot puede deducir nuevas tareas a partir del lenguaje natural en lugar de ser programado de forma fija.

Ejemplos importantes

  • Gemini Robotics (Google DeepMind) y sus predecesores RT-2 / RT-X.
  • π0 / π0.5 (Physical Intelligence).
  • Helix (Figure AI) con «System 1 / System 2».
  • GR00T N1 (NVIDIA), abierto.
  • SmolVLA (Hugging Face) y OpenVLA/Octo — modelos de referencia abiertos.

Una visión de conjunto con el estado actual de las versiones se ofrece en el panorama de modelos fundacionales.

Stand: 26/6/2026