Gemini Robotics
La familia de modelos fundacionales de robótica de Google — un VLA más un modelo «pensante» de razonamiento corporizado (Embodied Reasoning).
Gemini Robotics es la familia de modelos fundacionales de robótica presentada por Google DeepMind en marzo de 2025, que se construye sobre el modelo multimodal Gemini. Está compuesta por dos componentes propietarios:
- Gemini Robotics — un modelo de visión-lenguaje-acción que traduce directamente imágenes de cámara y órdenes en lenguaje natural en acciones del robot.
- Gemini Robotics-ER — un modelo de «razonamiento corporizado» (Embodied Reasoning) para el pensamiento espacial y la planificación; no controla los motores directamente, sino que aporta el razonamiento «lento».
Estado de desarrollo
- Gemini Robotics On-Device (junio de 2025): una variante que se ejecuta localmente en el robot — de baja latencia, independiente de la red y adaptable mediante fine-tuning con unas pocas demostraciones.
- Gemini Robotics 1.5 / ER 1.5 (septiembre de 2025): el VLA «piensa antes de actuar» y muestra los pasos intermedios; aprende Cross-Embodiment — los movimientos pueden transferirse de un robot a otro. ER 1.5 planifica en varias etapas e invoca herramientas digitales («agéntico»).
- Gemini Robotics-ER 1.6 (abril de 2026): razonamiento espacial e invocación de herramientas más precisos, disponible a través de la API de Gemini y Google AI Studio.
Estratégicamente importantes son las alianzas de 2026 para llevar los modelos a los humanoides — entre otras, con Boston Dynamics (Atlas). Contextualización en el panorama competitivo: panorama de modelos fundacionales.
Stand: 26/6/2026