Panorama de los Foundation Models 2026
Quién construye qué foundation models para robótica — el estado actual de los VLA y World Models más importantes (mediados de 2026).
Desde 2024 se ha desatado una carrera por el «cerebro» de los robots humanoides. Este panorama clasifica los foundation models para robótica más importantes — con su estado actual respectivo (mediados de 2026). Los superlativos de rendimiento de cada proveedor son a menudo datos proporcionados por ellos mismos y aún no han sido verificados de forma independiente; por eso aquí se formulan con la debida cautela.
Vistazo rápido
| Proveedor | Modelo más reciente | Estado | Tipo | Licencia |
|---|---|---|---|---|
| Google DeepMind | [[gemini-robotics | Gemini Robotics 1.5 / ER 1.6]] | 2025–2026 | VLA + VLM de razonamiento |
| NVIDIA | [[nvidia-groot | Isaac GR00T N1.7]] (N2 en preview) | 2026 | VLA / World-Action |
| NVIDIA | [[nvidia-cosmos | Cosmos]] (Predict/Transfer/Reason) | 2025–2026 | World Model |
| Physical Intelligence | [[physical-intelligence-pi | π0.7]] | 2026 | VLA |
| Figure AI | [[figure-helix | Helix]] | desde 2025 | VLA (System 1/2) |
| Tesla | Red de control de Optimus (sin modelo con nombre) | — | end-to-end | propietaria |
| Skild AI | [[skild-brain | Skild Brain]] | 2026 | foundation «omni-bodied» |
| 1X Technologies | Redwood + World Model | desde 2025 | VLA + World Model | propietaria |
| Hugging Face | [[lerobot | SmolVLA / LeRobot]] | desde 2025 | VLA / ecosistema |
| ByteDance | GR-3 | 2025 | VLA (Mixture-of-Transformers) | investigación |
| AgiBot | GO-1 (ViLLA) | 2025 | Embodied Foundation | conjunto de datos abierto |
| World Labs | Marble | 2026 | World Model de gran tamaño | propietaria |
Las grandes tendencias
Propietario e integrado (Google, Figure, Tesla, 1X). Quien fabrica sus propios robots o posee una plataforma suele mantener el modelo cerrado y lo optimiza estrechamente para su propio hardware. Gemini Robotics incorpora además un modelo de razonamiento separado (ER) que «piensa antes de actuar».
Abierto y multiplataforma (NVIDIA, Hugging Face). NVIDIA posiciona GR00T y Cosmos como bloques abiertos para todo el sector — respaldados por el negocio de chips y simulación. Hugging Face apunta con LeRobot/SmolVLA a la democratización: VLA pequeños y abiertos que funcionan en hardware de consumo.
Startups puramente de modelos (Physical Intelligence, Skild AI). No venden una carcasa de robot, sino el «cerebro» — un modelo que controle la mayor cantidad posible de cuerpos de robot. Physical Intelligence ha presentado con π0 un VLA muy comentado y parcialmente abierto; Skild AI persigue un modelo «omni-bodied».
El bloque chino (AgiBot, ByteDance, Fourier, Galbot, Unitree …). Los actores chinos combinan una fabricación en serie de hardware agresiva con sus propios modelos embodied y, en algunos casos, conjuntos de datos abiertos (AgiBot World). GR-3 de ByteDance y GO-1 de AgiBot figuran entre los más visibles.
El cuello de botella común
A todos los une el mismo problema: muy pocos datos de robots. Las respuestas van desde la teleoperación masiva, pasando por conjuntos de datos compartidos (Open X-Embodiment), hasta datos sintéticos generados por World Models («GR00T-Dreams»/Cosmos de NVIDIA). Justo aquí se decide qué modelo será el primero en alcanzar la fiabilidad suficiente para el uso cotidiano.
Stand: 26/6/2026