H Humanoid World
← Wiki

Panorama de los Foundation Models 2026

Quién construye qué foundation models para robótica — el estado actual de los VLA y World Models más importantes (mediados de 2026).

Desde 2024 se ha desatado una carrera por el «cerebro» de los robots humanoides. Este panorama clasifica los foundation models para robótica más importantes — con su estado actual respectivo (mediados de 2026). Los superlativos de rendimiento de cada proveedor son a menudo datos proporcionados por ellos mismos y aún no han sido verificados de forma independiente; por eso aquí se formulan con la debida cautela.

Vistazo rápido

ProveedorModelo más recienteEstadoTipoLicencia
Google DeepMind[[gemini-roboticsGemini Robotics 1.5 / ER 1.6]]2025–2026VLA + VLM de razonamiento
NVIDIA[[nvidia-grootIsaac GR00T N1.7]] (N2 en preview)2026VLA / World-Action
NVIDIA[[nvidia-cosmosCosmos]] (Predict/Transfer/Reason)2025–2026World Model
Physical Intelligence[[physical-intelligence-piπ0.7]]2026VLA
Figure AI[[figure-helixHelix]]desde 2025VLA (System 1/2)
TeslaRed de control de Optimus (sin modelo con nombre)end-to-endpropietaria
Skild AI[[skild-brainSkild Brain]]2026foundation «omni-bodied»
1X TechnologiesRedwood + World Modeldesde 2025VLA + World Modelpropietaria
Hugging Face[[lerobotSmolVLA / LeRobot]]desde 2025VLA / ecosistema
ByteDanceGR-32025VLA (Mixture-of-Transformers)investigación
AgiBotGO-1 (ViLLA)2025Embodied Foundationconjunto de datos abierto
World LabsMarble2026World Model de gran tamañopropietaria

Las grandes tendencias

Propietario e integrado (Google, Figure, Tesla, 1X). Quien fabrica sus propios robots o posee una plataforma suele mantener el modelo cerrado y lo optimiza estrechamente para su propio hardware. Gemini Robotics incorpora además un modelo de razonamiento separado (ER) que «piensa antes de actuar».

Abierto y multiplataforma (NVIDIA, Hugging Face). NVIDIA posiciona GR00T y Cosmos como bloques abiertos para todo el sector — respaldados por el negocio de chips y simulación. Hugging Face apunta con LeRobot/SmolVLA a la democratización: VLA pequeños y abiertos que funcionan en hardware de consumo.

Startups puramente de modelos (Physical Intelligence, Skild AI). No venden una carcasa de robot, sino el «cerebro» — un modelo que controle la mayor cantidad posible de cuerpos de robot. Physical Intelligence ha presentado con π0 un VLA muy comentado y parcialmente abierto; Skild AI persigue un modelo «omni-bodied».

El bloque chino (AgiBot, ByteDance, Fourier, Galbot, Unitree …). Los actores chinos combinan una fabricación en serie de hardware agresiva con sus propios modelos embodied y, en algunos casos, conjuntos de datos abiertos (AgiBot World). GR-3 de ByteDance y GO-1 de AgiBot figuran entre los más visibles.

El cuello de botella común

A todos los une el mismo problema: muy pocos datos de robots. Las respuestas van desde la teleoperación masiva, pasando por conjuntos de datos compartidos (Open X-Embodiment), hasta datos sintéticos generados por World Models («GR00T-Dreams»/Cosmos de NVIDIA). Justo aquí se decide qué modelo será el primero en alcanzar la fiabilidad suficiente para el uso cotidiano.

Stand: 26/6/2026