H Humanoid World
← Wiki

Foundation-Model-Landschaft 2026

Wer baut welche Robotik-Foundation-Models — der aktuelle Stand der wichtigsten VLAs und World Models (Mitte 2026).

Seit 2024 ist ein Wettlauf um das „Gehirn” humanoider Roboter entbrannt. Diese Übersicht ordnet die wichtigsten Robotik-Foundation-Models ein — mit dem jeweils aktuellen Stand (Mitte 2026). Leistungs-Superlative einzelner Anbieter sind oft Eigenangaben und noch nicht unabhängig überprüft; sie sind hier entsprechend zurückhaltend formuliert.

Schnellüberblick

AnbieterAktuellstes ModellStandTypLizenz
Google DeepMind[[gemini-roboticsGemini Robotics 1.5 / ER 1.6]]2025–2026VLA + Reasoning-VLM
NVIDIA[[nvidia-grootIsaac GR00T N1.7]] (N2 als Preview)2026VLA / World-Action
NVIDIA[[nvidia-cosmosCosmos]] (Predict/Transfer/Reason)2025–2026World Model
Physical Intelligence[[physical-intelligence-piπ0.7]]2026VLA
Figure AI[[figure-helixHelix]]seit 2025VLA (System 1/2)
TeslaOptimus-Steuernetz (kein benanntes Modell)end-to-endproprietär
Skild AI[[skild-brainSkild Brain]]2026„omni-bodied” Foundation
1X TechnologiesRedwood + World Modelseit 2025VLA + World Modelproprietär
Hugging Face[[lerobotSmolVLA / LeRobot]]seit 2025VLA / Ökosystem
ByteDanceGR-32025VLA (Mixture-of-Transformers)Forschung
AgiBotGO-1 (ViLLA)2025Embodied FoundationDatensatz offen
World LabsMarble2026großes World Modelproprietär

Die großen Linien

Proprietär & integriert (Google, Figure, Tesla, 1X). Wer eigene Roboter baut oder eine Plattform besitzt, hält das Modell meist geschlossen und optimiert es eng auf die eigene Hardware. Gemini Robotics bringt zusätzlich ein separates Reasoning-Modell (ER) mit, das „vor dem Handeln denkt”.

Offen & plattformübergreifend (NVIDIA, Hugging Face). NVIDIA positioniert GR00T und Cosmos als offene Bausteine für die ganze Branche — flankiert vom Geschäft mit Chips und Simulation. Hugging Face zielt mit LeRobot/SmolVLA auf die Demokratisierung: kleine, offene VLAs, die auf Consumer-Hardware laufen.

Reine Modell-Startups (Physical Intelligence, Skild AI). Sie verkaufen kein Robotergehäuse, sondern das „Gehirn” — ein Modell, das möglichst viele Roboterkörper steuert. Physical Intelligence hat mit π0 ein viel beachtetes, teils offenes VLA vorgelegt; Skild AI verfolgt ein „omni-bodied” Modell.

Der China-Block (AgiBot, ByteDance, Fourier, Galbot, Unitree …). Chinesische Akteure kombinieren aggressive Hardware-Serienfertigung mit eigenen Embodied-Modellen und teils offenen Datensätzen (AgiBot World). GR-3 von ByteDance und GO-1 von AgiBot zählen zu den sichtbarsten.

Der gemeinsame Engpass

Alle eint dasselbe Problem: zu wenig Roboterdaten. Die Antworten reichen von massiver Teleoperation über geteilte Datensätze (Open X-Embodiment) bis zu synthetischen Daten aus World Models (NVIDIAs „GR00T-Dreams”/Cosmos). Genau hier entscheidet sich, wessen Modell zuerst zuverlässig genug für den Alltagseinsatz wird.

Verwandte Themen

Hierher verlinkt

Quellen

  1. Google DeepMind: Gemini Robotics 1.5
  2. NVIDIA Isaac GR00T (GitHub)
  3. Physical Intelligence – Blog (π-Modelle)
  4. Figure: Helix
  5. Hugging Face: SmolVLA

Stand: 26.6.2026