Foundation-Model-Landschaft 2026
Wer baut welche Robotik-Foundation-Models — der aktuelle Stand der wichtigsten VLAs und World Models (Mitte 2026).
Seit 2024 ist ein Wettlauf um das „Gehirn” humanoider Roboter entbrannt. Diese Übersicht ordnet die wichtigsten Robotik-Foundation-Models ein — mit dem jeweils aktuellen Stand (Mitte 2026). Leistungs-Superlative einzelner Anbieter sind oft Eigenangaben und noch nicht unabhängig überprüft; sie sind hier entsprechend zurückhaltend formuliert.
Schnellüberblick
| Anbieter | Aktuellstes Modell | Stand | Typ | Lizenz |
|---|---|---|---|---|
| Google DeepMind | [[gemini-robotics | Gemini Robotics 1.5 / ER 1.6]] | 2025–2026 | VLA + Reasoning-VLM |
| NVIDIA | [[nvidia-groot | Isaac GR00T N1.7]] (N2 als Preview) | 2026 | VLA / World-Action |
| NVIDIA | [[nvidia-cosmos | Cosmos]] (Predict/Transfer/Reason) | 2025–2026 | World Model |
| Physical Intelligence | [[physical-intelligence-pi | π0.7]] | 2026 | VLA |
| Figure AI | [[figure-helix | Helix]] | seit 2025 | VLA (System 1/2) |
| Tesla | Optimus-Steuernetz (kein benanntes Modell) | — | end-to-end | proprietär |
| Skild AI | [[skild-brain | Skild Brain]] | 2026 | „omni-bodied” Foundation |
| 1X Technologies | Redwood + World Model | seit 2025 | VLA + World Model | proprietär |
| Hugging Face | [[lerobot | SmolVLA / LeRobot]] | seit 2025 | VLA / Ökosystem |
| ByteDance | GR-3 | 2025 | VLA (Mixture-of-Transformers) | Forschung |
| AgiBot | GO-1 (ViLLA) | 2025 | Embodied Foundation | Datensatz offen |
| World Labs | Marble | 2026 | großes World Model | proprietär |
Die großen Linien
Proprietär & integriert (Google, Figure, Tesla, 1X). Wer eigene Roboter baut oder eine Plattform besitzt, hält das Modell meist geschlossen und optimiert es eng auf die eigene Hardware. Gemini Robotics bringt zusätzlich ein separates Reasoning-Modell (ER) mit, das „vor dem Handeln denkt”.
Offen & plattformübergreifend (NVIDIA, Hugging Face). NVIDIA positioniert GR00T und Cosmos als offene Bausteine für die ganze Branche — flankiert vom Geschäft mit Chips und Simulation. Hugging Face zielt mit LeRobot/SmolVLA auf die Demokratisierung: kleine, offene VLAs, die auf Consumer-Hardware laufen.
Reine Modell-Startups (Physical Intelligence, Skild AI). Sie verkaufen kein Robotergehäuse, sondern das „Gehirn” — ein Modell, das möglichst viele Roboterkörper steuert. Physical Intelligence hat mit π0 ein viel beachtetes, teils offenes VLA vorgelegt; Skild AI verfolgt ein „omni-bodied” Modell.
Der China-Block (AgiBot, ByteDance, Fourier, Galbot, Unitree …). Chinesische Akteure kombinieren aggressive Hardware-Serienfertigung mit eigenen Embodied-Modellen und teils offenen Datensätzen (AgiBot World). GR-3 von ByteDance und GO-1 von AgiBot zählen zu den sichtbarsten.
Der gemeinsame Engpass
Alle eint dasselbe Problem: zu wenig Roboterdaten. Die Antworten reichen von massiver Teleoperation über geteilte Datensätze (Open X-Embodiment) bis zu synthetischen Daten aus World Models (NVIDIAs „GR00T-Dreams”/Cosmos). Genau hier entscheidet sich, wessen Modell zuerst zuverlässig genug für den Alltagseinsatz wird.
Verwandte Themen
Hierher verlinkt
Quellen
Stand: 26.6.2026