Gemini Robotics
Googles Familie von Robotik-Foundation-Models — ein VLA plus ein „denkendes" Embodied-Reasoning-Modell.
Gemini Robotics ist die von Google DeepMind im März 2025 vorgestellte Familie von Robotik-Foundation-Models, die auf dem multimodalen Gemini-Modell aufbaut. Sie besteht aus zwei proprietären Komponenten:
- Gemini Robotics — ein Vision-Language-Action-Modell, das Kamerabilder und Sprachbefehle direkt in Roboteraktionen übersetzt.
- Gemini Robotics-ER — ein „Embodied Reasoning”-Modell für räumliches Denken und Planung; es steuert keine Motoren direkt, sondern liefert das „langsame” Überlegen.
Entwicklungsstand
- Gemini Robotics On-Device (Juni 2025): eine Variante, die lokal auf dem Roboter läuft — latenzarm, netzunabhängig und per Fine-Tuning mit wenigen Demonstrationen anpassbar.
- Gemini Robotics 1.5 / ER 1.5 (September 2025): Das VLA „denkt vor dem Handeln” und zeigt Zwischenschritte; es lernt Cross-Embodiment — Bewegungen lassen sich von einem Roboter auf einen anderen übertragen. ER 1.5 plant mehrstufig und ruft digitale Werkzeuge auf („agentisch”).
- Gemini Robotics-ER 1.6 (April 2026): schärferes räumliches Reasoning und Werkzeugaufrufe, verfügbar über die Gemini-API und Google AI Studio.
Strategisch wichtig sind die 2026er Partnerschaften, um die Modelle in Humanoide zu bringen — unter anderem mit Boston Dynamics (Atlas). Einordnung im Wettbewerb: Foundation-Model-Landschaft.
Verwandte Themen
Hierher verlinkt
Quellen
Stand: 26.6.2026