
Google stellt Gemini Robotics 2.0 vor: Bessere Motorik und neue Sicherheits-Benchmarks
Gemini Robotics 2 besteht aus drei Sub-Modellen mit klar getrennten Aufgaben: Das öffentlich verfügbare Embodied-Reasoning-Modell ER 2 ist ein Vision-Language-Model (VLM), das Live-Videofeeds der Roboterkameras verarbeitet und Aufgabenfortschritte kontinuierlich verfolgt. Das eigentliche Aktionsmodell Gemini Robotics 2 – ein sogenanntes Vision-Language-Action-Model (VLA) – übersetzt die Situationsanalyse in konkrete Bewegungsbefehle, ähnlich wie andere generative Modelle Text oder Bilder erzeugen. Ergänzt wird das Trio durch Gemini Robotics On-Device 2, eine latenzarme Offline-Variante, die sich mit nur wenigen Stunden Bewegungsdaten – rund 200 Beispielen – an neue Roboterdesigns anpassen kann; beide Aktionsmodelle sind derzeit nur einem kleinen Testerkreis zugänglich. Als Demonstrations-Hardware setzt Google DeepMind unter anderem auf Apptroniks Apollo 2 und den Franka F3 Duo sowie auf Boston-Dynamics-Roboter. Der Vorgänger ER 1.6 wird dabei als Vergleichsbasis genutzt: ER 2 steigert die Videoframe-Vollständigkeitsklassifikation auf knapp 60 Prozent, während die Erkennung entscheidender Handlungsmomente – etwa das rechtzeitige Stoppen beim Einschenken – auf rund 90 Prozent klettert. Das neue ASIMOV-Agentic-Sicherheitsbenchmark prüft, ob ein VLM unsichere Werkzeugaufrufe eines VLA ablehnt, ob Aufgaben überhaupt sicher ausführbar sind, und ob das Modell bei Unsicherheit Menschenhilfe anfordert. Google DeepMind bezeichnet ER 2 als sein bisher sicherstes Modell, das Aktionen stoppt, sobald ein Mensch dem Roboter zu nahekäme.
- Gemini Robotics ER 2 klassifiziert Videoframe-Vollständigkeit mit knapp 60 % Genauigkeit – deutlich besser als ER 1.6 und konkurrierende Modelle, aber noch weit von perfekt.
- Das Aktionsmodell Gemini Robotics On-Device 2 (Offline-Variante) passt sich mit ~200 Bewegungsbeispielen (wenige Stunden Daten) an neue Roboter-Hardware an.
- Kollaborationsdemonstration mit zwei unterschiedlichen Robotertypen: Apptroniks Apollo 2 (Humanoid) und Franka F3 Duo arbeiten gemeinsam an Aufgaben, ohne sich gegenseitig zu behindern.
- ASIMOV-Agentic prüft drei Sicherheitsdimensionen: Ablehnung unsicherer VLA-Werkzeugaufrufe, Einschätzung der Aufgaben-Sicherheit und Anforderung menschlicher Hilfe bei Unsicherheit.
- Google testet Gemini Robotics 2 auch auf Boston-Dynamics-Hardware – neben Apptronik und Franka eine dritte Roboterplattform im Testfeld.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge

Google stellt Gemini Robotics 2.0 vor: Bessere Motorik und neue Sicherheits-Benchmarks
Gemini Robotics 2 besteht aus drei Sub-Modellen mit klar getrennten Aufgaben: Das öffentlich verfügbare Embodied-Reasoning-Modell ER 2 ist ein Vision-Language-Model (VLM), das Live-Videofeeds der Roboterkameras verarbeitet und Aufgabenfortschritte kontinuierlich verfolgt. Das eigentliche Aktionsmodell Gemini Robotics 2 – ein sogenanntes Vision-Language-Action-Model (VLA) – übersetzt die Situationsanalyse in konkrete Bewegungsbefehle, ähnlich wie andere generative Modelle Text oder Bilder erzeugen. Ergänzt wird das Trio durch Gemini Robotics On-Device 2, eine latenzarme Offline-Variante, die sich mit nur wenigen Stunden Bewegungsdaten – rund 200 Beispielen – an neue Roboterdesigns anpassen kann; beide Aktionsmodelle sind derzeit nur einem kleinen Testerkreis zugänglich. Als Demonstrations-Hardware setzt Google DeepMind unter anderem auf Apptroniks Apollo 2 und den Franka F3 Duo sowie auf Boston-Dynamics-Roboter. Der Vorgänger ER 1.6 wird dabei als Vergleichsbasis genutzt: ER 2 steigert die Videoframe-Vollständigkeitsklassifikation auf knapp 60 Prozent, während die Erkennung entscheidender Handlungsmomente – etwa das rechtzeitige Stoppen beim Einschenken – auf rund 90 Prozent klettert. Das neue ASIMOV-Agentic-Sicherheitsbenchmark prüft, ob ein VLM unsichere Werkzeugaufrufe eines VLA ablehnt, ob Aufgaben überhaupt sicher ausführbar sind, und ob das Modell bei Unsicherheit Menschenhilfe anfordert. Google DeepMind bezeichnet ER 2 als sein bisher sicherstes Modell, das Aktionen stoppt, sobald ein Mensch dem Roboter zu nahekäme.
- Gemini Robotics ER 2 klassifiziert Videoframe-Vollständigkeit mit knapp 60 % Genauigkeit – deutlich besser als ER 1.6 und konkurrierende Modelle, aber noch weit von perfekt.
- Das Aktionsmodell Gemini Robotics On-Device 2 (Offline-Variante) passt sich mit ~200 Bewegungsbeispielen (wenige Stunden Daten) an neue Roboter-Hardware an.
- Kollaborationsdemonstration mit zwei unterschiedlichen Robotertypen: Apptroniks Apollo 2 (Humanoid) und Franka F3 Duo arbeiten gemeinsam an Aufgaben, ohne sich gegenseitig zu behindern.
- ASIMOV-Agentic prüft drei Sicherheitsdimensionen: Ablehnung unsicherer VLA-Werkzeugaufrufe, Einschätzung der Aufgaben-Sicherheit und Anforderung menschlicher Hilfe bei Unsicherheit.
- Google testet Gemini Robotics 2 auch auf Boston-Dynamics-Hardware – neben Apptronik und Franka eine dritte Roboterplattform im Testfeld.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.