Gemini Robotics 1.5: Eine neue Generation von Robotern, die denken und handeln
Stellen Sie sich einen Roboter vor, der nicht nur die Welt um sich herum sieht, sondern auch plant, was er als Nächstes tun wird, und seine Entscheidung mit Worten erklärt. Genau das ermöglicht das neue Modell Gemini Robotics 1.5 von Google DeepMind, das am 25. September 2025 veröffentlicht wurde. Dieses Vision-Language-Action-Modell (VLA) nimmt visuelle Informationen und sprachliche Anweisungen auf und wandelt sie direkt in Bewegungen des Roboters um. Wenn der Roboter beispielsweise die Aufgabe erhält, Wäsche nach Farben zu sortieren, denkt er zunächst darüber nach – weiße Wäsche in den weißen Korb, Buntwäsche in den schwarzen – und beginnt erst dann, seine Arme zu bewegen, um die Aufgabe auszuführen. All das ist der Fähigkeit des Modells zu verdanken, eine interne Gedankenkette in natürlicher Sprache zu erzeugen, wodurch der gesamte Prozess transparenter wird.
Das Modell arbeitet mit einem weiteren Modell namens Gemini Robotics-ER 1.5 zusammen, das als übergeordnetes Gehirn fungiert. Dieses Vision-Language-Modell (VLM) ist auf Planung und logische Entscheidungsfindung in realen Umgebungen spezialisiert. Es kann digitale Werkzeuge wie Google Search aufrufen, um benötigte Informationen zu erhalten – etwa lokale Vorschriften zur Mülltrennung. Anschließend sendet es präzise Anweisungen an das Modell Gemini Robotics 1.5, das sie in konkrete Aktionen umsetzt. Beide Modelle basieren auf der Gemini-Modellfamilie und wurden mit spezifischen Daten optimiert, sodass sie längere Aufgaben in unterschiedlichen Umgebungen bewältigen können.
Denken vor jeder Bewegung
Einer der größten Vorteile von Gemini Robotics 1.5 besteht darin, dass der Roboter nachdenkt, bevor er sich bewegt. Bei einer Aufgabe wie „Sortiere meine Wäsche nach Farben“ analysiert das Modell zunächst die Situation: Es versteht, dass weiße Wäsche in den einen Korb und Buntwäsche in den anderen gehört. Dann plant es seine Bewegungen, beispielsweise einen roten Pullover zu nehmen und ihn in den schwarzen Korb zu legen, und berücksichtigt sogar Details wie das Heranziehen des Pullovers, damit er leichter gegriffen werden kann. Dieser Prozess unterteilt komplexe Aufgaben in einfachere Teile, was dem Roboter hilft, neue Situationen zu bewältigen und widerstandsfähiger gegenüber Veränderungen in seiner Umgebung zu sein.

Dank dieser Fähigkeit wird der Roboter flexibler. Wenn er beispielsweise Gegenstände in Kompost, Recycling und Restmüll sortiert, ermittelt er zunächst über das Internet die örtlichen Vorschriften, betrachtet die Gegenstände vor sich und sortiert sie anschließend entsprechend. All das geschieht ohne genaue Anweisungen eines Menschen – eine allgemeine Aufforderung genügt.
Lernen über verschiedene Robotertypen hinweg
Gemini Robotics 1.5 kann erlernte Fähigkeiten zwischen verschiedenen Robotern übertragen, was einen enormen Fortschritt darstellt. Wenn das Modell eine Aufgabe auf dem zweiarmigen Roboter ALOHA 2 erlernt, funktioniert dieselbe Bewegung auch auf dem humanoiden Roboter Apollo des Unternehmens Apptronik oder auf dem zweiarmigen Roboter Franka. Das bedeutet, dass das Modell nicht für jeden neuen Robotertyp angepasst werden muss – die Fähigkeiten werden direkt übertragen, was das Lernen beschleunigt und Roboter vielseitiger macht.
Dieser Ansatz basiert auf dem Training mit Daten von unterschiedlichen Robotern, wodurch eine Generalisierung möglich wird. Beispielsweise funktionieren Aufgaben, die ausschließlich auf ALOHA 2 trainiert wurden, sofort auf Apollo oder Franka und umgekehrt.
Sicherheit und Verfügbarkeit für Entwickler
Sicherheit ist von entscheidender Bedeutung. Daher berücksichtigt das Modell Gemini Robotics 1.5 vor jeder Aktion Sicherheitsaspekte, hält sich im Dialog mit Menschen an die Gemini-Grundsätze und aktiviert die Kollisionsvermeidungssysteme des Roboters. Google DeepMind hat den ASIMOV-Benchmark zur Sicherheitsbewertung verbessert, der nun eine bessere Abdeckung von Grenzfällen, Annotationen sowie neue Arten von Fragen und Videos umfasst. Das Modell Gemini Robotics-ER 1.5 erzielte bei diesen Tests Spitzenergebnisse.
Seit dem 25. September 2025 ist Gemini Robotics-ER 1.5 über die Gemini API in Google AI Studio für Entwickler verfügbar. Die Vollversion von Gemini Robotics 1.5 steht vorerst ausgewählten Partnern zur Verfügung. Einzelheiten zur Entwicklung mit diesen Modellen finden Sie im Entwicklerblog.
Diese Entwicklung bringt Roboter dem Einsatz als Helfer im Alltag näher – vom Aufräumen bis hin zu komplexen Aufgaben in der Industrie. Mit Gemini Robotics 1.5 wird künstliche Intelligenz Teil der physischen Welt, in der Roboter nicht nur reagieren, sondern auch aktiv denken und planen.



