Entdecken Sie Genie 3 von Google DeepMind – die Zukunft KI-gestützter Simulationen
Sie geben eine einfache Textbeschreibung ein und finden sich plötzlich in einer dynamischen Welt wieder, die Sie in Echtzeit erkunden können. Das ist keine Science-Fiction, sondern Realität, ermöglicht durch Genie 3, ein neues Modell von Google DeepMind. Dieser Artikel führt Sie durch die Details dieser bahnbrechenden Entwicklung und basiert auf dem offiziellen Blogbeitrag der Autoren Jack Parker-Holder und Shlomi Fruchter. Sehen wir uns an, wie Genie 3 unsere Sicht auf simulierte Umgebungen verändert – verständlich erklärt und mit einer ordentlichen Portion Begeisterung, denn das ist wirklich aufregend!
Der Weg zur Simulation der Welt
Google DeepMind erforscht seit mehr als zehn Jahren simulierte Umgebungen. Angefangen hat es mit dem Training von Agenten, die Echtzeit-Strategiespiele wie StarCraft II meisterten, und setzte sich mit der Entwicklung offener Umgebungen für maschinelles Lernen und Robotik fort. All dies führte zur Entwicklung von Weltmodellen – Systemen der künstlichen Intelligenz, die auf Grundlage ihres Verständnisses die Welt simulieren, ihre Entwicklung vorhersagen und auf Aktionen reagieren können.
Weltmodelle sind auf dem Weg zur allgemeinen künstlichen Intelligenz (AGI) von entscheidender Bedeutung, da sie das Training von Agenten in einer unbegrenzten Zahl vielfältiger Simulationen ermöglichen. Im vergangenen Jahr wurden Genie 1 und Genie 2 vorgestellt, die neue Umgebungen für Agenten generierten. Gleichzeitig gab es Fortschritte bei der Videogenerierung mit den Modellen Veo 2 und Veo 3, die ein tiefes Verständnis intuitiver Physik zeigen. Genie 3 ist das erste Modell, das Interaktionen in Echtzeit ermöglicht und zugleich Konsistenz und Realismus gegenüber Genie 2 verbessert.
Genie 3 kann auf Grundlage einer Textbeschreibung eine dynamische Welt erschaffen, durch die Sie in Echtzeit mit 24 Bildern pro Sekunde navigieren können – mit einer mehrere Minuten lang anhaltenden Konsistenz bei einer Auflösung von 720p. Das ist ein gewaltiger Sprung: Stellen Sie sich vor, Sie bewegen sich durch eine Vulkanlandschaft oder eine Unterwasserwelt und alles reagiert auf natürliche Weise. Sehen Sie sich das Beispielvideo an.
Die Fähigkeiten von Genie 3
Genie 3 zeichnet sich bei der Modellierung der physikalischen Eigenschaften der Welt aus. So kann es beispielsweise Naturphänomene wie Wasser, Beleuchtung oder komplexe Interaktionen innerhalb einer Umgebung simulieren. In einem Beispiel nehmen Sie die Perspektive eines Radroboters ein, der sich durch schwieriges Gelände in einem Vulkangebiet bewegt. Das Fahrzeug verfügt über robuste Geländereifen, die schwarzes Gestein zermalmen, und die Kamera zeigt eine Ich-Perspektive, sodass Sie die Vorderräder am unteren Bildrand sehen. In der Ferne steigen Rauch und fließende Lava aus dem Vulkan auf. Es gibt keine Anzeichen von Leben, dafür aber Lavateiche, denen der Agent auszuweichen versucht, sowie verstreute Felsformationen unter einem leuchtend blauen Himmel.
Ein weiteres Beispiel: eine Fahrt mit dem Jetski während eines Lichterfestivals. Oder ein Spaziergang auf einem Bürgersteig in Florida neben einer zweispurigen Straße und dem Meer während eines herannahenden Hurrikans – mit starkem Wind, Wellen, die über das Geländer schlagen, sich biegenden Palmen und heftigem Regen, wobei der Agent einen Regenmantel trägt.
Genie 3 simuliert außerdem die Natur mit vielfältigen Ökosystemen. Laufen entlang der Ufer eines Gletschersees, Erkunden verzweigter Waldwege, Überqueren von Gebirgsbächen in einer Umgebung aus verschneiten Bergen und Kiefernwäldern mit zahlreichen Wildtieren. Oder Schwimmen durch einen dunklen Ozean zwischen Canyons, inmitten von Quallenschwärmen und biolumineszenter Beleuchtung.
Sie möchten Orte und historische Umgebungen erkunden? Genie 3 bringt Sie in die Alpen mit steilen Felsen und Geröllschluchten, in die Kanäle Venedigs mit realistischen Wasserspiegelungen und alten Gebäuden oder in den Palast von Knossos auf Kreta während seiner Blütezeit. Sogar ein Spaziergang an einem sonnigen Tag durch Hinsdale in Illinois ist möglich – mit parkenden Autos und Vogelschwärmen am Himmel.
Technischer Durchbruch
Damit Genie 3 ein hohes Maß an Steuerbarkeit und Interaktion in Echtzeit erreichen konnte, waren bedeutende technische Innovationen erforderlich. Bei der Generierung jedes einzelnen Bildes muss das Modell die bisherige Trajektorie berücksichtigen, die mit der Zeit länger wird. Wenn Sie beispielsweise nach einer Minute an einen Ort zurückkehren, muss das Modell auf Informationen von vor einer Minute zurückgreifen. All dies muss als Reaktion auf neue Benutzereingaben mehrmals pro Sekunde geschehen.
Für ein immersives Erlebnis muss die Umgebung langfristig konsistent bleiben. Eine autoregressive Generierung ist komplexer als die Erzeugung eines vollständigen Videos, da sich Ungenauigkeiten summieren. Dennoch hält Genie 3 die Konsistenz mehrere Minuten lang aufrecht und verfügt über ein visuelles Gedächtnis, das bis zu einer Minute zurückreicht. Beispiele dafür sind das Streichen eines Hauses mit einer Farbrolle aus der Ich-Perspektive oder ein Spaziergang durch eine viktorianische Straße mit einem Portal in die Wüste, durch das sich der Agent teleportieren kann.
Eine weitere Neuerung sind durch Prompts steuerbare Weltereignisse – textbasierte Interaktionen, die die Welt verändern, etwa durch einen Wetterwechsel oder das Hinzufügen von Objekten und Figuren. Dadurch erweitern sich die Möglichkeiten für „Was-wäre-wenn“-Szenarien, die beim Training von Agenten nützlich sind.
Vergleich der Modelle
Für einen besseren Überblick finden Sie hier eine übersetzte Tabelle, die Genie 3 mit früheren Modellen vergleicht. Diese Tabelle basiert auf der bereitgestellten Abbildung und zeigt die wichtigsten Unterschiede.

Forschungsunterstützung und Einschränkungen
Genie 3 wurde mit dem SIMA-Agenten getestet, der in generierten Welten Ziele erfüllt, etwa sich in einer Bäckerei einem Mixer zu nähern oder zu Kühlregalen zu gehen. Dies verdeutlicht das Potenzial für das Training von Robotern und autonomen Systemen.
Dennoch gibt es Einschränkungen: einen begrenzten Aktionsraum, komplexe Interaktionen zwischen Agenten, ungenaue Simulationen realer Orte, Probleme mit Textdarstellungen und eine auf wenige Minuten begrenzte Interaktionsdauer.
Google DeepMind legt großen Wert auf Verantwortung – das Unternehmen arbeitet mit seinem Team für verantwortungsvolle Entwicklung zusammen, und Genie 3 ist ausschließlich im Rahmen einer begrenzten Forschungsvorschau für Wissenschaftler und Kreative verfügbar, um Feedback zu sammeln.



