Odyssey hat gerade Odyssey-2 veröffentlicht, ein neues interaktives Videomodell, das KI-Videos mit 20 Bildern pro Sekunde streamt. Nutzer können mehrere Minuten lange Videos mithilfe von Textbefehlen gestalten und steuern, während sie die Szene erkunden. Dieses System unterscheidet sich von anderen Videomodellen, die mehrere Minuten benötigen, um kurze Clips zu erstellen. Odyssey-2 beginnt sofort mit dem Videostreaming, wobei alle 50 Millisekunden neue Bilder erscheinen.
Das Modell generiert Videosegmente ohne vorherige Planung. Jedes neue Bild basiert darauf, was bereits geschehen ist und was die Nutzer in Echtzeit eingeben. Das bedeutet, dass sich das Video dynamisch und ohne festgelegtes Ende entwickelt. Da das Modell beispielsweise Physik und Dynamik aus Videodaten erlernt, kann es realistisches Verhalten simulieren, etwa die Bewegung von Wellen über das Wasser oder Veränderungen des Lichts auf Oberflächen.
Die Nutzer steuern die Entwicklung des Videos über natürlichsprachliche Befehle in einem Chatfenster, während das Video läuft. Die KI passt sich fortlaufend an jede Eingabe an, wodurch das Gefühl einer lebendigen Interaktion entsteht. Odyssey-2 basiert auf einem kausalen und autoregressiven Ansatz, bei dem jedes Bild ausschließlich anhand der vorherigen Bilder und Nutzeraktionen entsteht, ohne Kenntnis der Zukunft.

Geschwindigkeit und technische Details von Odyssey-2
Odyssey-2 erreicht eine Geschwindigkeit von bis zu 30 Bildern pro Sekunde, wobei jedes Bild in weniger als 50 Millisekunden generiert wird. Diese Geschwindigkeit verändert das gesamte Erlebnis, denn statt auf einen kurzen Clip zu warten, erhalten Sie einen sofortigen Stream, der auf Ihre Befehle reagiert. Das Modell wurde auf der Ebene der Architektur, der Datenpipeline und des Inferenz-Stacks optimiert, um Geschwindigkeit, Qualität und Reaktionsfähigkeit in Einklang zu bringen.
Das System erlernt komplexe physikalische Phänomene aus Videodaten mehrerer Jahrzehnte. Bei der Erzeugung von Meereswellen schätzt es beispielsweise aus vorherigen Bildern die Neigung der Oberfläche, ihre Krümmung und das Geschwindigkeitsfeld und prognostiziert anschließend die nächste Bewegung – der Wellenkamm bewegt sich weiter, Senken füllen sich, Schaum treibt umher und die Welle biegt sich um einen Felsen. All dies geschieht in Echtzeit, wodurch das Modell zu einem impliziten Weltsimulator wird.
Odyssey-2 streamt Videos von mehr als fünf Minuten Länge und bewahrt dabei die Kohärenz der Umgebung. Für die Leistung nutzt es Cluster aus Nvidia-H100-GPUs, wobei die Betriebskosten 1–2 Dollar pro Nutzerstunde betragen. Die Datenerfassung erfolgt mithilfe einer 360-Grad-Kamera in einem Rucksack, um realistische Ausgaben zu erzielen.
Vergleich mit der Konkurrenz
Odyssey-2 fühlt sich anders an als andere KI-Videoplattformen wie Veo oder Sora. Es ist eher ein hybrider Weltgenerator als lediglich ein Werkzeug zur Erstellung von Clips. Auch wenn die Qualität möglicherweise nicht so beeindruckend ist wie bei anderen Modellen, bieten die Echtzeitfähigkeit und die offene Erkundung ein enormes Potenzial für neue Inhaltserlebnisse.
Das Modell konzentriert sich auf offene Interaktivität, bei der Handlungen zu jedem beliebigen Zeitpunkt alle möglichen Zukunftsverläufe verändern. Dies ermöglicht ein kontinuierliches Videostreaming, das zuhört, sich anpasst und reagiert. Odyssey-2 baut auf Odyssey-1 auf, das sich auf Navigation und Langzeitgedächtnis konzentrierte, und erweitert diesen Ansatz um Textbefehle sowie bald auch Audiobefehle.
Anwendungen und Zukunft von Odyssey-2
Odyssey-2 eröffnet neue Anwendungsmöglichkeiten in den Bereichen Gaming, Film, Bildung, soziale Netzwerke, Werbung, Training und Simulationen. Stellen Sie sich vor, Sie könnten durch ein altes Foto spazieren und Erinnerungen erkunden oder an einer geführten Tour durch eine antike Zivilisation teilnehmen. Für Kreative lässt sich das Modell in Werkzeuge wie Unreal Engine, Blender und Adobe After Effects integrieren.
Dieses System vollzieht den Übergang von einem statischen zu einem emergenten Medium, bei dem das Video auf den Nutzer reagiert. Es befindet sich noch in einer frühen Phase, doch Odyssey-2 bietet ein Erlebnis, das einem Gespräch mit einem Sprachmodell ähnelt – Sie schreiben etwas, und das Video antwortet sofort. Die Qualität ist derzeit noch unausgereift und manchmal instabil, doch die Entwicklung schreitet in Richtung größerer Realitätsnähe und Interaktivität voran.



