Neues Modell Odyssey-2 verwandelt Videos in lebendige Welten

Neues Modell Odyssey-2 verwandelt Videos in lebendige Welten

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
29. 10. 2025
3 Minuten Lesezeit · 4 Aufrufe
Neues Modell Odyssey-2 verwandelt Videos in lebendige Welten

Odyssey hat gerade Odyssey-2 veröffentlicht, ein neues interaktives Videomodell, das KI-Videos mit 20 Bildern pro Sekunde streamt. Nutzer können mehrere Minuten lange Videos mithilfe von Textbefehlen gestalten und steuern, während sie die Szene erkunden. Dieses System unterscheidet sich von anderen Videomodellen, die mehrere Minuten benötigen, um kurze Clips zu erstellen. Odyssey-2 beginnt sofort mit dem Videostreaming, wobei alle 50 Millisekunden neue Bilder erscheinen.

Das Modell generiert Videosegmente ohne vorherige Planung. Jedes neue Bild basiert darauf, was bereits geschehen ist und was die Nutzer in Echtzeit eingeben. Das bedeutet, dass sich das Video dynamisch und ohne festgelegtes Ende entwickelt. Da das Modell beispielsweise Physik und Dynamik aus Videodaten erlernt, kann es realistisches Verhalten simulieren, etwa die Bewegung von Wellen über das Wasser oder Veränderungen des Lichts auf Oberflächen.

Die Nutzer steuern die Entwicklung des Videos über natürlichsprachliche Befehle in einem Chatfenster, während das Video läuft. Die KI passt sich fortlaufend an jede Eingabe an, wodurch das Gefühl einer lebendigen Interaktion entsteht. Odyssey-2 basiert auf einem kausalen und autoregressiven Ansatz, bei dem jedes Bild ausschließlich anhand der vorherigen Bilder und Nutzeraktionen entsteht, ohne Kenntnis der Zukunft.

Beispiel I

Geschwindigkeit und technische Details von Odyssey-2

Odyssey-2 erreicht eine Geschwindigkeit von bis zu 30 Bildern pro Sekunde, wobei jedes Bild in weniger als 50 Millisekunden generiert wird. Diese Geschwindigkeit verändert das gesamte Erlebnis, denn statt auf einen kurzen Clip zu warten, erhalten Sie einen sofortigen Stream, der auf Ihre Befehle reagiert. Das Modell wurde auf der Ebene der Architektur, der Datenpipeline und des Inferenz-Stacks optimiert, um Geschwindigkeit, Qualität und Reaktionsfähigkeit in Einklang zu bringen.

Das System erlernt komplexe physikalische Phänomene aus Videodaten mehrerer Jahrzehnte. Bei der Erzeugung von Meereswellen schätzt es beispielsweise aus vorherigen Bildern die Neigung der Oberfläche, ihre Krümmung und das Geschwindigkeitsfeld und prognostiziert anschließend die nächste Bewegung – der Wellenkamm bewegt sich weiter, Senken füllen sich, Schaum treibt umher und die Welle biegt sich um einen Felsen. All dies geschieht in Echtzeit, wodurch das Modell zu einem impliziten Weltsimulator wird.

Odyssey-2 streamt Videos von mehr als fünf Minuten Länge und bewahrt dabei die Kohärenz der Umgebung. Für die Leistung nutzt es Cluster aus Nvidia-H100-GPUs, wobei die Betriebskosten 1–2 Dollar pro Nutzerstunde betragen. Die Datenerfassung erfolgt mithilfe einer 360-Grad-Kamera in einem Rucksack, um realistische Ausgaben zu erzielen.
Beispiel II

Vergleich mit der Konkurrenz

Odyssey-2 fühlt sich anders an als andere KI-Videoplattformen wie Veo oder Sora. Es ist eher ein hybrider Weltgenerator als lediglich ein Werkzeug zur Erstellung von Clips. Auch wenn die Qualität möglicherweise nicht so beeindruckend ist wie bei anderen Modellen, bieten die Echtzeitfähigkeit und die offene Erkundung ein enormes Potenzial für neue Inhaltserlebnisse.

Das Modell konzentriert sich auf offene Interaktivität, bei der Handlungen zu jedem beliebigen Zeitpunkt alle möglichen Zukunftsverläufe verändern. Dies ermöglicht ein kontinuierliches Videostreaming, das zuhört, sich anpasst und reagiert. Odyssey-2 baut auf Odyssey-1 auf, das sich auf Navigation und Langzeitgedächtnis konzentrierte, und erweitert diesen Ansatz um Textbefehle sowie bald auch Audiobefehle.

Anwendungen und Zukunft von Odyssey-2

Odyssey-2 eröffnet neue Anwendungsmöglichkeiten in den Bereichen Gaming, Film, Bildung, soziale Netzwerke, Werbung, Training und Simulationen. Stellen Sie sich vor, Sie könnten durch ein altes Foto spazieren und Erinnerungen erkunden oder an einer geführten Tour durch eine antike Zivilisation teilnehmen. Für Kreative lässt sich das Modell in Werkzeuge wie Unreal Engine, Blender und Adobe After Effects integrieren.

Dieses System vollzieht den Übergang von einem statischen zu einem emergenten Medium, bei dem das Video auf den Nutzer reagiert. Es befindet sich noch in einer frühen Phase, doch Odyssey-2 bietet ein Erlebnis, das einem Gespräch mit einem Sprachmodell ähnelt – Sie schreiben etwas, und das Video antwortet sofort. Die Qualität ist derzeit noch unausgereift und manchmal instabil, doch die Entwicklung schreitet in Richtung größerer Realitätsnähe und Interaktivität voran.

Werbung

Inhalte entstehen mit Unterstützung von UpTier.

SEO und GEO auf Autopilot. Die Multiagentensysteme von UpTier schreiben und optimieren Inhalte für Suchmaschinen und KI-Antworten.

UpTier entdecken ↗

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

ChatGPT führt virtuelle Anprobe für Kleidung und Accessoires einChatGPT führt virtuelle Anprobe für Kleidung und Accessoires ein
OpenAI startet weltweit zwei Shopping-Funktionen in ChatGPT: Nutzer können Kleidung und Accessoires auf einem eigenen Foto visualisieren und ausgewählte Produkte mit Favorites speichern.
1 Min. Lesezeit
2. 10. 2026
Codex erhält wiederverwendbare Cloud-Umgebungen mit Zugriff von jedem Gerät ausCodex erhält wiederverwendbare Cloud-Umgebungen mit Zugriff von jedem Gerät aus
OpenAI erweitert Codex um wiederverwendbare Cloud-Arbeitsumgebungen. Hinzu kommen Sprachsteuerung im CLI, Code-Reviews in der ChatGPT-Desktop-App und Sicherheitsprüfungen für GitHub-Repositories.
2 Min. Lesezeit
2. 10. 2026
Amazon veröffentlicht Strands Decider 2B für Entscheidungen in Agenten-WorkflowsAmazon veröffentlicht Strands Decider 2B für Entscheidungen in Agenten-Workflows
Strands Decider 2B wählt zwischen vorgegebenen Optionen und liefert dazu einen Konfidenzwert. Das neue Entscheidungsmodell von AWS ist vollständig Open Source und lässt sich lokal betreiben.
2 Min. Lesezeit
1. 10. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok