Wan 2.2: KI-Videogenerierung aus dem Tongyi Lab
Die Alibaba Group hat über ihr Forschungszentrum Tongyi Lab eine völlig neue Generation ihres Modells zur Videogenerierung namens Wan 2.2 vorgestellt. Dieser Fortschritt im Bereich der künstlichen Intelligenz wird als Open-Source-Lösung angeboten, die weltweit einschließlich der Tschechischen Republik verfügbar ist.
Technische Innovationen und MoE-Architektur
Wan 2.2 führt eine bahnbrechende Architektur namens Mixture-of-Experts (Expertenmischung) ein, die bisher noch nicht in Modellen zur Videogenerierung eingesetzt wurde. Diese Architektur verteilt den Entrauschungsprozess (Denoising) mithilfe spezialisierter Expertenmodelle auf verschiedene Zeitschritte. Konkret verwendet das Modell zwei Expertensysteme: einen Experten für hohen Rauschpegel in den Anfangsphasen, der sich auf das Gesamtlayout konzentriert, und einen Experten für niedrigen Rauschpegel in den späteren Phasen, der die Details des Videos verfeinert.
Jedes Expertenmodell umfasst etwa 14 Milliarden Parameter, was insgesamt 27 Milliarden Parametern entspricht, wobei in jedem Schritt nur 14 Milliarden aktiv sind. Diese Lösung erhöht die Gesamtkapazität des Modells erheblich und behält gleichzeitig die gleichen Rechenkosten wie bei den vorherigen Versionen bei.

Datengrundlage und Leistung
Im Vergleich zum Vorgängermodell Wan 2.1 wurde Wan 2.2 mit einem deutlich größeren Datensatz trainiert, der 65,6 % mehr Bilder und 83,2 % mehr Videos enthält. Diese Erweiterung verbessert die Fähigkeit des Modells, über zahlreiche Dimensionen hinweg zu generalisieren, darunter Bewegungen, Semantik und Ästhetik.
Im neuen Benchmark Wan-Bench 2.0 übertrifft Wan 2.2 die führenden kommerziellen Modelle in den meisten wichtigen Bewertungsdimensionen. Das Modell erzielt unter allen Open-Source- und kommerziellen Modellen im Bereich der Videogenerierung die beste Leistung.

Filmische Kontrolle und kreative Möglichkeiten
Wan 2.2 ermöglicht professionelles filmisches Storytelling durch eine tiefgreifende Kontrolle der Filmsprache. Das Modell bietet eine präzise Steuerung von Beleuchtung, Farben und Komposition für vielseitige Stile mit fein ausgearbeiteten Details. Benutzer können komplexe Bewegungssequenzen mit verbesserter Flüssigkeit und Kontrolle erstellen.
Das Modell kann komplexe Szenen mit mehreren Objekten verarbeiten und detaillierten Anweisungen präzise folgen. Beispiele hierfür sind die Generierung dynamischer Hip-Hop-Tanzszenen, Kampfsequenzen, Parkour-Aktionen oder akrobatischer Darbietungen auf einem Flugzeug in der Luft.
Drei Hauptvarianten des Modells
Wan AI hat drei Hauptvarianten des Modells Wan 2.2 veröffentlicht:
Wan 2.2-T2V-A14B ist ein Text-zu-Video-Modell, das die Generierung 5-sekündiger Videos in den Auflösungen 480P und 720P unterstützt. Es basiert auf der Mixture-of-Experts-Architektur und erzielt eine hervorragende Qualität bei der Videogenerierung.
Wan 2.2-I2V-A14B wurde speziell für die Generierung von Videos aus Bildern entwickelt und unterstützt die Auflösungen 480P und 720P. Dank der MoE-Architektur ermöglicht es eine stabilere Videosynthese mit weniger unrealistischen Kamerabewegungen und bietet eine verbesserte Unterstützung für vielfältige stilisierte Szenen.
Wan 2.2-TI2V-5B ist ein Hybridmodell, das auf dem fortschrittlichen Wan 2.2-VAE basiert, das ein Kompressionsverhältnis von 16×16×4 erreicht. Dieses Modell unterstützt sowohl die Generierung von Text zu Video als auch von Bild zu Video in 720P-Auflösung mit 24 Bildern pro Sekunde und kann auf einzelnen Consumer-GPUs wie der NVIDIA 4090 ausgeführt werden.

Verfügbarkeit in der Tschechischen Republik
Wan 2.2 ist als Open-Source-Lösung weltweit einschließlich der Tschechischen Republik ohne jegliche regionale Einschränkungen verfügbar. Tschechische Benutzer können das Modell über die Plattformen GitHub, Hugging Face und ModelScope herunterladen und ausführen. Das Modell ist auch online über den Hugging Face Space verfügbar, wo das TI2V-5B-Modell getestet werden kann.
Für die lokale Ausführung wird Hardware benötigt, die PyTorch 2.4.0 und höhere Versionen unterstützt und über ausreichende Rechenressourcen verfügt. Das TI2V-5B-Modell kann ohne spezielle Optimierung auf einer einzelnen Consumer-GPU in weniger als 9 Minuten ein 5-sekündiges Video in 720P-Auflösung generieren.
Preispolitik und Abonnement
Kostenlose Basisversion: Wan 2.2 ist in der grundlegenden Open-Source-Version sowohl für die persönliche als auch für die kommerzielle Nutzung völlig kostenlos. Benutzer können den Code und die Modelle kostenlos von GitHub, Hugging Face und anderen Plattformen herunterladen.
Wan 2.2 Plus: Für erweiterte Funktionen, Werkzeuge und Vorlagen gibt es eine kostenpflichtige Version namens „Wan 2.2 Plus“, die über die offizielle Website WanVideo verfügbar ist.
Hardwarekosten: Die einzigen Kosten, die entstehen können, sind die Kosten für die Rechenhardware oder die Nutzung cloudbasierter GPU-Dienste, die nicht von Wan AI festgelegt werden.
WanBox – umfassende Kreativplattform
Wan AI bietet außerdem die Kreativplattform WanBox an, mit der sich verschiedene kreative Aufgaben ausführen lassen, darunter Bildgenerierung, Videogenerierung und Videobearbeitung. Die Plattform bietet eine flexible Videobearbeitung mithilfe einer Zeitleiste zum Schneiden von Clips und zur weiteren Generierung von Inhalten.



