Seedance 2.0 ist ein fortschrittliches KI-Modell zur Videogenerierung, das vom chinesischen Unternehmen ByteDance entwickelt wurde. Das Modell kann professionelle Videos in einer Auflösung von 1080p bis 2K aus Textbeschreibungen, Bildern, Videos und Audiospuren erstellen. Es handelt sich um ein multimodales System, das eine beispiellose Kontrolle über die resultierenden Inhalte bietet.
Was kann Seedance 2.0?
Das Modell verwendet eine Dual-Branch-Diffusion-Transformer-Architektur, die gleichzeitig visuelle Inhalte und nativen Ton generiert. Nutzer können eine Textbeschreibung eingeben oder Bilder hochladen und erhalten innerhalb von 60 Sekunden ein 4 bis 15 Sekunden langes Video. Seedance 2.0 kann aus einem einzigen Prompt kohärente Sequenzen mit mehreren Szenen erstellen, wobei es automatisch die narrative Logik analysiert und eine konsistente Darstellung der Figuren beibehält.
Zu den wichtigsten Fähigkeiten gehört ein fortschrittliches semantisches Verständnis, das eine präzise Kontrolle über die Interaktionen mehrerer Objekte, komplexe Aktionen und verschiedene Kamerabewegungen ermöglicht. Das Modell beherrscht physikalisch präzise Simulationen – Objekte fallen, kollidieren und interagieren gemäß den Regeln der realen Welt. Die Bewegungen sind flüssig und weisen einen natürlichen Impuls sowie ein natürliches Timing auf.
Seedance 2.0 akzeptiert bis zu 9 Bilder, 3 Videos (insgesamt maximal 15 Sekunden), 3 MP3-Audiodateien (insgesamt maximal 15 Sekunden) und Text-Prompts. Das Gesamtlimit liegt bei 12 Dateien pro Generierung. Das System verwendet @-Erwähnungen, um festzulegen, wie jede hochgeladene Datei verwendet werden soll.
Nutzer können beispielsweise schreiben: „@Image1 als erstes Bild, @Video1 als Referenz für die Kamerabewegung, @Audio1 als Hintergrundmusik verwenden.“ Das Modell kann komplexe Choreografien, Kameratechniken, Schnittrhythmen oder spezielle Bewegungen wie den Hitchcock-Zoom extrahieren und anwenden.
Konsistenz von Figuren und Objekten
Frühere Modelle hatten Schwierigkeiten, die Identität über mehrere Einzelbilder hinweg beizubehalten. Seedance 2.0 löst dieses Problem direkt – die Gesichter der Figuren bleiben konsistent, Produktdetails einschließlich Logos und Texten bleiben präzise und der visuelle Stil verändert sich während der Generierung nicht. Dies ist entscheidend für die Erstellung von Werbeinhalten, E-Commerce-Videos oder Geschichten mit wiederkehrenden Figuren.
Nativer Ton und Synchronisierung
Das Modell generiert Videos mit nativem Ton und kann die Inhalte mit Referenz-Audio synchronisieren. Es unterstützt lippensynchrone Dialoge in mehreren Sprachen, einschließlich Tschechisch, zu den Aktionen auf dem Bildschirm passende Soundeffekte, dem visuellen Rhythmus folgende Hintergrundmusik und schauspielerische Sprachleistungen mit emotionalem Ausdruck.
Kontroverse Funktion und ihre Aussetzung
Bei einem kürzlich durchgeführten Test entdeckte Pan Tianhong, Gründer des Technologiemediums MediaStorm, dass das Hochladen eines persönlichen Fotos dazu führte, dass das Modell eine Stimme erzeugte, die seiner tatsächlichen Stimme nahezu identisch war – ohne Verwendung irgendwelcher Sprachproben oder autorisierter Daten. Diese Entdeckung löste schnell öffentliche Bedenken hinsichtlich der Fälschung von Identitäten mithilfe von KI aus. Daher gaben die Betreiber der Plattform Jimeng (der chinesische Name der Seedance-2.0-App) bekannt: „Um ein gesundes und nachhaltiges kreatives Umfeld zu erhalten, aktualisieren wir das Modell dringend und setzen die Funktion mit sofortiger Wirkung aus, die es ermöglicht, echte Fotos oder Videos als Referenzsubjekte zu verwenden.“
ByteDance führte zugleich einen Live-Verifizierungsschritt in den Apps Jimeng und Doubao ein, der von Nutzern verlangt, vor der Erstellung eines digitalen Avatars ihr eigenes Bild und ihre eigene Stimme hochzuladen. Das Unternehmen betonte, dass diese Anpassungen darauf ausgelegt seien, Verantwortlichkeit zu gewährleisten und zugleich Innovation mit der Einhaltung regulatorischer Vorgaben in Einklang zu bringen.
Wie Seedance 2.0 bedient wird
Das Modell ist als Webanwendung verfügbar, die ohne Download in den wichtigsten Browsern funktioniert. Nutzer melden sich an und können mit kostenlosen Credits beginnen oder auf kostenpflichtige Tarife upgraden. Der grundlegende Workflow lautet: Prompt eingeben, Stil auswählen, generieren und herunterladen.
Für die Arbeit mit Referenzen gibt es zwei Modi: den First/Last Frame Mode für die einfache Erstellung mit einem Startbild und einem Prompt sowie den Universal Reference Mode für multimodale Kombinationen. Nutzer laden Dateien hoch und verweisen im Prompt mithilfe der @-Syntax darauf.
Preismodelle
Seedance 2.0 basiert auf einem Credit-System. Jede Erstellung eines Videos in 1080p-Auflösung erfordert je nach Länge und Auflösung Credits. Es stehen drei Tarife zur Verfügung: Basic für 247 Kč monatlich (bei jährlicher Zahlung) bietet 800 Credits pro Monat, was für bis zu 80 Videos ausreicht. Professional für 497 Kč monatlich bietet 2.000 Credits (bis zu 200 Videos). Enterprise für 1.247 Kč monatlich umfasst 6.000 Credits (bis zu 600 Videos) und priorisierten Support.
Praktische Anwendung
Seedance 2.0 findet Anwendung in Werbung und E-Commerce, etwa zur Erstellung von Produktdemonstrationen mit synchronisiertem Kommentar. Es ermöglicht die Lokalisierung von Inhalten – die Generierung mehrsprachiger Video-Adaptionen mit nativer Lippensynchronisation. Kreative können statische Storyboards in animierte Sequenzen umwandeln oder durch das Hochladen eines Referenzvideos Inhalte anhand von Vorlagen erstellen.
Das Modell befindet sich weiterhin in der Phase interner Tests, wobei ByteDance proaktive Maßnahmen ergreift, etwa die Einschränkung bestimmter Funktionen und die Verstärkung der Inhaltskontrolle, um potenzielle Risiken zu mindern. Branchenbeobachter bleiben hinsichtlich des Potenzials von Seedance 2.0 für KI-Kurzdramen und animierte Serien optimistisch, betonen jedoch, dass jede Anwendung in der realen Welt auf Sicherheit, Kontrolle und Verantwortlichkeit beruhen muss.
Quelle: technode.com



