Microsoft veröffentlicht VibeVoice-1.5B: Neues offenes Modell für lange Gespräche

Microsoft veröffentlicht VibeVoice-1.5B: Neues offenes Modell für lange Gespräche

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
27. 8. 2025
4 Minuten Lesezeit
Microsoft veröffentlicht VibeVoice-1.5B: Neues offenes Modell für lange Gespräche

Microsoft veröffentlicht VibeVoice-1.5B: Neues offenes Modell für lange Gespräche

Egal, ob Sie im Bereich der künstlichen Intelligenz forschen oder einfach nur ein neugieriger Technikbegeisterter sind, das Modell VibeVoice-1.5B von Microsoft wird Sie sicherlich interessieren. Dieses offene Text-to-Speech-Modell bietet Innovationen, mit denen sich lange, natürliche Gespräche mit mehreren Sprechern erstellen lassen. Sehen wir uns an, was es genau kann, wie es funktioniert und wie es im Vergleich zur Konkurrenz abschneidet.

Was genau kann VibeVoice-1.5B?

VibeVoice-1.5B wurde für die Erzeugung ausdrucksstarker, langer Audioinhalte mit mehreren Sprechern entwickelt, etwa Podcasts oder Dialoge. Es kann in einer einzigen Ausgabe bis zu 90 Minuten lange Sprache mit bis zu vier unterschiedlichen Sprechern synthetisieren. Das ist ein großer Fortschritt gegenüber herkömmlichen Modellen, die in der Regel auf einen oder zwei Sprecher beschränkt sind. Das Modell verwendet kontinuierliche Sprach-Tokenisierer (akustisch und semantisch) mit einer extrem niedrigen Frequenz von 7,5 Hz, was eine hohe Klangtreue bei der effizienten Verarbeitung langer Sequenzen gewährleistet.

Die Grundlage bildet das große Transformer-Sprachmodell (LLM) Qwen2.5-1.5B, das den Textkontext und den Dialogfluss versteht. Hinzu kommt ein Diffusions-Head zur Erzeugung von Klangdetails. Der akustische Tokenisierer basiert auf einer Variante des σ-VAE mit einer Encoder-Decoder-Struktur, die bei einer Eingabe mit 24 kHz eine 3200-fache Reduzierung der Abtastrate erreicht. Jeder Teil des Encoders und Decoders verfügt über etwa 340 Millionen Parameter. Der semantische Tokenisierer übernimmt die Architektur des akustischen Tokenisierers, wird jedoch für die automatische Spracherkennung trainiert.

Das Modell unterstützt ausdrucksstarke Elemente, einschließlich spontanen Gesangs, und funktioniert hauptsächlich auf Englisch und Chinesisch. Während der Inferenz benötigt es nur etwa 7 GB GPU-Speicher, wodurch es auch auf gängiger Hardware eingesetzt werden kann. Das Training erfolgte in mehreren Phasen: zunächst wurden die Tokenisierer separat trainiert, danach das gesamte Modell mit schrittweise zunehmender Sequenzlänge bis zu 65.536 Token. Insgesamt verfügt das Modell über 2,7 Milliarden Parameter und wurde für Forschungszwecke unter der MIT-Lizenz veröffentlicht.

Wie funktioniert es in der Praxis und wo liegen die Grenzen?

In der Praxis überzeugt VibeVoice-1.5B bei der Erstellung natürlicher Gespräche mit wechselnden Sprechern. Es verwendet einen Diffusionsprozess mit klassifikatorfreier Steuerung für eine bessere Qualität. Das Modell fügt automatisch den hörbaren Hinweis „Dieses Segment wurde von einer KI generiert“ in jede Ausgabe ein und versieht sie außerdem mit einem unsichtbaren Wasserzeichen zur Überprüfung der Herkunft, was Missbrauch vorbeugen soll.

Doch nicht alles ist perfekt. Das Modell konzentriert sich ausschließlich auf Sprache und erzeugt daher weder Musik noch Soundeffekte oder sich überlagernde Stimmen. Vollständig unterstützt werden nur Englisch und Chinesisch – andere Sprachen können zu unverständlichen oder ungenauen Ergebnissen führen. Es ist nicht für kommerzielle Anwendungen wie die Imitation von Stimmen ohne Zustimmung oder die Verbreitung von Desinformationen vorgesehen. Zu den Risiken gehört das Potenzial für Deepfakes, weshalb Microsoft eine verantwortungsvolle Nutzung und die Meldung von Problemen per E-Mail an [email protected] empfiehlt.

Vergleich mit der Konkurrenz: Wo zeichnet sich VibeVoice aus?

Im Vergleich zu Konkurrenten wie Whisper von OpenAI oder ElevenLabs kann sich VibeVoice-1.5B gut behaupten. Whisper ist in erster Linie ein Modell zur Umwandlung von Sprache in Text (ASR) und nicht zur Sprachsynthese, sodass es nicht direkt konkurriert – es überzeugt bei der Transkription in Dutzenden von Sprachen, erzeugt jedoch keine Audioinhalte. VibeVoice hingegen ist bei der Ausgabelänge (bis zu 90 Minuten) und der Unterstützung mehrerer Sprecher (bis zu 4 Sprecher) führend, was Whisper nicht bietet.

Gegenüber ElevenLabs, einem kommerziellen TTS-Dienst mit Unterstützung für 29 Sprachen und Hunderte von Stimmen, bietet VibeVoice Offenheit (es ist Open Source) und Effizienz auf gängiger Hardware. ElevenLabs überzeugt durch emotionale Authentizität und bei kurzen Ausgaben, ist jedoch auf kürzere Längen beschränkt und proprietär. VibeVoice ergänzt einzigartige Elemente wie Gesang und ethische Schutzmaßnahmen wie Wasserzeichen, während ElevenLabs dies mit einem eigenen Klassifikator löst.

Andere Modelle wie Deepgram oder wav2vec 2.0 konzentrieren sich eher auf ASR als auf TTS und unterscheiden sich hinsichtlich Geschwindigkeit oder Spezialisierung. VibeVoice-1.5B zeichnet sich daher durch offene, lange Sprachsynthese mit mehreren Sprechern aus, bleibt bei der sprachlichen Vielfalt jedoch hinter kommerziellen Lösungen zurück. Insgesamt ist es ein hervorragendes Forschungswerkzeug, das die Grenzen dessen erweitert, was TTS leisten kann.

Wenn Sie mehr erfahren möchten, lesen Sie den technischen Bericht auf arXiv oder besuchen Sie das GitHub-Repository microsoft/VibeVoice. Dieses Modell zeigt, wie sich künstliche Intelligenz einem natürlichen menschlichen Dialog annähert – und das vollkommen offen und verantwortungsvoll. Was halten Sie davon?

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Altman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamenAltman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamen
OpenAI-Chef Sam Altman erklärte in einer Folge des Podcasts Relentless, die Menschheit sei bereits in die Singularität eingetreten. „Wir sind jetzt gewissermaßen in der Singularität“, sagte er wörtlich. Ein Begriff, der jahrzehntelang eher zur Science-Fiction gehörte
6 Min. Lesezeit
28. 7. 2026
KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.
Australische Radios spielen seit April Madonnas Dance-Version von Like a Prayer in Dauerschleife. Veröffentlicht vom Queensland-DJ Josh Fawaz, führt sie die Radiocharts an und hat auf Spotify 35 Millionen Streams.
5 Min. Lesezeit
28. 7. 2026
Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?
Der Ego-Shooter läuft direkt im Browser, bietet eine eigene Physik und elf separate Codebereiche. Insgesamt rund 55.000 Zeilen, verteilt auf elf Subsysteme und aufgebaut auf Thr
4 Min. Lesezeit
28. 7. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok