Microsoft veröffentlicht VibeVoice-1.5B: Neues offenes Modell für lange Gespräche

Microsoft veröffentlicht VibeVoice-1.5B: Neues offenes Modell für lange Gespräche

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
27. 8. 2025
4 Minuten Lesezeit · 3 Aufrufe
Microsoft veröffentlicht VibeVoice-1.5B: Neues offenes Modell für lange Gespräche

Microsoft veröffentlicht VibeVoice-1.5B: Neues offenes Modell für lange Gespräche

Egal, ob Sie im Bereich der künstlichen Intelligenz forschen oder einfach nur ein neugieriger Technikbegeisterter sind, das Modell VibeVoice-1.5B von Microsoft wird Sie sicherlich interessieren. Dieses offene Text-to-Speech-Modell bietet Innovationen, mit denen sich lange, natürliche Gespräche mit mehreren Sprechern erstellen lassen. Sehen wir uns an, was es genau kann, wie es funktioniert und wie es im Vergleich zur Konkurrenz abschneidet.

Was genau kann VibeVoice-1.5B?

VibeVoice-1.5B wurde für die Erzeugung ausdrucksstarker, langer Audioinhalte mit mehreren Sprechern entwickelt, etwa Podcasts oder Dialoge. Es kann in einer einzigen Ausgabe bis zu 90 Minuten lange Sprache mit bis zu vier unterschiedlichen Sprechern synthetisieren. Das ist ein großer Fortschritt gegenüber herkömmlichen Modellen, die in der Regel auf einen oder zwei Sprecher beschränkt sind. Das Modell verwendet kontinuierliche Sprach-Tokenisierer (akustisch und semantisch) mit einer extrem niedrigen Frequenz von 7,5 Hz, was eine hohe Klangtreue bei der effizienten Verarbeitung langer Sequenzen gewährleistet.

Die Grundlage bildet das große Transformer-Sprachmodell (LLM) Qwen2.5-1.5B, das den Textkontext und den Dialogfluss versteht. Hinzu kommt ein Diffusions-Head zur Erzeugung von Klangdetails. Der akustische Tokenisierer basiert auf einer Variante des σ-VAE mit einer Encoder-Decoder-Struktur, die bei einer Eingabe mit 24 kHz eine 3200-fache Reduzierung der Abtastrate erreicht. Jeder Teil des Encoders und Decoders verfügt über etwa 340 Millionen Parameter. Der semantische Tokenisierer übernimmt die Architektur des akustischen Tokenisierers, wird jedoch für die automatische Spracherkennung trainiert.

Das Modell unterstützt ausdrucksstarke Elemente, einschließlich spontanen Gesangs, und funktioniert hauptsächlich auf Englisch und Chinesisch. Während der Inferenz benötigt es nur etwa 7 GB GPU-Speicher, wodurch es auch auf gängiger Hardware eingesetzt werden kann. Das Training erfolgte in mehreren Phasen: zunächst wurden die Tokenisierer separat trainiert, danach das gesamte Modell mit schrittweise zunehmender Sequenzlänge bis zu 65.536 Token. Insgesamt verfügt das Modell über 2,7 Milliarden Parameter und wurde für Forschungszwecke unter der MIT-Lizenz veröffentlicht.

Wie funktioniert es in der Praxis und wo liegen die Grenzen?

In der Praxis überzeugt VibeVoice-1.5B bei der Erstellung natürlicher Gespräche mit wechselnden Sprechern. Es verwendet einen Diffusionsprozess mit klassifikatorfreier Steuerung für eine bessere Qualität. Das Modell fügt automatisch den hörbaren Hinweis „Dieses Segment wurde von einer KI generiert“ in jede Ausgabe ein und versieht sie außerdem mit einem unsichtbaren Wasserzeichen zur Überprüfung der Herkunft, was Missbrauch vorbeugen soll.

Doch nicht alles ist perfekt. Das Modell konzentriert sich ausschließlich auf Sprache und erzeugt daher weder Musik noch Soundeffekte oder sich überlagernde Stimmen. Vollständig unterstützt werden nur Englisch und Chinesisch – andere Sprachen können zu unverständlichen oder ungenauen Ergebnissen führen. Es ist nicht für kommerzielle Anwendungen wie die Imitation von Stimmen ohne Zustimmung oder die Verbreitung von Desinformationen vorgesehen. Zu den Risiken gehört das Potenzial für Deepfakes, weshalb Microsoft eine verantwortungsvolle Nutzung und die Meldung von Problemen per E-Mail an [email protected] empfiehlt.

Vergleich mit der Konkurrenz: Wo zeichnet sich VibeVoice aus?

Im Vergleich zu Konkurrenten wie Whisper von OpenAI oder ElevenLabs kann sich VibeVoice-1.5B gut behaupten. Whisper ist in erster Linie ein Modell zur Umwandlung von Sprache in Text (ASR) und nicht zur Sprachsynthese, sodass es nicht direkt konkurriert – es überzeugt bei der Transkription in Dutzenden von Sprachen, erzeugt jedoch keine Audioinhalte. VibeVoice hingegen ist bei der Ausgabelänge (bis zu 90 Minuten) und der Unterstützung mehrerer Sprecher (bis zu 4 Sprecher) führend, was Whisper nicht bietet.

Gegenüber ElevenLabs, einem kommerziellen TTS-Dienst mit Unterstützung für 29 Sprachen und Hunderte von Stimmen, bietet VibeVoice Offenheit (es ist Open Source) und Effizienz auf gängiger Hardware. ElevenLabs überzeugt durch emotionale Authentizität und bei kurzen Ausgaben, ist jedoch auf kürzere Längen beschränkt und proprietär. VibeVoice ergänzt einzigartige Elemente wie Gesang und ethische Schutzmaßnahmen wie Wasserzeichen, während ElevenLabs dies mit einem eigenen Klassifikator löst.

Andere Modelle wie Deepgram oder wav2vec 2.0 konzentrieren sich eher auf ASR als auf TTS und unterscheiden sich hinsichtlich Geschwindigkeit oder Spezialisierung. VibeVoice-1.5B zeichnet sich daher durch offene, lange Sprachsynthese mit mehreren Sprechern aus, bleibt bei der sprachlichen Vielfalt jedoch hinter kommerziellen Lösungen zurück. Insgesamt ist es ein hervorragendes Forschungswerkzeug, das die Grenzen dessen erweitert, was TTS leisten kann.

Wenn Sie mehr erfahren möchten, lesen Sie den technischen Bericht auf arXiv oder besuchen Sie das GitHub-Repository microsoft/VibeVoice. Dieses Modell zeigt, wie sich künstliche Intelligenz einem natürlichen menschlichen Dialog annähert – und das vollkommen offen und verantwortungsvoll. Was halten Sie davon?

Werbung

Inhalte entstehen mit Unterstützung von UpTier.

SEO und GEO auf Autopilot. Die Multiagentensysteme von UpTier schreiben und optimieren Inhalte für Suchmaschinen und KI-Antworten.

UpTier entdecken ↗

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

ChatGPT führt virtuelle Anprobe für Kleidung und Accessoires einChatGPT führt virtuelle Anprobe für Kleidung und Accessoires ein
OpenAI startet weltweit zwei Shopping-Funktionen in ChatGPT: Nutzer können Kleidung und Accessoires auf einem eigenen Foto visualisieren und ausgewählte Produkte mit Favorites speichern.
1 Min. Lesezeit
2. 10. 2026
Codex erhält wiederverwendbare Cloud-Umgebungen mit Zugriff von jedem Gerät ausCodex erhält wiederverwendbare Cloud-Umgebungen mit Zugriff von jedem Gerät aus
OpenAI erweitert Codex um wiederverwendbare Cloud-Arbeitsumgebungen. Hinzu kommen Sprachsteuerung im CLI, Code-Reviews in der ChatGPT-Desktop-App und Sicherheitsprüfungen für GitHub-Repositories.
2 Min. Lesezeit
2. 10. 2026
Amazon veröffentlicht Strands Decider 2B für Entscheidungen in Agenten-WorkflowsAmazon veröffentlicht Strands Decider 2B für Entscheidungen in Agenten-Workflows
Strands Decider 2B wählt zwischen vorgegebenen Optionen und liefert dazu einen Konfidenzwert. Das neue Entscheidungsmodell von AWS ist vollständig Open Source und lässt sich lokal betreiben.
2 Min. Lesezeit
1. 10. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok