ElevenLabs Eleven v3 ist das neueste und fortschrittlichste Modell zur Umwandlung von Text in Sprache, das ElevenLabs offiziell für alle Nutzer freigegeben hat. Das Modell, das zuvor nur als Alpha-Version verfügbar war, bietet nun eine deutlich verbesserte Stabilität und Genauigkeit bei der Textverarbeitung.
Fortschrittliches Sprachmodell Eleven v3
Eleven v3 ist das ausdrucksstärkste KI-Sprachmodell von ElevenLabs mit außergewöhnlicher emotionaler Tiefe und facettenreicher Wiedergabe. Im Gegensatz zu früheren Modellen bietet es einen großen Dynamikumfang, der sich mithilfe von Inline-Audio-Tags direkt im Text steuern lässt. Das Modell unterstützt mehr als 70 Sprachen, darunter Tschechisch, und ermöglicht die Erstellung natürlicher Dialoge zwischen mehreren Sprechern.
Eine wichtige Neuerung ist der Dialogmodus (Dialogue Mode), der mehrere Stimmen zu einem flüssigen Gespräch verbindet. Die Sprecher teilen Kontext und Emotionen, wodurch natürlich klingende Dialoge entstehen, die an echte menschliche Kommunikation erinnern.
Dramatische Verbesserung der Genauigkeit
Seit der Alpha-Version wurde Eleven v3 erheblich verbessert. In Tests bevorzugten die Nutzer die neue Version in 72 % der Fälle gegenüber der vorherigen Alpha-Version. Die größten Fortschritte wurden bei der präzisen Verarbeitung von Zahlen, Symbolen und spezieller Notation über verschiedene Sprachen hinweg erzielt.
Die Gesamtfehlerrate sank um 68 % – von ursprünglich 15,3 % auf nur noch 4,9 %. Das Modell kann nun den Kontext korrekt interpretieren und entscheiden, wie ein Text ausgesprochen werden soll. Beispielsweise las das Modell die Telefonnummer "+49 170 9876543" zuvor als "plus neunundvierzig, einhundertsiebzig, neun Millionen ..." vor, anstatt die einzelnen Ziffern korrekt auszusprechen.
Beispiele für konkrete Korrekturen sind das korrekte Vorlesen von Währungen (¥250,000 jetzt als "250,000 Yen" statt "25,000 Yen"), chemischen Formeln (SO₂ als "S O zwei" statt des verstümmelten "Schwefel doppelt") oder Sportergebnissen (102-98 als "einhundertzwei zu achtundneunzig" statt "einhundertzwei minus achtundneunzig").
Steuerung von Emotionen und Soundeffekten
Eleven v3 ermöglicht mithilfe von Audio-Tags die vollständige Kontrolle über Emotionen, Regieanweisungen und Soundeffekte. Nutzer können Tags wie [slowly] (langsam), [whispers] (flüstert), [chuckles] (kichert), [sad] (traurig) oder [excited] (aufgeregt) in den Text einfügen, die das Modell interpretiert und auf die erzeugte Stimme anwendet.
Das Modell unterstützt eine breite Palette von Audio-Tags, die teilweise von der Stimme und vom Kontext abhängig sind. Diese Funktion erzeugt eine steuerbare, ausdrucksstarke Sprache mit mehreren Ebenen von Emotionen, Audioereignissen und immersiven Klanglandschaften.
Verfügbarkeit
Eleven v3 ist jetzt allgemein verfügbar – auf allen Plattformen, einschließlich Mobilgeräten. Entwickler können das Modell über eine öffentliche API nutzen, die sowohl die standardmäßige Umwandlung von Text in Sprache als auch die exklusive Funktion für Dialoge zwischen mehreren Sprechern unterstützt. Das Modell stellt einen deutlichen Fortschritt gegenüber dem vorherigen Eleven v2 dar, das nur 29 Sprachen und grundlegende Tags wie Pausen unterstützte. Eleven v3 bietet eine vollständige Palette von Emotionen, Regieanweisungen und Soundeffekten sowie die Unterstützung mehrerer Sprecher im Dialogmodus.



