ElevenLabs stellt Eleven v3 vor: volle Kontrolle über Emotionen und Soundeffekte

ElevenLabs stellt Eleven v3 vor: volle Kontrolle über Emotionen und Soundeffekte

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
5. 2. 2026
2 Minuten Lesezeit
ElevenLabs stellt Eleven v3 vor: volle Kontrolle über Emotionen und Soundeffekte

ElevenLabs Eleven v3 ist das neueste und fortschrittlichste Modell zur Umwandlung von Text in Sprache, das ElevenLabs offiziell für alle Nutzer freigegeben hat. Das Modell, das zuvor nur als Alpha-Version verfügbar war, bietet nun eine deutlich verbesserte Stabilität und Genauigkeit bei der Textverarbeitung.

Fortschrittliches Sprachmodell Eleven v3

Eleven v3 ist das ausdrucksstärkste KI-Sprachmodell von ElevenLabs mit außergewöhnlicher emotionaler Tiefe und facettenreicher Wiedergabe. Im Gegensatz zu früheren Modellen bietet es einen großen Dynamikumfang, der sich mithilfe von Inline-Audio-Tags direkt im Text steuern lässt. Das Modell unterstützt mehr als 70 Sprachen, darunter Tschechisch, und ermöglicht die Erstellung natürlicher Dialoge zwischen mehreren Sprechern.

Eine wichtige Neuerung ist der Dialogmodus (Dialogue Mode), der mehrere Stimmen zu einem flüssigen Gespräch verbindet. Die Sprecher teilen Kontext und Emotionen, wodurch natürlich klingende Dialoge entstehen, die an echte menschliche Kommunikation erinnern.

Dramatische Verbesserung der Genauigkeit

Seit der Alpha-Version wurde Eleven v3 erheblich verbessert. In Tests bevorzugten die Nutzer die neue Version in 72 % der Fälle gegenüber der vorherigen Alpha-Version. Die größten Fortschritte wurden bei der präzisen Verarbeitung von Zahlen, Symbolen und spezieller Notation über verschiedene Sprachen hinweg erzielt.

Die Gesamtfehlerrate sank um 68 % – von ursprünglich 15,3 % auf nur noch 4,9 %. Das Modell kann nun den Kontext korrekt interpretieren und entscheiden, wie ein Text ausgesprochen werden soll. Beispielsweise las das Modell die Telefonnummer "+49 170 9876543" zuvor als "plus neunundvierzig, einhundertsiebzig, neun Millionen ..." vor, anstatt die einzelnen Ziffern korrekt auszusprechen.

Tabelle der Fehlerraten
Tabelle der Fehlerraten.

Beispiele für konkrete Korrekturen sind das korrekte Vorlesen von Währungen (¥250,000 jetzt als "250,000 Yen" statt "25,000 Yen"), chemischen Formeln (SO₂ als "S O zwei" statt des verstümmelten "Schwefel doppelt") oder Sportergebnissen (102-98 als "einhundertzwei zu achtundneunzig" statt "einhundertzwei minus achtundneunzig").

Steuerung von Emotionen und Soundeffekten

Eleven v3 ermöglicht mithilfe von Audio-Tags die vollständige Kontrolle über Emotionen, Regieanweisungen und Soundeffekte. Nutzer können Tags wie [slowly] (langsam), [whispers] (flüstert), [chuckles] (kichert), [sad] (traurig) oder [excited] (aufgeregt) in den Text einfügen, die das Modell interpretiert und auf die erzeugte Stimme anwendet.

Das Modell unterstützt eine breite Palette von Audio-Tags, die teilweise von der Stimme und vom Kontext abhängig sind. Diese Funktion erzeugt eine steuerbare, ausdrucksstarke Sprache mit mehreren Ebenen von Emotionen, Audioereignissen und immersiven Klanglandschaften.

Verfügbarkeit

Eleven v3 ist jetzt allgemein verfügbar – auf allen Plattformen, einschließlich Mobilgeräten. Entwickler können das Modell über eine öffentliche API nutzen, die sowohl die standardmäßige Umwandlung von Text in Sprache als auch die exklusive Funktion für Dialoge zwischen mehreren Sprechern unterstützt. Das Modell stellt einen deutlichen Fortschritt gegenüber dem vorherigen Eleven v2 dar, das nur 29 Sprachen und grundlegende Tags wie Pausen unterstützte. Eleven v3 bietet eine vollständige Palette von Emotionen, Regieanweisungen und Soundeffekten sowie die Unterstützung mehrerer Sprecher im Dialogmodus.

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Altman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamenAltman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamen
OpenAI-Chef Sam Altman erklärte in einer Folge des Podcasts Relentless, die Menschheit sei bereits in die Singularität eingetreten. „Wir sind jetzt gewissermaßen in der Singularität“, sagte er wörtlich. Ein Begriff, der jahrzehntelang eher zur Science-Fiction gehörte
6 Min. Lesezeit
28. 7. 2026
KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.
Australische Radios spielen seit April Madonnas Dance-Version von Like a Prayer in Dauerschleife. Veröffentlicht vom Queensland-DJ Josh Fawaz, führt sie die Radiocharts an und hat auf Spotify 35 Millionen Streams.
5 Min. Lesezeit
28. 7. 2026
Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?
Der Ego-Shooter läuft direkt im Browser, bietet eine eigene Physik und elf separate Codebereiche. Insgesamt rund 55.000 Zeilen, verteilt auf elf Subsysteme und aufgebaut auf Thr
4 Min. Lesezeit
28. 7. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok