ElevenLabs stellt Eleven v3 vor: volle Kontrolle über Emotionen und Soundeffekte

ElevenLabs stellt Eleven v3 vor: volle Kontrolle über Emotionen und Soundeffekte

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
5. 2. 2026
2 Minuten Lesezeit · 3 Aufrufe
ElevenLabs stellt Eleven v3 vor: volle Kontrolle über Emotionen und Soundeffekte

ElevenLabs Eleven v3 ist das neueste und fortschrittlichste Modell zur Umwandlung von Text in Sprache, das ElevenLabs offiziell für alle Nutzer freigegeben hat. Das Modell, das zuvor nur als Alpha-Version verfügbar war, bietet nun eine deutlich verbesserte Stabilität und Genauigkeit bei der Textverarbeitung.

Fortschrittliches Sprachmodell Eleven v3

Eleven v3 ist das ausdrucksstärkste KI-Sprachmodell von ElevenLabs mit außergewöhnlicher emotionaler Tiefe und facettenreicher Wiedergabe. Im Gegensatz zu früheren Modellen bietet es einen großen Dynamikumfang, der sich mithilfe von Inline-Audio-Tags direkt im Text steuern lässt. Das Modell unterstützt mehr als 70 Sprachen, darunter Tschechisch, und ermöglicht die Erstellung natürlicher Dialoge zwischen mehreren Sprechern.

Eine wichtige Neuerung ist der Dialogmodus (Dialogue Mode), der mehrere Stimmen zu einem flüssigen Gespräch verbindet. Die Sprecher teilen Kontext und Emotionen, wodurch natürlich klingende Dialoge entstehen, die an echte menschliche Kommunikation erinnern.

Dramatische Verbesserung der Genauigkeit

Seit der Alpha-Version wurde Eleven v3 erheblich verbessert. In Tests bevorzugten die Nutzer die neue Version in 72 % der Fälle gegenüber der vorherigen Alpha-Version. Die größten Fortschritte wurden bei der präzisen Verarbeitung von Zahlen, Symbolen und spezieller Notation über verschiedene Sprachen hinweg erzielt.

Die Gesamtfehlerrate sank um 68 % – von ursprünglich 15,3 % auf nur noch 4,9 %. Das Modell kann nun den Kontext korrekt interpretieren und entscheiden, wie ein Text ausgesprochen werden soll. Beispielsweise las das Modell die Telefonnummer "+49 170 9876543" zuvor als "plus neunundvierzig, einhundertsiebzig, neun Millionen ..." vor, anstatt die einzelnen Ziffern korrekt auszusprechen.

Tabelle der Fehlerraten
Tabelle der Fehlerraten.

Beispiele für konkrete Korrekturen sind das korrekte Vorlesen von Währungen (¥250,000 jetzt als "250,000 Yen" statt "25,000 Yen"), chemischen Formeln (SO₂ als "S O zwei" statt des verstümmelten "Schwefel doppelt") oder Sportergebnissen (102-98 als "einhundertzwei zu achtundneunzig" statt "einhundertzwei minus achtundneunzig").

Steuerung von Emotionen und Soundeffekten

Eleven v3 ermöglicht mithilfe von Audio-Tags die vollständige Kontrolle über Emotionen, Regieanweisungen und Soundeffekte. Nutzer können Tags wie [slowly] (langsam), [whispers] (flüstert), [chuckles] (kichert), [sad] (traurig) oder [excited] (aufgeregt) in den Text einfügen, die das Modell interpretiert und auf die erzeugte Stimme anwendet.

Das Modell unterstützt eine breite Palette von Audio-Tags, die teilweise von der Stimme und vom Kontext abhängig sind. Diese Funktion erzeugt eine steuerbare, ausdrucksstarke Sprache mit mehreren Ebenen von Emotionen, Audioereignissen und immersiven Klanglandschaften.

Verfügbarkeit

Eleven v3 ist jetzt allgemein verfügbar – auf allen Plattformen, einschließlich Mobilgeräten. Entwickler können das Modell über eine öffentliche API nutzen, die sowohl die standardmäßige Umwandlung von Text in Sprache als auch die exklusive Funktion für Dialoge zwischen mehreren Sprechern unterstützt. Das Modell stellt einen deutlichen Fortschritt gegenüber dem vorherigen Eleven v2 dar, das nur 29 Sprachen und grundlegende Tags wie Pausen unterstützte. Eleven v3 bietet eine vollständige Palette von Emotionen, Regieanweisungen und Soundeffekten sowie die Unterstützung mehrerer Sprecher im Dialogmodus.

Werbung

Inhalte entstehen mit Unterstützung von UpTier.

SEO und GEO auf Autopilot. Die Multiagentensysteme von UpTier schreiben und optimieren Inhalte für Suchmaschinen und KI-Antworten.

UpTier entdecken ↗

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Codex erhält wiederverwendbare Cloud-Umgebungen mit Zugriff von jedem Gerät ausCodex erhält wiederverwendbare Cloud-Umgebungen mit Zugriff von jedem Gerät aus
OpenAI erweitert Codex um wiederverwendbare Cloud-Arbeitsumgebungen. Hinzu kommen Sprachsteuerung im CLI, Code-Reviews in der ChatGPT-Desktop-App und Sicherheitsprüfungen für GitHub-Repositories.
2 Min. Lesezeit
2. 10. 2026
Amazon veröffentlicht Strands Decider 2B für Entscheidungen in Agenten-WorkflowsAmazon veröffentlicht Strands Decider 2B für Entscheidungen in Agenten-Workflows
Strands Decider 2B wählt zwischen vorgegebenen Optionen und liefert dazu einen Konfidenzwert. Das neue Entscheidungsmodell von AWS ist vollständig Open Source und lässt sich lokal betreiben.
2 Min. Lesezeit
1. 10. 2026
ChatGPT erhält Space für die Teamarbeit mit KI-AgentenChatGPT erhält Space für die Teamarbeit mit KI-Agenten
OpenAI erweitert ChatGPT um den gemeinsamen Arbeitsraum Space und den Dokumenteditor Pages. Präsentationen sollen sich ebenfalls im Chat erstellen und gemeinsam bearbeiten lassen; Slides soll in den kommenden Wochen folgen.
1 Min. Lesezeit
1. 10. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok