ElevenLabs hat laut AlphaSignal zwei neue Sprachmodelle eingeführt: Eleven v4 für Erzähltexte und die Darstellung von Figuren sowie Turbo für Sprachagenten mit geringer Latenz. Zu den Neuerungen gehören eine gezieltere Steuerung des Stimmeinsatzes und Stimmenklonen aus einer zehnsekündigen Aufnahme; v4 bietet außerdem phonetische Vorgaben für die Aussprache.
Mehr Sprachen und gezielte Aussprachekontrolle
Die beiden Varianten setzen laut AlphaSignal unterschiedliche Schwerpunkte. Während Eleven v4 auf vertonte Erzählungen und Figurenstimmen ausgerichtet ist, priorisiert Turbo die schnelle Sprachausgabe für Agenten. Beide bieten zusätzliche Möglichkeiten, den stimmlichen Ausdruck zu steuern, und unterstützen mehr als 90 Sprachen. Bei v3 lag die Zahl noch bei ungefähr 70.
Für Eleven v4 nennt AlphaSignal zusätzlich Aussprachevorgaben mit IPA, dem Internationalen Phonetischen Alphabet. Diese Lautschrift steuert die Aussprache, während die ebenfalls eingeführten Ausdruckskontrollen den stimmlichen Vortrag beeinflussen. Die Erweiterung der Sprachunterstützung gilt dagegen für beide neuen Varianten.
Neue Stimmklone und Umstellung vorhandener Stimmen
Für die neue Generation hat ElevenLabs nach dem Bericht von AlphaSignal das System zum Stimmenklonen überarbeitet. Beim sofortigen Klonen lässt sich bereits aus einer zehn Sekunden langen Aufnahme eine Stimme erzeugen. Zugleich kehrt das professionelle Stimmenklonen zurück, das in v3 nicht verfügbar war.
Bei vorhandenen Stimmen erfordert der Wechsel jedoch einen eigenen Arbeitsschritt. Sowohl professionelle als auch sofortige Klone, die vor v4 erstellt wurden, müssen laut AlphaSignal für den wirksamen Einsatz mit dem neuen Modell erneut trainiert werden. Anwendungen, die bereits die Konvertierungs-API von ElevenLabs aufrufen, können v4 durch Ändern des Modellbezeichners auswählen. Das erneute Training der Stimmen bleibt von dieser Änderung getrennt.
Bessere Aussprache als v3, aber nicht in jeder Kategorie führend
Im Test zur Robustheit der Aussprache von Artificial Analysis erreicht Eleven v4 nach Angaben von AlphaSignal insgesamt 91,7 Prozent gegenüber 85,6 Prozent bei v3. Das ist der höchste bisher in diesem Benchmark gemessene Gesamtwert. Menschliche Bewertende vergleichen dafür erzeugte Audioausschnitte mit zuvor festgelegten Aussprachen. Geprüft werden unter anderem Abkürzungen, kontextabhängige Wörter und Zeichenfolgen.
Beim korrekten Auflösen von Abkürzungen berichtet AlphaSignal einen Wert von 94,1 Prozent für v4; v3 kam auf 82,7 Prozent. Auch bei der Wahl der Aussprache anhand des Satzkontexts erzielt v4 94,1 Prozent. In dieser Kategorie führt allerdings Gemini 3.8 Flash mit 97,9 Prozent.
Bei einzelnen Ausdrücken ohne Satzkontext liegt v4 laut AlphaSignal mit 93,2 Prozent hinter dem führenden v3 Conversational mit 95,1 Prozent. Die schwächste Kategorie des neuen Modells bleibt das genaue Vorlesen von Identifikatoren und Zeichenketten: Hier erzielt es 78,8 Prozent. Das ist besser als die 71,2 Prozent von v3, liegt aber unter den 85,7 Prozent des führenden SpaceXAI TTS.
Eleven v4 führt die englische Provider Voice Arena an
In der englischen Provider Voice Arena stand Eleven v4 zum Veröffentlichungszeitpunkt des AlphaSignal-Berichts mit 1.319 Elo an erster Stelle. Cartesia Sonic 3.6 folgte mit 1.276, Gemini 3.8 Flash TTS mit 1.267. Das Ergebnis von v4 beruhte auf 1.674 bewerteten Hörproben. Diese Arena verwendet die jeweiligen eigenen Stimmen und Standardkonfigurationen der Modelle; der Elo-Wert bildet die Präferenzen der Zuhörenden in direkten Vergleichen ab.
Die Controlled-Voice-Rangliste vergleicht dagegen nach dem Bericht von AlphaSignal alle Systeme mit derselben geklonten Stimme. Dort belegt Eleven v4 mit 1.157 Elo den zweiten Platz hinter Alibaba Qwen-Audio-3.1-TTS-Plus mit 1.178. Die gemeinsame Stimme reduziert in diesem Vergleich den Einfluss der unterschiedlichen Stimmenkataloge der Anbieter.
In acht der neun nichtenglischen Sprachranglisten von Artificial Analysis liegt laut AlphaSignal weiterhin Cartesia Sonic 3.6 vorn.
Schnellere Synthese und Streaming mit Turbo
Artificial Analysis hat laut AlphaSignal bei Eleven v4 eine Synthesegeschwindigkeit von 73,4 erzeugten Zeichen pro Sekunde gemessen, gegenüber 42,5 bei v3. Der Wert beschreibt den Durchsatz der Spracherzeugung. Netzwerkverzögerungen, die Antwortzeit eines Sprachmodells und die Audiowiedergabe auf dem Endgerät sind darin nicht enthalten.
Für Turbo nennt AlphaSignal einen Median von 150 Millisekunden bis zur ersten Audioausgabe sowie Unterstützung für bidirektionales Streaming. Gemessen wird dabei die Zeit von der Syntheseanfrage bis zum ersten zurückgegebenen Audioblock. Die Gesamtlatenz eines Sprachagenten hängt zusätzlich von den Netzwerkbedingungen, der Textgenerierung durch das Sprachmodell, der Pufferung und der Wiedergabe ab.
Zugang über API und Creator+
Laut AlphaSignal beträgt der reguläre API-Preis für Eleven v4 80 Dollar je Million Zeichen. Das entspricht ungefähr dem 1,6-Fachen des Preises von Sonic 3.6 und dem 4,9-Fachen des Preises von Gemini 3.8 Flash TTS. Eine zweiwöchige Einführungsaktion senkt den Preis auf 22 Dollar für v4 und 11 Dollar für Turbo je Million Zeichen. Die Preise können je nach Tarif, Volumenvereinbarung und enthaltenen Guthaben variieren. Wer ein berechtigtes Creator+-Abonnement hat, kann v4 innerhalb seiner monatlichen Guthabenlimits ohne zusätzlichen Modellaufschlag nutzen.



