AlphaSignal: Eleven v4 klont Stimmen aus zehnsekündigen Aufnahmen

AlphaSignal: Eleven v4 klont Stimmen aus zehnsekündigen Aufnahmen

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
30. 9. 2026
4 Minuten Lesezeit · 1 Aufrufe
Artikel anhören
Audioversion des Artikels
AlphaSignal: Eleven v4 klont Stimmen aus zehnsekündigen Aufnahmen

ElevenLabs hat laut AlphaSignal zwei neue Sprachmodelle eingeführt: Eleven v4 für Erzähltexte und die Darstellung von Figuren sowie Turbo für Sprachagenten mit geringer Latenz. Zu den Neuerungen gehören eine gezieltere Steuerung des Stimmeinsatzes und Stimmenklonen aus einer zehnsekündigen Aufnahme; v4 bietet außerdem phonetische Vorgaben für die Aussprache.

Mehr Sprachen und gezielte Aussprachekontrolle

Die beiden Varianten setzen laut AlphaSignal unterschiedliche Schwerpunkte. Während Eleven v4 auf vertonte Erzählungen und Figurenstimmen ausgerichtet ist, priorisiert Turbo die schnelle Sprachausgabe für Agenten. Beide bieten zusätzliche Möglichkeiten, den stimmlichen Ausdruck zu steuern, und unterstützen mehr als 90 Sprachen. Bei v3 lag die Zahl noch bei ungefähr 70.

Für Eleven v4 nennt AlphaSignal zusätzlich Aussprachevorgaben mit IPA, dem Internationalen Phonetischen Alphabet. Diese Lautschrift steuert die Aussprache, während die ebenfalls eingeführten Ausdruckskontrollen den stimmlichen Vortrag beeinflussen. Die Erweiterung der Sprachunterstützung gilt dagegen für beide neuen Varianten.

Neue Stimmklone und Umstellung vorhandener Stimmen

Für die neue Generation hat ElevenLabs nach dem Bericht von AlphaSignal das System zum Stimmenklonen überarbeitet. Beim sofortigen Klonen lässt sich bereits aus einer zehn Sekunden langen Aufnahme eine Stimme erzeugen. Zugleich kehrt das professionelle Stimmenklonen zurück, das in v3 nicht verfügbar war.

Bei vorhandenen Stimmen erfordert der Wechsel jedoch einen eigenen Arbeitsschritt. Sowohl professionelle als auch sofortige Klone, die vor v4 erstellt wurden, müssen laut AlphaSignal für den wirksamen Einsatz mit dem neuen Modell erneut trainiert werden. Anwendungen, die bereits die Konvertierungs-API von ElevenLabs aufrufen, können v4 durch Ändern des Modellbezeichners auswählen. Das erneute Training der Stimmen bleibt von dieser Änderung getrennt.

Bessere Aussprache als v3, aber nicht in jeder Kategorie führend

Im Test zur Robustheit der Aussprache von Artificial Analysis erreicht Eleven v4 nach Angaben von AlphaSignal insgesamt 91,7 Prozent gegenüber 85,6 Prozent bei v3. Das ist der höchste bisher in diesem Benchmark gemessene Gesamtwert. Menschliche Bewertende vergleichen dafür erzeugte Audioausschnitte mit zuvor festgelegten Aussprachen. Geprüft werden unter anderem Abkürzungen, kontextabhängige Wörter und Zeichenfolgen.

Beim korrekten Auflösen von Abkürzungen berichtet AlphaSignal einen Wert von 94,1 Prozent für v4; v3 kam auf 82,7 Prozent. Auch bei der Wahl der Aussprache anhand des Satzkontexts erzielt v4 94,1 Prozent. In dieser Kategorie führt allerdings Gemini 3.8 Flash mit 97,9 Prozent.

Bei einzelnen Ausdrücken ohne Satzkontext liegt v4 laut AlphaSignal mit 93,2 Prozent hinter dem führenden v3 Conversational mit 95,1 Prozent. Die schwächste Kategorie des neuen Modells bleibt das genaue Vorlesen von Identifikatoren und Zeichenketten: Hier erzielt es 78,8 Prozent. Das ist besser als die 71,2 Prozent von v3, liegt aber unter den 85,7 Prozent des führenden SpaceXAI TTS.

Eleven v4 führt die englische Provider Voice Arena an

In der englischen Provider Voice Arena stand Eleven v4 zum Veröffentlichungszeitpunkt des AlphaSignal-Berichts mit 1.319 Elo an erster Stelle. Cartesia Sonic 3.6 folgte mit 1.276, Gemini 3.8 Flash TTS mit 1.267. Das Ergebnis von v4 beruhte auf 1.674 bewerteten Hörproben. Diese Arena verwendet die jeweiligen eigenen Stimmen und Standardkonfigurationen der Modelle; der Elo-Wert bildet die Präferenzen der Zuhörenden in direkten Vergleichen ab.

Die Controlled-Voice-Rangliste vergleicht dagegen nach dem Bericht von AlphaSignal alle Systeme mit derselben geklonten Stimme. Dort belegt Eleven v4 mit 1.157 Elo den zweiten Platz hinter Alibaba Qwen-Audio-3.1-TTS-Plus mit 1.178. Die gemeinsame Stimme reduziert in diesem Vergleich den Einfluss der unterschiedlichen Stimmenkataloge der Anbieter.

In acht der neun nichtenglischen Sprachranglisten von Artificial Analysis liegt laut AlphaSignal weiterhin Cartesia Sonic 3.6 vorn.

Schnellere Synthese und Streaming mit Turbo

Artificial Analysis hat laut AlphaSignal bei Eleven v4 eine Synthesegeschwindigkeit von 73,4 erzeugten Zeichen pro Sekunde gemessen, gegenüber 42,5 bei v3. Der Wert beschreibt den Durchsatz der Spracherzeugung. Netzwerkverzögerungen, die Antwortzeit eines Sprachmodells und die Audiowiedergabe auf dem Endgerät sind darin nicht enthalten.

Für Turbo nennt AlphaSignal einen Median von 150 Millisekunden bis zur ersten Audioausgabe sowie Unterstützung für bidirektionales Streaming. Gemessen wird dabei die Zeit von der Syntheseanfrage bis zum ersten zurückgegebenen Audioblock. Die Gesamtlatenz eines Sprachagenten hängt zusätzlich von den Netzwerkbedingungen, der Textgenerierung durch das Sprachmodell, der Pufferung und der Wiedergabe ab.

Zugang über API und Creator+

Laut AlphaSignal beträgt der reguläre API-Preis für Eleven v4 80 Dollar je Million Zeichen. Das entspricht ungefähr dem 1,6-Fachen des Preises von Sonic 3.6 und dem 4,9-Fachen des Preises von Gemini 3.8 Flash TTS. Eine zweiwöchige Einführungsaktion senkt den Preis auf 22 Dollar für v4 und 11 Dollar für Turbo je Million Zeichen. Die Preise können je nach Tarif, Volumenvereinbarung und enthaltenen Guthaben variieren. Wer ein berechtigtes Creator+-Abonnement hat, kann v4 innerhalb seiner monatlichen Guthabenlimits ohne zusätzlichen Modellaufschlag nutzen.

Werbung

Inhalte entstehen mit Unterstützung von UpTier.

SEO und GEO auf Autopilot. Die Multiagentensysteme von UpTier schreiben und optimieren Inhalte für Suchmaschinen und KI-Antworten.

UpTier entdecken ↗

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Amazon veröffentlicht Strands Decider 2B für Entscheidungen in Agenten-WorkflowsAmazon veröffentlicht Strands Decider 2B für Entscheidungen in Agenten-Workflows
Strands Decider 2B wählt zwischen vorgegebenen Optionen und liefert dazu einen Konfidenzwert. Das neue Entscheidungsmodell von AWS ist vollständig Open Source und lässt sich lokal betreiben.
2 Min. Lesezeit
1. 10. 2026
ChatGPT erhält Space für die Teamarbeit mit KI-AgentenChatGPT erhält Space für die Teamarbeit mit KI-Agenten
OpenAI erweitert ChatGPT um den gemeinsamen Arbeitsraum Space und den Dokumenteditor Pages. Präsentationen sollen sich ebenfalls im Chat erstellen und gemeinsam bearbeiten lassen; Slides soll in den kommenden Wochen folgen.
1 Min. Lesezeit
1. 10. 2026
AlphaSignal: d1 von Liquid AI liefert Entscheidungen statt TextAlphaSignal: d1 von Liquid AI liefert Entscheidungen statt Text
Laut AlphaSignal hat Liquid AI d1 veröffentlicht. Das Modell liefert strukturierte Entscheidungen mit Wahrscheinlichkeiten, statt Text zu erzeugen, und verbindet Klassifikation und Bewertung in einem API-Aufruf.
3 Min. Lesezeit
30. 9. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok