Microsoft veröffentlicht MAI-Transcribe-2-Streaming für Live-Audio

Microsoft veröffentlicht MAI-Transcribe-2-Streaming für Live-Audio

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
2. 10. 2026
2 Minuten Lesezeit
Artikel anhören
Audioversion des Artikels
Microsoft veröffentlicht MAI-Transcribe-2-Streaming für Live-Audio

Microsoft AI hat MAI-Transcribe-2-Streaming veröffentlicht und erweitert seine Spracherkennung damit um die Verarbeitung von Live-Audio. Das Modell gibt bereits während des Audioempfangs vorläufigen Text aus. Es ergänzt die Batch-Variante für abgeschlossene Aufnahmen: Für den Beginn der Transkription muss das Ende einer Aufnahme nicht mehr abgewartet werden.

Geringere Fehlerrate als Grok im finalen Transkript

Zum Zeitpunkt der Veröffentlichung belegte MAI-Transcribe-2-Streaming bei Artificial Analysis unter 38 Modellen den ersten Platz nach der Wortfehlerrate des finalen Transkripts. Der Evaluator ermittelte eine Word Error Rate (WER) von 2,5 % und eine Latenz von 0,13 Sekunden nach dem Ende der Spracheingabe. Grok Voice Transcribe 2.0 erreichte im selben Vergleich 2,7 % WER bei 0,49 Sekunden.

Die niedrigste Fehlerrate ging jedoch nicht mit der kürzesten Wartezeit einher. Bei Artificial Analysis lieferte Cartesia Ink Preview das finale Transkript nach 0,11 Sekunden und damit schneller als Microsofts Modell mit 0,13 Sekunden. Die Fehlerrate lag bei Cartesia allerdings bei 3,1 %, gegenüber 2,5 % bei MAI-Transcribe-2-Streaming.

Erster vorläufiger Text nach 0,12 Sekunden im Test

Artificial Analysis bewertet auch den ersten vorläufigen Transkriptionsstand, nicht nur den fertigen Text. In dieser Auswertung erreichte MAI-Transcribe-2-Streaming eine WER von 2,5 % bei einer Latenz von 0,12 Sekunden. Für Grok Voice Transcribe 2.0 lagen die Werte bei 3,4 % und 0,49 Sekunden.

Auch bei diesem Zwischenergebnis gab es einen schnelleren Konkurrenten: Cartesia Ink-2 benötigte laut Artificial Analysis 0,07 Sekunden bis zum ersten vorläufigen Transkript. Seine Wortfehlerrate betrug dabei 4,0 %, gegenüber den 2,5 % des Microsoft-Modells.

MAI-Transcribe-Familie mit 60 Sprachen und Sprechertrennung

Microsoft nennt für die MAI-Transcribe-Familie einen mehrsprachigen Ansatz mit einem einzigen Modell für 60 Sprachen. Zu den aufgeführten Funktionen gehören außerdem die Unterscheidung von Sprechern und Zeitmarken für einzelne Wörter. Welche dieser Funktionen verfügbar sind, kann vom verwendeten Endpoint abhängen.

Für Namen und Fachbegriffe führt Microsoft zudem Keyword Biasing an: Vorgegebene Schlüsselwörter werden bei der Erkennung bevorzugt berücksichtigt. Für die Ausgabe nennt das Unternehmen zwei Varianten, einen wortgetreuen und einen bereinigten Text.

Voice Live API startet als öffentliche Preview

Für Live-Audio ist MAI-Transcribe-2-Streaming über die Voice Live API zugänglich. Diese Schnittstelle ist von der Fast Transcription API getrennt, die für bereits aufgenommene Audiodateien verwendet wird. Der Live-Zugang befindet sich in einer öffentlichen Preview ohne Service-Level Agreement (SLA); Microsoft rät wegen der fehlenden vertraglichen Servicegarantie vom Einsatz dieser Preview im Produktionsbetrieb ab.

Die Streaming-Variante kostet 0,54 US-Dollar je Audiostunde und damit genauso viel wie Gemini 3.5 Transcribe Live, aber mehr als ElevenLabs Scribe v2 Realtime und Deepgram Flux; für den Batch-Modell MAI-Transcribe-2 gilt bis Ende 2026 ein Aktionspreis von 0,10 US-Dollar je Audiostunde.

Werbung

Inhalte entstehen mit Unterstützung von UpTier.

SEO und GEO auf Autopilot. Die Multiagentensysteme von UpTier schreiben und optimieren Inhalte für Suchmaschinen und KI-Antworten.

UpTier entdecken ↗

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

CoreWeave startet Forge für Training und Verbesserung von KI-AgentenCoreWeave startet Forge für Training und Verbesserung von KI-Agenten
Forge verbindet Modelltraining, Auswertung und die Weiterentwicklung von KI-Agenten. Teams können eigene Produktionsdaten für das Nachtraining nutzen, ohne einen eigenen Trainingscluster betreiben zu müssen.
3 Min. Lesezeit
2. 10. 2026
ChatGPT führt virtuelle Anprobe für Kleidung und Accessoires einChatGPT führt virtuelle Anprobe für Kleidung und Accessoires ein
OpenAI startet weltweit zwei Shopping-Funktionen in ChatGPT: Nutzer können Kleidung und Accessoires auf einem eigenen Foto visualisieren und ausgewählte Produkte mit Favorites speichern.
1 Min. Lesezeit
2. 10. 2026
Codex erhält wiederverwendbare Cloud-Umgebungen mit Zugriff von jedem Gerät ausCodex erhält wiederverwendbare Cloud-Umgebungen mit Zugriff von jedem Gerät aus
OpenAI erweitert Codex um wiederverwendbare Cloud-Arbeitsumgebungen. Hinzu kommen Sprachsteuerung im CLI, Code-Reviews in der ChatGPT-Desktop-App und Sicherheitsprüfungen für GitHub-Repositories.
2 Min. Lesezeit
2. 10. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok