Microsoft AI hat MAI-Transcribe-2-Streaming veröffentlicht und erweitert seine Spracherkennung damit um die Verarbeitung von Live-Audio. Das Modell gibt bereits während des Audioempfangs vorläufigen Text aus. Es ergänzt die Batch-Variante für abgeschlossene Aufnahmen: Für den Beginn der Transkription muss das Ende einer Aufnahme nicht mehr abgewartet werden.
Geringere Fehlerrate als Grok im finalen Transkript
Zum Zeitpunkt der Veröffentlichung belegte MAI-Transcribe-2-Streaming bei Artificial Analysis unter 38 Modellen den ersten Platz nach der Wortfehlerrate des finalen Transkripts. Der Evaluator ermittelte eine Word Error Rate (WER) von 2,5 % und eine Latenz von 0,13 Sekunden nach dem Ende der Spracheingabe. Grok Voice Transcribe 2.0 erreichte im selben Vergleich 2,7 % WER bei 0,49 Sekunden.
Die niedrigste Fehlerrate ging jedoch nicht mit der kürzesten Wartezeit einher. Bei Artificial Analysis lieferte Cartesia Ink Preview das finale Transkript nach 0,11 Sekunden und damit schneller als Microsofts Modell mit 0,13 Sekunden. Die Fehlerrate lag bei Cartesia allerdings bei 3,1 %, gegenüber 2,5 % bei MAI-Transcribe-2-Streaming.
Erster vorläufiger Text nach 0,12 Sekunden im Test
Artificial Analysis bewertet auch den ersten vorläufigen Transkriptionsstand, nicht nur den fertigen Text. In dieser Auswertung erreichte MAI-Transcribe-2-Streaming eine WER von 2,5 % bei einer Latenz von 0,12 Sekunden. Für Grok Voice Transcribe 2.0 lagen die Werte bei 3,4 % und 0,49 Sekunden.
Auch bei diesem Zwischenergebnis gab es einen schnelleren Konkurrenten: Cartesia Ink-2 benötigte laut Artificial Analysis 0,07 Sekunden bis zum ersten vorläufigen Transkript. Seine Wortfehlerrate betrug dabei 4,0 %, gegenüber den 2,5 % des Microsoft-Modells.
MAI-Transcribe-Familie mit 60 Sprachen und Sprechertrennung
Microsoft nennt für die MAI-Transcribe-Familie einen mehrsprachigen Ansatz mit einem einzigen Modell für 60 Sprachen. Zu den aufgeführten Funktionen gehören außerdem die Unterscheidung von Sprechern und Zeitmarken für einzelne Wörter. Welche dieser Funktionen verfügbar sind, kann vom verwendeten Endpoint abhängen.
Für Namen und Fachbegriffe führt Microsoft zudem Keyword Biasing an: Vorgegebene Schlüsselwörter werden bei der Erkennung bevorzugt berücksichtigt. Für die Ausgabe nennt das Unternehmen zwei Varianten, einen wortgetreuen und einen bereinigten Text.
Voice Live API startet als öffentliche Preview
Für Live-Audio ist MAI-Transcribe-2-Streaming über die Voice Live API zugänglich. Diese Schnittstelle ist von der Fast Transcription API getrennt, die für bereits aufgenommene Audiodateien verwendet wird. Der Live-Zugang befindet sich in einer öffentlichen Preview ohne Service-Level Agreement (SLA); Microsoft rät wegen der fehlenden vertraglichen Servicegarantie vom Einsatz dieser Preview im Produktionsbetrieb ab.
Die Streaming-Variante kostet 0,54 US-Dollar je Audiostunde und damit genauso viel wie Gemini 3.5 Transcribe Live, aber mehr als ElevenLabs Scribe v2 Realtime und Deepgram Flux; für den Batch-Modell MAI-Transcribe-2 gilt bis Ende 2026 ein Aktionspreis von 0,10 US-Dollar je Audiostunde.



