Im Quellenvergleich
Worin die Quellen übereinstimmen
Meta hat am 1. September 2026 das Echtzeit-Spracherkennungsmodell „Muse Voice Transcribe“ vorgestellt. Es unterscheidet mehr als 20 Sprecher in einer Aufnahme, erkennt Pausen und verarbeitet Audio über einer Stunde. Trainiert wurde es auf über 70 Sprachen, 25 davon wurden vor dem Start validiert. Technisch zerlegt die KI Audio in 80-Millisekunden-Fragmente und nutzt Verstärkungslernen, um Genauigkeit und Latenz auszubalancieren. Die Wortfehlerrate im Englischen gibt Meta mit 3,1 Prozent an, die Fehlerrate bei der Sprechererkennung mit 17,5 Prozent. Das Modell ist über die API sowie in der Mac-Version von „Meta AI“ und im Coding-Produkt „Muse Code“ verfügbar. Offene Gewichte veröffentlicht Meta nicht. Das Modell wurde von Meta Superintelligence Labs (MSL) entwickelt und ist seit demselben Tag über die „Meta Model API“ verfügbar. Es kombiniert Streaming-Transkription, Sprechertrennung und Erkennung des Sprecherendes in einem einzigen Modell. Die Verzögerung nach dem Sprechende beträgt laut Meta 0,16 Sekunden.
Aktualisierungen
02.09.2026
22:06Das Modell wurde von Meta Superintelligence Labs (MSL) entwickelt und ist seit demselben Tag über die „Meta Model API“ verfügbar.
Es kombiniert Streaming-Transkription, Sprechertrennung und Erkennung des Sprecherendes in einem einzigen Modell.
Die Verzögerung nach dem Sprechende beträgt laut Meta 0,16 Sekunden.
Worin sie sich unterscheidenPreisangabe für die API-Nutzung·Einordnung der Leistung im Vergleich zu Konkurrenzmodellen·Zusätzliche technische Details und Benchmarks
Preisangabe für die API-NutzungDer Preis liegt bei 0,18 Dollar pro Stunde verarbeitetem Audio.12- Der Preis beträgt 3 Dollar pro 1.000 Minuten Audio.3
Einordnung der Leistung im Vergleich zu Konkurrenzmodellen- Damit liege es vor GPT Live Transcribe und Gemini Transcribe Live.3
- Damit übertrifft es Cartesia Ink-2 (3,4 Prozent) und ElevenLabs' Scribe v2 Realtime (3,6 Prozent).1
- Die 20-Sprecher-Marke ist kein Weltrekord: Speechmatics unterstützt 50 Sprecher standardmäßig und bis zu 100 konfigurierbar, Amazon Transcribe schafft maximal 30 Sprecher.2
- Preislich liegt Muse im unteren Marktbereich, ist aber nicht der günstigste Anbieter: Soniox kostet 0,12 Dollar pro Stunde.2
Zusätzliche technische Details und Benchmarks- Laut Meta belegt das Modell den ersten Platz in Artificial Analysis' Streaming-Spracherkennungs-Ranking und öffentlichen Sprechertrennungs-Benchmarks.1
- Die API liefert nur Turn-Level-Zeitstempel, keine Wort-Level-Konfidenzwerte und begrenzt Sessions auf 60 Minuten.2