Im Quellenvergleich
Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.
Microsoft AI hat ein Echtzeit-Transkriptionsmodell namens MAI-Transcribe-2-Streaming sowie zwei Sprachausgabemodelle vorgestellt: MAI-Voice-2.1 und die schnellere Variante MAI-Voice-2.1-Flash. Das Transkriptionsmodell liefert bereits während des Sprechens vorläufige Ergebnisse, unterstützt 60 Sprachen und gibt nach gut 100 Millisekunden einen ersten Text zurück. Laut Microsoft liegt es bei einer Auswertung von Artificial Analysis auf Platz eins der Genauigkeit. Bis Jahresende kostet eine Stunde Audio 0,54 Dollar. MAI-Voice-2.1 deckt 23 Sprachen ab und soll beim Sprachwechsel den muttersprachlichen Akzent treffen. Die Flash-Version erreicht eine Latenz von 150 Millisekunden und kostet 15 Dollar pro Million Zeichen. Beide Voice-Modelle können Stimmen aus wenigen Sekunden Referenzaudio klonen; Schutzmechanismen sollen Missbrauch verhindern. Die Modelle sind über Microsoft Foundry und den MAI Playground verfügbar.