Im Quellenvergleich

Gemini 3.5 Transcribe angekündigt

3 Quellen · 3 Meldungen · Stand 27.08.2026

Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.

Im Quellenvergleich

Worin die Quellen übereinstimmen

Google hat Gemini 3.5 Transcribe vorgestellt, ein KI-Modell für Sprach-zu-Text. Es entfernt Füllwörter und Versprecher und liefert formatierten Text. Das Modell ist in Produkten wie Gboard integriert und unterstützt über 85 Sprachen sowie die Identifikation von bis zu drei Sprechern. Laut Google ist es etwa 70 Prozent schneller als der Vorgänger Chirp 3. Die Quellen berichten weitgehend übereinstimmend. Entwickler können es über die Gemini API in Google AI Studio und der Gemini Enterprise Agent Platform nutzen. Es gibt zwei Schnittstellen: eine Live-API für Echtzeit-Streaming und eine Interactions-API für vorab aufgenommene Audiodateien mit Sprecherzuordnung und Zeitstempeln.

Aktualisierungen
27.08.2026
11:06Entwickler können das Modell über die Gemini API in Google AI Studio und der Gemini Enterprise Agent Platform nutzen.
Es gibt zwei Schnittstellen: eine Live-API für Echtzeit-Streaming und eine Interactions-API für vorab aufgenommene Audiodateien mit Sprecherzuordnung und Zeitstempeln.
Worin sie sich unterscheidenFehlerrate des Modells·Verfügbarkeit für Entwickler·Bewertung der Textveränderung+1 weitere
Fehlerrate des Modells
  • Eine Messung ergibt eine Wortfehlerrate von 4,0 Prozent beim Streaming und 2,6 Prozent bei Nicht-Streaming.1
  • Eine andere Messung nennt eine Fehlerrate von 5,5 Prozent bei Live-Sprache, gegenüber 7,32 Prozent beim Vorgänger Chirp 3.2
Verfügbarkeit für Entwickler
  • Das Modell ist ab sofort in Google AI Studio und auf der Gemini Enterprise Agent Platform verfügbar.3
Bewertung der Textveränderung
  • Das Modell versteht die Absicht hinter den Worten und bereinigt Versprecher.2
  • Die KI verändert technisch den Wortlaut des Gesagten, was in manchen Situationen unpassend sein kann.2
Zusätzliche Funktionen
  • Das Modell bietet Funktionen wie das Entfernen von Füllwörtern, automatische Formatierung, Funktion-Calling, benutzerdefiniertes Vokabular und Sprecheridentifikation für bis zu drei Sprecher.1
  • Über Function Calling kann das Modell Aufgaben wie Bilderzeugung oder Websuchen an andere Gemini-Modelle delegieren.3

Quellen (3)

Vollständige Übersicht mit allen Meldungen öffnen →