Im Quellenvergleich
Worin die Quellen übereinstimmen
Google hat zwei neue Text-to-Speech-Modelle für die Gemini-Familie vorgestellt: Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS. Beide unterstützen mehr als 100 Sprachen und erlauben Regieanweisungen für einzelne Dialogzeilen. Flash TTS ist für kreative Anwendungen gedacht, Flash-Lite TTS für kosteneffiziente Massengenerierung. Eine Bibliothek mit über 2.000 vorgefertigten Stimmen steht bereit. Aus 30-sekündigen Audioproben lassen sich Stimmprofile nachbilden; dafür verlangt Google die Einwilligung der nachgebildeten Person. Jeder erzeugte Audioclip trägt ein SynthID-Wasserzeichen. Beide Modelle sollen lange Texte über Stunden mit minimalem Speaker Drift vertonen, Dialoge mit zwei Stimmen trennen und nichtverbale Elemente wie Lachen umsetzen. Beide Modelle starten über die Gemini-API und Google AI Studio, Flash TTS zusätzlich in Gemini Notebook, Flash-Lite TTS in Google Vids. Die Quellen berichten weitgehend übereinstimmend.
Worin sie sich unterscheidenZusätzliche Schutzmaßnahmen bei der Stimmreplikation·Verfügbarkeit einer Voice-Remixing-Funktion·Leistung in Benchmarks und Tests+3 weitere
Zusätzliche Schutzmaßnahmen bei der Stimmreplikation- Google nennt als Schutzmaßnahmen eine Einwilligungsprüfung, SynthID-Wasserzeichen und C2PA-Nachweise.1
Verfügbarkeit einer Voice-Remixing-Funktion- Eine Funktion namens Voice Remixing ist angekündigt, aber noch nicht verfügbar.2
Leistung in Benchmarks und Tests- Flash TTS erreicht den ersten Platz in Hume AIs Voice Design Benchmark mit 71,4 und führt bei der Akzentmodellierung mit 60,8; im Overall Quality Index belegen Flash und Flash-Lite die Plätze eins und zwei.1
- In zwei eigenen Tests überzeugte die Stilsteuerung bei Akzent und Intonation, doch trat zeitweise ein hohes Fiepen auf, und in einem Test wechselte die Stimme am Ende.2
Nutzung von Nutzerdaten im kostenlosen Tarif- Im kostenlosen Tarif nutzt Google die Daten laut Unternehmen zur Produktverbesserung, im kostenpflichtigen nicht.2
Preise und Token-Berechnung- Eine Sekunde Audio entspricht 25 Audio-Tokens, eine Stunde 90.000; bis Ende 2026 kostet eine Stunde Ausgabe bei Flash TTS 0,81 US-Dollar, bei Flash-Lite TTS 0,54 US-Dollar, ab dem 1. Januar 2027 steigen die Preise auf 1,62 beziehungsweise 1,08 US-Dollar, und die Texteingabe wird zusätzlich berechnet.2
Verfügbarkeit für Unternehmen- Für Unternehmen kommen beide Modelle später über die API in Gemini Enterprise.1