Gemini 3.8 Text-to-Speech: Stimmklonen nicht im EWR
Google bringt zwei TTS-Modelle mit über 2.000 Stimmen in mehr als 100 Sprachen; die Stimmnachbildung bleibt im EWR und in der Schweiz gesperrt.
Kurz gesagt
Google hat am 23.09.2026 zwei Text-to-Speech-Modelle veröffentlicht — Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS —, deren Stimmnachbildung aus 30-Sekunden-Proben in sechs benannten Gebieten gesperrt bleibt, darunter EWR, Großbritannien und die Schweiz.
Auf einen Blick
- Zwei Modelle: Flash TTS für Regiearbeit und Figuren, Flash-Lite TTS für hohe Volumina.
- Stimmbibliothek: über 2.000 einsatzfertige Stimmen in mehr als 100 Sprachen und Dialekten.
- Nachbildung verlangt eine 30-Sekunden-Probe plus Einwilligungsaufnahme der Stimminhaberin.
- Hume-AI-Benchmark: 71,4 Punkte im Voice Design, 60,8 bei Akzenten — jeweils Platz 1.
- Jede erzeugte Audiodatei trägt ein SynthID-Wasserzeichen und C2PA-Angaben.
Google hat am 23.09.2026 zwei neue Modelle für Sprachsynthese vorgestellt: Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS. Beide erzeugen Sprache aus Text, beide betten ein unhörbares Wasserzeichen ein. Die Funktion mit der größten Sprengkraft — eine vorhandene Stimme aus einer 30-Sekunden-Probe nachzubilden — ist in sechs benannten Gebieten abgeschaltet.
Zwei Modelle, zwei Einsatzprofile
Flash TTS ist für Regiearbeit gedacht: Tempo, Emotion und Schauspielhinweise lassen sich Zeile für Zeile steuern, dazu kommen Dialoge mit zwei Sprechern und natürlichem Sprecherwechsel. Flash-Lite TTS zielt auf große Mengen zu niedrigen Kosten. Beide laufen ab sofort über die Gemini API und Google AI Studio; eine Enterprise-Schnittstelle ist angekündigt, aber noch nicht freigeschaltet.
In den Endprodukten teilen sich die beiden auf: Flash TTS steckt in Gemini Notebook, Flash-Lite TTS in Google Vids.
Über 2.000 Stimmen, mehr als 100 Sprachen
Die Bibliothek beginnt bei 30 Originalstimmen und wächst nach Angaben von Google auf über 2.000 einsatzfertige Varianten in mehr als 100 Sprachen und Dialekten. Regionale Färbungen gehören ausdrücklich dazu, etwa mexikanisches Spanisch, Québec-Französisch oder schottisches Englisch. Zusätzlich lassen sich neue Stimmen per Textbeschreibung entwerfen — Rolle, Akzent, Klangcharakter.
Warum die Nachbildung hier fehlt
Wer eine bestehende Stimme kopieren will, muss eine Einwilligungsaufnahme der betreffenden Person hinterlegen, die zur Referenzaufnahme passt. Freigeschaltet wird die Funktion trotzdem nicht überall: EWR, Großbritannien, Schweiz, Indien, Illinois und Texas bleiben außen vor. Eine Begründung nennt der Beitrag nicht; die Liste deckt sich auffällig mit Rechtsräumen, die biometrische Merkmale streng regeln.
Für Redaktionen und Agenturen im deutschsprachigen Raum heißt das praktisch: Stimmen entwerfen ja, fremde Stimmen nachbauen nein.
Wo die Modelle in Ranglisten stehen
Im Voice-Design-Benchmark von Hume AI kommt Flash TTS auf 71,4 Punkte und Platz 1, bei der Akzentmodellierung auf 60,8 Punkte und ebenfalls Platz 1. Im Gesamtindex belegen die beiden Modelle die Plätze 1 und 2. In der Voice-Arena-Rangliste führen sie unter anderem für Japanisch, brasilianisches Portugiesisch, Vietnamesisch, Hocharabisch, mexikanisches Spanisch und Hindi.
Was offenbleibt
Preise pro Zeichen oder Token nennt die Ankündigung nicht, Latenzwerte ebenso wenig — beides ist damit unbestätigt. Auch die genauen API-Kennungen der Modelle stehen nicht im Text. Der separat geführte DeepMind-Link leitet auf denselben Blogbeitrag weiter, es liegt also bislang nur eine Primärquelle vor.
Häufige Fragen
Welche Gemini-3.8-TTS-Modelle hat Google veröffentlicht?
Zwei: Gemini 3.8 Flash TTS für Regiearbeit und Figurenstimmen sowie Gemini 3.8 Flash-Lite TTS für große Mengen zu geringeren Kosten. Beide sind über die Gemini API und Google AI Studio erreichbar.
Kann ich in Deutschland meine Stimme mit Gemini 3.8 klonen?
Nein. Google schaltet die Stimmnachbildung im EWR, in Großbritannien, der Schweiz, Indien, Illinois und Texas nicht frei. Das Entwerfen neuer, frei erfundener Stimmen bleibt davon unberührt.
Was kostet Gemini 3.8 Text-to-Speech?
Die Ankündigung nennt keine Preise und keine Latenzwerte. Wer kalkulieren will, muss auf die Preisliste der Gemini API warten — aus dem Blogbeitrag lässt sich dazu nichts ableiten.