Gemini 3.5 Transcribe: Googles neues Modell für Sprache
Google meldet für das neue Transkriptionsmodell eine Wortfehlerrate von 2,6 Prozent und 70 Prozent kürzere Wartezeit gegenüber Chirp 3.
Symbolbild: ein Studiomikrofon im Dämmerlicht, über dem sich Schallwellen in schwebende Lichtpartikel auflösen.
Gemini 3.5 Transcribe ist Googles neues Spracherkennungsmodell, das nach Angaben des Anbieters mehr als 85 Sprachen erkennt und in der Variante ohne Streaming eine Wortfehlerrate von 2,6 Prozent erreicht.
Auf einen Blick
- Zwei Varianten: Gemini 3.5 Transcribe für Aufnahmen, Gemini 3.5 Transcribe Live für Streaming mit Latenz unter einer Sekunde.
- Wortfehlerrate laut Google: 2,6 Prozent ohne Streaming, 4,0 Prozent im Streaming-Betrieb.
- Im mehrsprachigen FLEURS-Test nennt Google 5,04 Prozent ohne Streaming und 5,50 Prozent im Streaming.
- Sprecher-Trennung mit Zeitstempeln für bis zu drei Stimmen; mehr als drei Sprecher gelten als experimentell.
- Public Preview über Gemini API, AI Studio und Antigravity. Der Beitrag nennt keine Preise.
Google hat am 26.08.2026 Gemini 3.5 Transcribe vorgestellt, ein Modell, das gesprochene Sprache nicht nur in Text überführt, sondern den Text unterwegs aufräumt. Füllwörter wie Ähs verschwinden, eine Selbstkorrektur mitten im Satz übernimmt das Modell statt beide Fassungen mitzuschreiben, und die Formatierung setzt es selbst. Fachbegriffe lassen sich über ein eigenes Vokabular hinterlegen.
Zwei Varianten für zwei Aufgaben
Für fertige Aufnahmen ist Gemini 3.5 Transcribe zuständig, für laufende Gespräche Gemini 3.5 Transcribe Live. Die Live-Variante arbeitet nach Googles Angaben bidirektional mit einer Verzögerung unter einer Sekunde und kann mitten im Gespräch die Sprache wechseln. Über Function Calling darf das Modell Teilaufgaben an andere Gemini-Modelle weiterreichen. Sprecher werden mit Zeitstempeln getrennt, sauber allerdings nur bis zu drei Stimmen; darüber stuft Google die Funktion als experimentell ein.
Die genannten Messwerte
Google beziffert die Wortfehlerrate auf 2,6 Prozent ohne Streaming und 4,0 Prozent im Streaming. Auf dem mehrsprachigen FLEURS-Test liegen die Werte bei 5,04 Prozent beziehungsweise 5,50 Prozent. Bis zum fertigen Endergebnis soll das Modell 70 Prozent schneller sein als der Vorgänger Chirp 3. Automatisch erkannt und transkribiert werden nach Herstellerangabe mehr als 85 Sprachen samt regionalen Akzenten.
Wo es bereits läuft
Entwicklerinnen und Entwickler erreichen das Modell als Public Preview über die Gemini API in Google AI Studio sowie über Google Antigravity, dort als gemini-3.5-transcribe-live in der Live API und als gemini-3.5-transcribe in der Interactions API. Für Unternehmen läuft eine Preview auf der Gemini Enterprise Agent Platform. Auf der Verbraucherseite steckt das Modell in der Gemini-App unter macOS auf Englisch und in der Rambler-Funktion von Gboard auf Android in ausgewählten Ländern; für Chrome ist es angekündigt. Sieben Plattformen haben die Live API bereits eingebunden: Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel und Vision Agents.
Was offen bleibt
Alle genannten Zahlen stammen aus Googles eigener Ankündigung. Zum Zeitpunkt dieses Artikels lag uns keine zweite, unabhängige Redaktion vor, die sie bestätigt oder eingeordnet hätte, und unabhängige Nachmessungen der Fehlerraten gibt es bislang nicht. Google beschreibt weder die Testbedingungen noch die Audio-Qualität, unter der die Werte entstanden sind. Preise, Kontingente und Latenzgarantien nennt der Beitrag nicht. Für welche Länder und Sprachen Rambler freigeschaltet ist und wann Chrome folgt, bleibt ebenfalls unbeantwortet.
Häufige Fragen
Was ist Gemini 3.5 Transcribe?
Ein Spracherkennungsmodell von Google, das Audio in Text umwandelt, Füllwörter entfernt, Selbstkorrekturen berücksichtigt und den Text automatisch formatiert. Es gibt eine Variante für Aufnahmen und eine für Streaming in Echtzeit.
Wie genau ist Gemini 3.5 Transcribe?
Google gibt eine Wortfehlerrate von 2,6 Prozent ohne Streaming und 4,0 Prozent im Streaming an, im mehrsprachigen FLEURS-Test 5,04 beziehungsweise 5,50 Prozent. Unabhängig überprüft sind diese Werte bisher nicht.
Wo kann ich Gemini 3.5 Transcribe nutzen?
Als Public Preview über die Gemini API in Google AI Studio und über Google Antigravity, für Unternehmen über die Gemini Enterprise Agent Platform, außerdem in der Gemini-App unter macOS und in der Rambler-Funktion von Gboard auf Android.