LIVE
Alle Meldungen ›
AI IN LIFENEWS
Tools & AnwendungenWirtschaft & DealsKI-ModelleGesellschaftForschungChips & InfrastrukturSicherheitRegulierung & RechtRobotik OpenAIAnthropicGoogle & DeepMindAlibaba / QwenxAIMetaByteDance
StartGoogle & DeepMind › MODELLE
MODELLE

Gemini 3.8 Live: Googles Sprachmodelle für Agenten

Zwei native Speech-to-Speech-Modelle, 82,6 Punkte im Artificial-Analysis-Index und ein Minutenpreis ab 0,005 US-Dollar — seit 15.09.2026 in der API.

Gemini 3.8 Live: Googles Sprachmodelle für Agenten
Symbolbild: An einem Testplatz für Sprachagenten leuchten die Pegelanzeigen, während eine Person von hinten den Mikrofonregler nachjustiert.

Kurz gesagt

Google hat am 15.09.2026 mit Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking zwei native Speech-to-Speech-Modelle für produktive Sprachagenten veröffentlicht, abrechenbar ab 0,005 US-Dollar pro Minute Audio-Input.

Auf einen Blick

  • Zwei Modelle: Gemini 3.8 Live (günstige Skalierung) und Gemini 3.8 Live Extended Thinking (mehrstufiges Denken).
  • Preis laut MarkTechPost: 0,005 US-Dollar pro Minute Audio-Input, 0,018 US-Dollar pro Minute Audio-Output.
  • Benchmarks: 82,6 im Speech-to-Speech-Index, 68,6 % τ-Voice, 35,1 % τ-Voice-banking, 97,7 % Big Bench Audio.
  • 97 Sprachen mit Wechsel mitten im Gespräch; SynthID-Wasserzeichen in jedem generierten Audio.
  • Nur gehostet über Gemini API und Google AI Studio, keine offenen Gewichte.

Google hat am 15.09.2026 zwei neue Sprachmodelle freigegeben: Gemini 3.8 Live für den kostengünstigen Massenbetrieb und Gemini 3.8 Live Extended Thinking für Aufgaben mit mehreren Denkschritten. Beide arbeiten nativ von Sprache zu Sprache, also ohne den Umweg über Transkription und ein getrenntes Textmodell. Zielgruppe sind Telefon- und Support-Agenten, die im Wirkbetrieb laufen sollen.

Was die Modelle leisten sollen

Laut Googles Ankündigung erkennen die Modelle 97 Sprachen und wechseln mitten im Gespräch zwischen ihnen. Werkzeug- und API-Aufrufe laufen asynchron im Hintergrund, während das Modell weiterspricht: Es kündigt die Wartezeit verbal an, statt stumm zu werden. Extended Thinking denkt und spricht gleichzeitig. Dazu kommen Bildverarbeitung nahezu in Echtzeit und höhere Genauigkeit bei Buchstaben-Zahlen-Kombinationen, etwa bei Bestätigungscodes.

Die Benchmark-Zahlen

Im Speech-to-Speech Quality Index von Artificial Analysis erreicht Extended Thinking 82,6 Punkte und damit Platz 1. Bei der agentischen Aufgabenerfüllung nennt Google 68,6 % auf τ-Voice und 35,1 % auf dem Banking-Teil τ-Voice-banking von Sierra. Big Bench Audio liegt bei 97,7 %. In der Speech Agent Arena, die menschliche Präferenz misst, belegt das kleinere 3.8 Live Platz 2.

Der Abstand zwischen 97,7 % im Audio-Reasoning und 35,1 % im Banking-Szenario ist der aufschlussreichere Teil. Reine Hörverständnis-Tests sind damit weitgehend abgearbeitet; mehrstufige Vorgänge gegen echte Fachsysteme sind es nicht.

Preis und Verfügbarkeit

MarkTechPost rechnet die Tokenpreise von 3 US-Dollar pro Million Input-Token und 12 US-Dollar pro Million Output-Token in 0,005 US-Dollar pro Minute Audio-Input und 0,018 US-Dollar pro Minute Audio-Output um. Entwickler erreichen die Modelle über die Gemini API und Google AI Studio, offene Gewichte gibt es nicht. Für Unternehmen läuft eine private Preview in Gemini Enterprise. Auf Nutzerseite steckt 3.8 Live in Search Live, Extended Thinking in Gemini Live sowie in Gmail und Keep, in Google Workspace für Pro- und Ultra-Abos.

Als Integrationspartner nennt Google Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel und Vision Agents. Jedes generierte Audio traegt ein SynthID-Wasserzeichen.

Erster Blick von außen

Simon Willison hat am selben Tag ein kleines Browser-Werkzeug veröffentlicht. Es kommt ohne Bibliotheken aus, verbindet sich per WebSocket mit Googles Generative-Language-Endpunkt und nutzt die Web Audio API für Aufnahme und Wiedergabe. Modell und Stimme sind wählbar, ein System-Prompt ist optional, und das Modell lässt sich mitten im Satz unterbrechen. Willison ordnet die neue Familie als ähnlich geschnitten wie OpenAIs GPT-Live-Modelle ein und weist darauf hin, dass Transkripte Sprache enthalten können, die nie abgespielt wurde.

Was offen bleibt

Keine der geprüften Quellen nennt einen Latenzwert in Millisekunden. Die zitierte „beeindruckende Latenz“ stammt von Integrationspartnern und ist kein Messwert. Auch die Größe des Kontextfensters ist in den vorliegenden Quellen nicht angegeben. Beide Punkte sind damit unveröffentlicht, nicht widerlegt.

◈ KI-GENERIERTER BERICHT · QUELLEN VERLINKT

Häufige Fragen

Was kostet Gemini 3.8 Live pro Minute?

MarkTechPost rechnet 0,005 US-Dollar pro Minute Audio-Input und 0,018 US-Dollar pro Minute Audio-Output, abgeleitet aus 3 US-Dollar pro Million Input-Token und 12 US-Dollar pro Million Output-Token.

Was unterscheidet Gemini 3.8 Live von Extended Thinking?

3.8 Live ist auf günstige Skalierung ausgelegt. Extended Thinking denkt mehrstufig und spricht dabei weiter, ist also für komplexere Vorgänge gedacht.

Gibt es Gemini 3.8 Live mit offenen Gewichten?

Nein. Beide Modelle laufen nur gehostet über die Gemini API und Google AI Studio; eine Variante zum Selbst-Hosten hat Google nicht angekündigt.

Quellen

Weitere Berichte