GPT-Live-1: OpenAI bringt Voll-Duplex-Sprache in die API
Das neue Sprachmodell soll Gespräche ohne starre Sprecherwechsel führen, Anweisungen zuverlässiger befolgen, eigene Stimmen und Telefonie unterstützen.

Kurz gesagt
OpenAI hat mit GPT-Live-1 ein Sprachmodell für die eigene API angekündigt, das Voll-Duplex-Dialoge, bessere Anweisungstreue, eigene Stimmen und eine Telefonie-Anbindung bieten soll.
Auf einen Blick
- GPT-Live-1 ist laut Ankündigung ein Sprachmodell für die OpenAI-API.
- Genanntes Kernmerkmal: Voll-Duplex-Gespräche, bei denen beide Seiten gleichzeitig sprechen können.
- Weiter genannt: zuverlässigere Anweisungstreue, eigene Stimmen, Telefonie-Unterstützung.
- Die Ankündigungsseite war für uns nicht abrufbar; der Server antwortete mit HTTP 403.
- Preis, Modell-ID, Sprachen, Latenz und Verfügbarkeit bleiben deshalb unbestätigt.
OpenAI hat GPT-Live-1 vorgestellt, ein Sprachmodell für die eigene Programmierschnittstelle. Die Ankündigung nennt vier Punkte: Voll-Duplex-Gespräche, zuverlässigere Anweisungstreue, eigene Stimmen und Unterstützung für Telefonie.
Übliche Sprachassistenten arbeiten im Halb-Duplex: Sie hören zu, warten auf eine Pause und antworten dann. Wer dazwischenredet, bringt das System meist aus dem Takt. Voll-Duplex beschreibt den Fall, dass beide Seiten gleichzeitig aktiv sein dürfen — die Gegenstelle spricht weiter, während die anrufende Person einhakt, und geht auf den Einwurf ein.
Für Support-Hotlines ist genau dieses Unterbrechen der Unterschied zwischen einem Gespräch und einer Ansage. Wie GPT-Live-1 das technisch löst, ob über Barge-in-Erkennung, Pufferung oder eine durchgehend audio-native Verarbeitung, geht aus dem uns vorliegenden Material nicht hervor.
Zwei der vier genannten Merkmale zielen weniger auf Sprachqualität als auf Integration. Eigene Stimmen erlauben ein einheitliches Klangbild über mehrere Produkte hinweg, statt aus einem festen Satz vorgegebener Stimmen zu wählen. Telefonie-Unterstützung deutet darauf hin, dass sich das Modell an das Telefonnetz anbinden lässt — dort liegt nach wie vor der größte Teil des realen Kundenkontakts.
Welche Protokolle, Anbieter oder Regionen dabei abgedeckt sind, nennt die uns zugängliche Kurzfassung nicht.
Die Ankündigungsseite von OpenAI ließ sich für diesen Text nicht abrufen; der Server antwortete mit HTTP 403. Dieser Beitrag stützt sich deshalb auf den Titel und die Zusammenfassung der Ankündigung.
Unbestätigt bleiben damit: Preise, die exakte Modell-Bezeichnung in der API, unterstützte Sprachen, Latenzwerte und der Zeitpunkt der Verfügbarkeit. Auch berichtet bislang nur eine unabhängige Redaktion über die Ankündigung, eine zweite Quelle zur Gegenprüfung lag nicht vor.
Sprachfunktionen in Modell-APIs sind kein neues Feld, der Engpass lag zuletzt aber weniger bei der Klangqualität als beim Gesprächsverhalten: Unterbrechungen, Rückfragen, Überlappungen. Eine Ankündigung, die genau dort ansetzt und zusätzlich den Weg ins Telefonnetz nennt, adressiert erkennbar Callcenter- und Assistenz-Anwendungen.
Belastbar wird das Bild erst mit den technischen Angaben, die wir hier nicht einsehen konnten. Bis dahin gilt der Funktionsumfang als von OpenAI beschrieben, nicht als von uns geprüft.
Häufige Fragen
Was ist GPT-Live-1?
Ein von OpenAI angekündigtes Sprachmodell für die eigene API, das laut Ankündigung natürlichere Sprachdialoge ermöglichen soll.
Was bedeutet Voll-Duplex bei einem Sprachmodell?
Beide Seiten können gleichzeitig sprechen. Das System muss also auf eine Unterbrechung reagieren, statt erst eine Sprechpause abzuwarten.
Was kostet GPT-Live-1 und ab wann ist es verfügbar?
Dazu liegen uns keine bestätigten Angaben vor. Die Ankündigungsseite war nicht abrufbar (HTTP 403), Preise und Verfügbarkeit bleiben offen.


