Ultrafast: OpenAI beschleunigt GPT-5.6 Sol auf das 14-Fache
Der neue API-Tier liefert bis zu 750 Output-Token pro Sekunde auf Cerebras-Hardware — vorerst als limitierte Preview für ausgewählte Kunden.

Symbolbild · KI-generiert (AI IN LIFE)
Auf einen Blick
- Bis zu 14-fache Geschwindigkeit für GPT-5.6 Sol im neuen Ultrafast-Tier
- Bis zu 750 Output-Token pro Sekunde
- Läuft auf Wafer-Scale-Infrastruktur von Cerebras
- Aktuell limitierte Preview für ausgewählte Kunden, Ausbau nach Kapazität
- Preise noch nicht veröffentlicht
OpenAI hat mit „Ultrafast“ einen neuen Service-Tier für seine API vorgestellt, der das Frontier-Modell GPT-5.6 Sol bis zu 14-mal schneller laufen lässt. Möglich machen soll das die Wafer-Scale-Hardware des Chipherstellers Cerebras, die auf besonders latenzarme Inferenz ausgelegt ist.
Konkret verspricht OpenAI bis zu 750 Output-Token pro Sekunde — ein Wert, der bisher eher mit kleinen, schwächeren Modellen assoziiert wurde, nicht mit dem intelligentesten Modell des Hauses. Genau diese Kombination ist der Kern der Ankündigung: volle Modellqualität bei Antwortzeiten, die synchrone, interaktive Anwendungen erlauben.
Als Zielszenarien nennt OpenAI Echtzeit-Incident-Response und Systemdiagnosen, Finanzrecherche und Betrugserkennung, Live-Kundensupport und Sprachinteraktionen sowie E-Commerce-Produktassistenz und Checkout-Support. Frühe Tester berichten laut OpenAI, dass Workflows praktikabel werden, die bisher an der Latenz intelligenter Modelle scheiterten.
Verfügbar ist Ultrafast zunächst nur als limitierte Preview für ausgewählte Kunden; der Zugang soll mit wachsender Kapazität ausgeweitet werden. Preise hat OpenAI noch nicht genannt. Für Anbieter von Voice-Agents, Support-Automatisierung und Echtzeit-Workflows — auch im europäischen Mittelstand — ist das dennoch eine Richtungsentscheidung: Die Latenz-Hürde für den Einsatz von Frontier-Modellen im Kundenkontakt fällt.
Häufige Fragen
Was ist Ultrafast genau?
Ein neuer API-Service-Tier von OpenAI, der GPT-5.6 Sol für zeitkritische Anwendungen mit bis zu 14-facher Geschwindigkeit ausliefert.
Wer kann Ultrafast nutzen?
Derzeit nur ausgewählte Kunden in einer limitierten Preview; OpenAI will den Zugang mit steigender Kapazität ausweiten.
Wofür lohnt sich der Modus?
Für Echtzeit-Anwendungen wie Voice-Agents, Live-Support, Betrugserkennung und Incident-Response, die bisher an der Latenz großer Modelle scheiterten.


