Ultrafast-Modus: OpenAI macht GPT-5.6 Sol 14-mal schneller
Ein neuer Preview-Modus beschleunigt GPT-5.6 Sol auf bis zu 750 Tokens pro Sekunde – möglich macht es eine Partnerschaft mit Chip-Hersteller Cerebras.

Symbolbild · KI-generiert (AI IN LIFE)
Auf einen Blick
- Ultrafast beschleunigt GPT-5.6 Sol auf bis zu 750 Output-Tokens pro Sekunde
- Bis zu 14-fache Geschwindigkeit gegenüber dem Standardbetrieb
- Hardware-Partner ist Cerebras mit seinen Wafer-Scale-Chips
- Status: Preview für eine kleine Kundengruppe, noch ohne öffentliches Pricing
- Zielanwendungen: Incident Response, Kundenservice, Finanzanalyse, E-Commerce
OpenAI hat einen neuen Betriebsmodus für sein Modell GPT-5.6 Sol vorgestellt: „Ultrafast“ liefert Antworten mit bis zu 14-facher Geschwindigkeit gegenüber dem Standardbetrieb – bis zu 750 Output-Tokens pro Sekunde. Der Modus befindet sich in einer Preview-Phase und ist zunächst nur für eine kleine Gruppe von Kunden verfügbar.
Technisch basiert der Geschwindigkeitssprung auf einer Partnerschaft mit Cerebras. Der Chip-Hersteller, bekannt für seine Wafer-Scale-Prozessoren, bestätigte die Zusammenarbeit am 13. August in einer eigenen Mitteilung. Cerebras-Systeme sind auf extrem schnelle Inferenz spezialisiert und konkurrieren damit direkt mit Nvidia-basierten Setups.
OpenAI positioniert Ultrafast als Antwort auf ein bekanntes Dilemma: Wer bislang Echtzeit-Geschwindigkeit brauchte, musste meist auf kleinere oder spezialisierte Modelle ausweichen. „Ultrafast points to progress in a new direction: more useful work per second“, heißt es von OpenAI – volle Modellqualität bei Echtzeit-Tempo.
Als Zielanwendungen nennt das Unternehmen Incident Response im IT-Betrieb, Kundenservice, Finanzmarktanalyse und E-Commerce – Szenarien, in denen Latenz direkt über den Nutzwert entscheidet. Gerade für agentische Workflows, die viele Schritte hintereinander ausführen, multipliziert sich jeder Geschwindigkeitsgewinn.
Offene Fragen bleiben: Einen Preis hat OpenAI nicht genannt, und die Ausweitung über den kleinen Kundenkreis hinaus soll erst erfolgen, „wenn die Kapazität wächst“. Wie viel Cerebras-Hardware tatsächlich hinter dem Angebot steht, ist nicht öffentlich.
Häufige Fragen
Was ist der Ultrafast-Modus?
Ein neuer Betriebsmodus für GPT-5.6 Sol, der dasselbe Modell mit bis zu 14-facher Geschwindigkeit ausführt – bis zu 750 Tokens pro Sekunde.
Wer kann Ultrafast nutzen?
Aktuell nur eine kleine Gruppe von OpenAI-Kunden im Rahmen einer Preview. Eine breitere Verfügbarkeit soll mit wachsender Kapazität folgen.
Welche Rolle spielt Cerebras?
Cerebras liefert die spezialisierte Wafer-Scale-Hardware, auf der der Ultrafast-Modus läuft, und bestätigte die Partnerschaft in einer eigenen Mitteilung.


