Ox Alpha ist jetzt GLM-5.3-Flash: Z.ai öffnet Gewichte
Das Mixture-of-Experts-Modell hat 320 Milliarden Parameter, davon 18 Milliarden aktiv, und verarbeitet Eingaben von bis zu einer Million Token.
Symbolbild: eine weite Serverhalle in kühlem Blau- und warmem Bernsteinlicht, ohne erkennbare Marken.
Z.ai hat das zuvor unter dem Codenamen Ox Alpha getestete Modell als GLM-5.3-Flash mit offen verfügbaren Gewichten auf Hugging Face bereitgestellt.
Auf einen Blick
- Architektur: Mixture of Experts mit 320 Milliarden Parametern, davon 18 Milliarden pro Anfrage aktiv.
- Kontext: 1 Million Token Eingabe für Text, Bild und Video, bis zu 131.072 Token Ausgabe.
- Training: 30 Billionen Token laut Bericht von SiliconANGLE.
- Benchmarks: höchster Wert bei GDPval-AA v2, zweiter Platz bei AutomationBench.
- Kosten: zehnmal kosteneffizienter als das Vorgängermodell, das im Bericht nicht benannt wird.
Z.ai hat die Gewichte des Modells veröffentlicht, das in der Vorwoche unter dem Codenamen Ox Alpha aufgetaucht war. Es trägt nun den Namen GLM-5.3-Flash und liegt auf Hugging Face unter der Kennung zai-org/GLM-5.3-Flash. Betreiber OpenRouter hatte zuvor eine kostenlos nutzbare gehostete Fassung angeboten, damals noch unter dem Codenamen.
Was in dem Modell steckt
GLM-5.3-Flash ist ein Mixture-of-Experts-Modell mit 320 Milliarden Parametern. Pro Anfrage bleiben davon 18 Milliarden aktiv — das ist der Hebel, mit dem diese Bauart die Rechenkosten je Antwort drückt. Als Eingabe nimmt das Modell bis zu 1 Million Token entgegen, neben Text auch Bilder und Video. Die Ausgabe reicht bis 131.072 Token.
SiliconANGLE nennt drei technische Bausteine: eine dünn besetzte Aufmerksamkeit, die nur einen Teil der Token auswertet statt aller; eine lineare Variante der Aufmerksamkeit, die die Softmax-Funktion durch ein günstigeres Verfahren ersetzt; und ein mit mHC bezeichnetes Verfahren, das die Gradienten während des Trainings optimiert. Als Trainingsumfang gibt der Bericht 30 Billionen Token an.
Wie es in Benchmarks abschneidet
Den höchsten Wert erreichte GLM-5.3-Flash dem Bericht zufolge bei GDPval-AA v2, einem Test für wissensintensive Arbeitsaufgaben. Bei AutomationBench, der das Erledigen von Aufgaben in Cloud-Anwendungen misst, landete es auf Platz zwei. Als Vergleichspunkte führt der Bericht Claude Opus 4.8, GPT-5.6 Terra und Gemini 3.7 Flash an.
Ob diese Werte unabhängig reproduziert wurden, geht aus dem Bericht nicht hervor. Konkrete Punktzahlen zu den beiden Benchmarks nennt er ebenfalls nicht.
Kosten und Verfügbarkeit
Der wirtschaftliche Kern der Ankündigung ist der Preis pro Arbeitseinheit: GLM-5.3-Flash sei zehnmal kosteneffizienter als sein Vorgänger, heißt es. Welches Modell dabei als Vorgänger gilt, wird nicht ausgeführt. Ein Betrag pro Million Token steht in dem Bericht nicht.
Für Entwicklerinnen und Entwickler zählt vorerst der zweite Punkt: Die Gewichte liegen offen, und über OpenRouter existiert ein gehosteter Zugang, der beim Start kostenlos war. Beides zusammen senkt die Hürde, das Modell gegen die eigene Aufgabenstellung zu testen, statt sich auf Ranglisten zu verlassen.
Was offen bleibt
Die Modellseite von Z.ai war zum Zeitpunkt der Recherche nicht auslesbar. Lizenztext, Preisliste je Million Token und die vollständige Benchmark-Tabelle konnten deshalb nicht am Herstellertext geprüft werden. Alle Zahlen in diesem Artikel stammen aus der Berichterstattung von SiliconANGLE.
Häufige Fragen
Was ist GLM-5.3-Flash?
Ein Mixture-of-Experts-Modell von Z.ai, das vor der Veröffentlichung unter dem Codenamen Ox Alpha getestet wurde. Die Gewichte liegen auf Hugging Face.
Wie viele Parameter hat GLM-5.3-Flash?
320 Milliarden insgesamt, davon 18 Milliarden pro Anfrage aktiv. Das Kontextfenster fasst 1 Million Token Eingabe und bis zu 131.072 Token Ausgabe.
Wo kann man GLM-5.3-Flash ausprobieren?
Die Gewichte stehen auf Hugging Face unter zai-org/GLM-5.3-Flash. OpenRouter hatte zum Start eine kostenlose gehostete Fassung im Angebot.