Qwen3.8-Flash-Next: 125 Milliarden Parameter, 6 aktiv
Alibaba stellt das Modell unter Apache 2.0 bereit: 262.144 Token Kontext, 0,16 US-Dollar je Million Eingabe-Token – und ein Vorgeschmack auf Qwen4.
Symbolbild: eine schmale, blau ausgeleuchtete Gasse zwischen langen Serverreihen in einem abgedunkelten Rechenzentrum.
Qwen3.8-Flash-Next ist ein multimodales MoE-Modell von Alibaba mit 125 Milliarden Parametern, von denen pro Token nur 6 Milliarden aktiv sind, veröffentlicht unter Apache 2.0 und vom Hersteller als Architektur-Vorschau auf Qwen4 bezeichnet.
Auf einen Blick
- 125 Milliarden Parameter gesamt, davon 6 Milliarden pro Token aktiv (Mixture of Experts).
- Lizenz Apache 2.0; Gewichte und Technical Report auf Hugging Face und ModelScope.
- Kontextfenster 262.144 Token nativ, mit YaRN auf 1 Million Token erweiterbar.
- QwenCloud-Preis: 0,16 US-Dollar je Million Input-Token, 0,47 US-Dollar je Million Output-Token.
- Herstellerangabe: rund ein Neuntel der Trainingskosten von Qwen3.7-Plus.
Alibaba hat am 26.08.2026 Qwen3.8-Flash-Next veröffentlicht, ein multimodales Mixture-of-Experts-Modell mit 125 Milliarden Parametern, von denen pro Token nur 6 Milliarden rechnen. Die Gewichte stehen unter Apache 2.0 auf Hugging Face und ModelScope. Als Produktionsvariante läuft Qwen3.8-Flash über QwenCloud. Das Unternehmen beschreibt die Architektur als Vorschau auf die kommende Qwen4-Generation.
Die N-gram-Schicht sitzt im Arbeitsspeicher
Die auffälligste Neuerung ist eine N-gram-Embedding-Schicht mit 51 Milliarden Parametern. Sie legt häufige Wortgruppen als eigene Einträge ab – the-decoder vergleicht das mit einem „Phrasenlexikon". Entscheidend für die Kosten: Diese Schicht kann im normalen Arbeitsspeicher liegen statt im teuren GPU-Speicher.
Genau dieser Baustein soll laut the-decoder in Qwen4 übernommen werden. Damit ist Flash-Next weniger ein Endpunkt als ein öffentlicher Feldversuch für die nächste Modellreihe.
Kontext und Verfügbarkeit
Nativ verarbeitet das Modell 262.144 Token. Mit dem Skalierungsverfahren YaRN lässt sich das Fenster auf 1 Million Token strecken. Zusammen mit der Apache-2.0-Lizenz heißt das: Wer die Hardware hat, darf das Modell auch kommerziell selbst betreiben.
Benchmarks – Zahlen des Herstellers
Die folgenden Werte stammen aus Alibabas eigenem Bericht. Eine unabhängige Nachmessung liegt bislang in keiner der ausgewerteten Quellen vor.
| Benchmark | Qwen3.8-Flash-Next |
|---|---|
| DeepSWE 1.1 | 58,7 |
| SWE-bench Pro | 62,5 |
| CoWorkBench | 73,9 |
| JobBench | 55,7 |
| GPQA Diamond | 91,7 |
| LiveCodeBench v6 | 91,9 |
Der Preis ist das eigentliche Argument
Über QwenCloud kostet Flash-Next 0,16 US-Dollar je Million Input-Token und 0,47 US-Dollar je Million Output-Token. Das hauseigene Spitzenmodell Qwen3.8-Max liegt bei 2,00 US-Dollar Input und 6,00 US-Dollar Output. the-decoder.de beziffert das Verhältnis auf etwa 1:12.
Dazu kommt die Trainingsseite: Flash-Next habe nur rund ein Neuntel der Trainingskosten von Qwen3.7-Plus verursacht und dabei besser abgeschnitten. Auch das ist eine Herstellerangabe ohne externe Prüfung. Alibaba selbst rahmt die Veröffentlichung mit dem Ziel „ultimativer Kosteneffizienz".
Erster Praxiseindruck
Der Entwickler Simon Willison hat das Modell nach eigener Darstellung auf einem DGX Spark ausprobiert und dabei quantisierte Fassungen von 72,5 GB und 78,9 GB verwendet. Sein Beitrag ist ein kurzer Notizposten mit Bildausgaben, keine systematische Messung. Eine offizielle Mindestanforderung an den Speicher nennt keine der drei Quellen.
Was offen bleibt
Unbeantwortet sind der genaue Erscheinungstermin von Qwen4, die Datengrundlage des Trainings und die Frage, wie sich die N-gram-Schicht bei langen Kontexten auf den Durchsatz auswirkt. Wer die Benchmark-Werte gegenprüfen will, muss auf unabhängige Läufe warten. Bis dahin gilt: nachvollziehbar ist die Lizenz, belegt sind die Preise, offen ist die Leistung unter fremder Messung.
Häufige Fragen
Was ist Qwen3.8-Flash-Next?
Ein multimodales Mixture-of-Experts-Modell von Alibaba mit 125 Milliarden Parametern, von denen pro Token 6 Milliarden aktiv sind. Es erschien am 26.08.2026 unter Apache 2.0 und dient laut Alibaba als Architektur-Vorschau auf Qwen4.
Was kostet Qwen3.8-Flash-Next?
Über QwenCloud 0,16 US-Dollar je Million Input-Token und 0,47 US-Dollar je Million Output-Token. Zum Vergleich: Qwen3.8-Max kostet 2,00 US-Dollar beziehungsweise 6,00 US-Dollar. Die Gewichte selbst sind unter Apache 2.0 frei verfügbar.
Wie viel Speicher braucht Qwen3.8-Flash-Next lokal?
Eine offizielle Angabe gibt es in den ausgewerteten Quellen nicht. Simon Willison nutzte quantisierte Fassungen von 72,5 GB und 78,9 GB auf einem DGX Spark. Die 51 Milliarden Parameter der N-gram-Schicht können im Arbeitsspeicher liegen.