llama.cpp 0.4.1: drei neue Modellarchitekturen
Das Patch-Release bringt Maple 20B-A1B, Tencent Hy 4 und Spark2.5, räumt die JSON-Schema-Verarbeitung auf und hebt ggml auf v0.24.0.
Kurz gesagt
llama.cpp 0.4.1 ist ein Patch auf 0.4.0, der drei neue Modellarchitekturen ergänzt - Maple 20B-A1B, Tencent Hy 4 und Spark2.5 - und ggml von v0.23.0 auf v0.24.0 hebt.
Auf einen Blick
- Patch-Release auf v0.4.0, laut Release-Seite vom 14. September; ein Jahr nennt die Seite nicht.
- Neu: Maple 20B-A1B (ternäres MoE, CPU), Tencent Hy 4 als Preview (hy_v4), Spark2.5.
- Die Rechenbibliothek ggml steigt von v0.23.0 auf v0.24.0.
- API-Änderung: llama_sampler_chain_n() liefert int32_t statt int (PR #28631).
- Entfernt: die veralteten Argumente --mmap, --mlock und --direct-io (PR #28334).
llama.cpp 0.4.1 ist ein Patch auf 0.4.0 und bleibt ein Wartungs-Release: Es ergänzt drei Modellarchitekturen, sortiert die JSON-Schema-Verarbeitung neu und zieht die Rechenbibliothek ggml von v0.23.0 auf v0.24.0 nach.
Drei neue Architekturen
Neu unterstützt werden Maple 20B-A1B, eine ternäre MoE-Architektur zunächst auf der CPU (PR #27000), die Preview-Architektur Tencent Hy 4 unter dem Kürzel hy_v4 (#28127) sowie Spark2.5 (#27868). Für die Konvertierung von HF nach GGUF kommt der Schalter --fuse-qkv dazu (#22780).
Dazu kommen Korrekturen an bereits unterstützten Familien. Für Kimi-K3 lässt sich der rekurrente Zustand jetzt zurückrollen (#28466), die KV-Cache-Reservierung für MTP-Kontexte bei DeepSeek2 und GLM-MoE wurde repariert (#28630), und die GDN-Normalisierung für Qwen-, Kimi- und GLM-Modelle rechnet statt mit max nun mit rsqrt (#28068). Bei Granite und Granite3 MoE stimmen die ausgewiesenen Parameterzahlen wieder (#28643, #28632).
Schema, Parser, Logs
Die JSON-Schema-Behandlung läuft nun über eine gemeinsame Darstellung namens common_schema (#28736), die spezialisierten Chat-Parser wandern nach common/parsers (#27764). Das ist Infrastrukturarbeit, die für Anwendungen mit erzwungenem Ausgabeformat und Tool-Aufrufen die wichtigere Hälfte dieses Releases sein dürfte.
Neu ist strukturiertes Logging im JSONL-Format über --log-jsonl und die Variable LOG_JSON (#28437, #28586). Gestrichen wurden die veralteten Argumente --mmap, --mlock und --direct-io (#28334). Wer sie in Startskripten stehen hat, muss vor dem Update nachziehen.
Server und Oberfläche
Die Kindprozesse des Routers überwacht jetzt ein einzelner Monitor-Thread (#28555); dafür kamen server_subproc und waiter in server-common.h dazu. Ein Hänger in der LRU-Verwaltung bei mehreren Anfragen auf dasselbe Modell ist behoben (#28539), und Downloads sind auch dann erlaubt, wenn --models-max erreicht ist (#28530).
Kontext-Checkpoints werden nicht mehr verworfen, wenn der Prompt kürzer als checkpoint_min_step ist (#28302); --reasoning-preserve ist ab sofort Standard (#28437). In der Web-Oberfläche werden Chat-Nachrichten verzögert gemountet (#28460), Assets landen in einem Cache (#28802) und werden per CMake direkt eingebettet (#28445), dazu kommt ein Fix für MCP-Bildanhänge in Tool-Blöcken (#28089).
An der C-API ändert sich genau eine Signatur: llama_sampler_chain_n() gibt int32_t statt int zurück (#28631).
Was die Release-Seite offenlässt
Die Notizen nennen den 14. September als Datum, aber kein Jahr. Der Assets-Block der Seite lud beim Abruf nicht, deshalb ließen sich Dateinamen, Plattformen und Größen der Binärpakete nicht prüfen. Eine Zahl der Beitragenden steht dort ebenfalls nicht; vermerkt ist lediglich, dass seit diesem Tag fünf Commits auf dem Branch gelandet sind.
Für diese Meldung war nur die Release-Seite selbst verfügbar, also eine einzige Quelle. Benchmarks, Geschwindigkeitsvergleiche oder Aussagen zur Reife der drei neuen Architekturen stehen dort nicht - entsprechend behauptet dieser Text sie auch nicht.
Häufige Fragen
Welche Modelle unterstützt llama.cpp 0.4.1 neu?
Maple 20B-A1B als ternäre MoE-Architektur auf der CPU, Tencent Hy 4 als Preview unter dem Kürzel hy_v4 und Spark2.5. Dazu kommen Korrekturen für Kimi-K3, DeepSeek2, GLM-MoE, Qwen und Granite.
Muss ich nach dem Update meine Startskripte anpassen?
Möglicherweise ja: Die Argumente --mmap, --mlock und --direct-io wurden entfernt (#28334). Neu hinzugekommen sind --log-jsonl für JSONL-Logs und --fuse-qkv bei der GGUF-Konvertierung.
Was ändert sich am llama.cpp-Server?
Die Kindprozesse des Routers überwacht ein einzelner Monitor-Thread, ein LRU-Hänger bei parallelen Anfragen auf dasselbe Modell ist behoben, und --reasoning-preserve ist jetzt Standard.