LIVE
Alle Meldungen ›
AI IN LIFENEWS
Tools & AnwendungenWirtschaft & DealsKI-ModelleGesellschaftChips & InfrastrukturForschungSicherheitRegulierung & RechtRobotik OpenAIAnthropicGoogle & DeepMindAlibaba / QwenxAIMetaByteDance
StartKI-Modelle › MODELLE
MODELLE

llama.cpp 0.4.1: drei neue Modellarchitekturen

Das Patch-Release bringt Maple 20B-A1B, Tencent Hy 4 und Spark2.5, räumt die JSON-Schema-Verarbeitung auf und hebt ggml auf v0.24.0.

llama.cpp 0.4.1: drei neue Modellarchitekturen
Symbolbild: Eine geöffnete Workstation arbeitet auf der Werkbank, daneben zeigt ein Monitor abstrakte Farbblöcke.

Kurz gesagt

llama.cpp 0.4.1 ist ein Patch auf 0.4.0, der drei neue Modellarchitekturen ergänzt - Maple 20B-A1B, Tencent Hy 4 und Spark2.5 - und ggml von v0.23.0 auf v0.24.0 hebt.

Auf einen Blick

  • Patch-Release auf v0.4.0, laut Release-Seite vom 14. September; ein Jahr nennt die Seite nicht.
  • Neu: Maple 20B-A1B (ternäres MoE, CPU), Tencent Hy 4 als Preview (hy_v4), Spark2.5.
  • Die Rechenbibliothek ggml steigt von v0.23.0 auf v0.24.0.
  • API-Änderung: llama_sampler_chain_n() liefert int32_t statt int (PR #28631).
  • Entfernt: die veralteten Argumente --mmap, --mlock und --direct-io (PR #28334).

llama.cpp 0.4.1 ist ein Patch auf 0.4.0 und bleibt ein Wartungs-Release: Es ergänzt drei Modellarchitekturen, sortiert die JSON-Schema-Verarbeitung neu und zieht die Rechenbibliothek ggml von v0.23.0 auf v0.24.0 nach.

Drei neue Architekturen

Neu unterstützt werden Maple 20B-A1B, eine ternäre MoE-Architektur zunächst auf der CPU (PR #27000), die Preview-Architektur Tencent Hy 4 unter dem Kürzel hy_v4 (#28127) sowie Spark2.5 (#27868). Für die Konvertierung von HF nach GGUF kommt der Schalter --fuse-qkv dazu (#22780).

Dazu kommen Korrekturen an bereits unterstützten Familien. Für Kimi-K3 lässt sich der rekurrente Zustand jetzt zurückrollen (#28466), die KV-Cache-Reservierung für MTP-Kontexte bei DeepSeek2 und GLM-MoE wurde repariert (#28630), und die GDN-Normalisierung für Qwen-, Kimi- und GLM-Modelle rechnet statt mit max nun mit rsqrt (#28068). Bei Granite und Granite3 MoE stimmen die ausgewiesenen Parameterzahlen wieder (#28643, #28632).

Schema, Parser, Logs

Die JSON-Schema-Behandlung läuft nun über eine gemeinsame Darstellung namens common_schema (#28736), die spezialisierten Chat-Parser wandern nach common/parsers (#27764). Das ist Infrastrukturarbeit, die für Anwendungen mit erzwungenem Ausgabeformat und Tool-Aufrufen die wichtigere Hälfte dieses Releases sein dürfte.

Neu ist strukturiertes Logging im JSONL-Format über --log-jsonl und die Variable LOG_JSON (#28437, #28586). Gestrichen wurden die veralteten Argumente --mmap, --mlock und --direct-io (#28334). Wer sie in Startskripten stehen hat, muss vor dem Update nachziehen.

Server und Oberfläche

Die Kindprozesse des Routers überwacht jetzt ein einzelner Monitor-Thread (#28555); dafür kamen server_subproc und waiter in server-common.h dazu. Ein Hänger in der LRU-Verwaltung bei mehreren Anfragen auf dasselbe Modell ist behoben (#28539), und Downloads sind auch dann erlaubt, wenn --models-max erreicht ist (#28530).

Kontext-Checkpoints werden nicht mehr verworfen, wenn der Prompt kürzer als checkpoint_min_step ist (#28302); --reasoning-preserve ist ab sofort Standard (#28437). In der Web-Oberfläche werden Chat-Nachrichten verzögert gemountet (#28460), Assets landen in einem Cache (#28802) und werden per CMake direkt eingebettet (#28445), dazu kommt ein Fix für MCP-Bildanhänge in Tool-Blöcken (#28089).

An der C-API ändert sich genau eine Signatur: llama_sampler_chain_n() gibt int32_t statt int zurück (#28631).

Was die Release-Seite offenlässt

Die Notizen nennen den 14. September als Datum, aber kein Jahr. Der Assets-Block der Seite lud beim Abruf nicht, deshalb ließen sich Dateinamen, Plattformen und Größen der Binärpakete nicht prüfen. Eine Zahl der Beitragenden steht dort ebenfalls nicht; vermerkt ist lediglich, dass seit diesem Tag fünf Commits auf dem Branch gelandet sind.

Für diese Meldung war nur die Release-Seite selbst verfügbar, also eine einzige Quelle. Benchmarks, Geschwindigkeitsvergleiche oder Aussagen zur Reife der drei neuen Architekturen stehen dort nicht - entsprechend behauptet dieser Text sie auch nicht.

◈ KI-GENERIERTER BERICHT · QUELLEN VERLINKT

Häufige Fragen

Welche Modelle unterstützt llama.cpp 0.4.1 neu?

Maple 20B-A1B als ternäre MoE-Architektur auf der CPU, Tencent Hy 4 als Preview unter dem Kürzel hy_v4 und Spark2.5. Dazu kommen Korrekturen für Kimi-K3, DeepSeek2, GLM-MoE, Qwen und Granite.

Muss ich nach dem Update meine Startskripte anpassen?

Möglicherweise ja: Die Argumente --mmap, --mlock und --direct-io wurden entfernt (#28334). Neu hinzugekommen sind --log-jsonl für JSONL-Logs und --fuse-qkv bei der GGUF-Konvertierung.

Was ändert sich am llama.cpp-Server?

Die Kindprozesse des Routers überwacht ein einzelner Monitor-Thread, ein LRU-Hänger bei parallelen Anfragen auf dasselbe Modell ist behoben, und --reasoning-preserve ist jetzt Standard.

Quellen

Weitere Berichte