llama.cpp Release b9297 bringt NVFP4 und Multi-Token-Prediction
Release b9297 von llama.cpp, dem quelloffenen Inferenz-Framework von ggml-org, führt zwei bislang getrennte Leistungsmerkmale zusammen: NVFP4-Quantisierung und Multi-Token Prediction (MTP). NVFP4 ist ein von NVIDIA eingeführtes 4-Bit-Floating-Point-Format, das speziell auf Tensor-Cores moderner NVIDIA-GPUs ausgelegt ist und gegenüber klassischen INT4-Verfahren eine höhere numerische Präzision bei vergleichbarem Speicherbedarf verspricht. MTP wiederum ist ein Dekodierverfahren, bei dem das Modell in einem Schritt mehrere Token vorhersagt, was den Durchsatz bei der Textgenerierung deutlich steigern kann, ohne das Modell selbst austauschen zu müssen. Vor diesem Release mussten Nutzer, die beide Techniken nutzen wollten, auf separate Toolchains oder Patches zurückgreifen. Mit b9297 sind beide Features nun nativ in einem Build kombinierbar, was den Einstieg für Local-LLM-Nutzer auf NVIDIA-Hardware erheblich vereinfacht. Der Post stammt vom Reddit-Nutzer mossy_troll_84 und verweist direkt auf die offizielle Release-Seite des llama.cpp-Repositories unter github.com/ggml-org/llama.cpp.
- Release-Tag: b9297 im Repository ggml-org/llama.cpp auf GitHub
- NVFP4 ist ein NVIDIA-spezifisches 4-Bit-Floating-Point-Format, optimiert für moderne Tensor-Cores
- MTP (Multi-Token Prediction) erhöht den Dekodier-Durchsatz, indem mehrere Token pro Schritt vorhergesagt werden
- Die Kombination beider Features war laut Post zuvor in llama.cpp nicht gleichzeitig verfügbar
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
llama.cpp Release b9297 bringt NVFP4 und Multi-Token-Prediction
Release b9297 von llama.cpp, dem quelloffenen Inferenz-Framework von ggml-org, führt zwei bislang getrennte Leistungsmerkmale zusammen: NVFP4-Quantisierung und Multi-Token Prediction (MTP). NVFP4 ist ein von NVIDIA eingeführtes 4-Bit-Floating-Point-Format, das speziell auf Tensor-Cores moderner NVIDIA-GPUs ausgelegt ist und gegenüber klassischen INT4-Verfahren eine höhere numerische Präzision bei vergleichbarem Speicherbedarf verspricht. MTP wiederum ist ein Dekodierverfahren, bei dem das Modell in einem Schritt mehrere Token vorhersagt, was den Durchsatz bei der Textgenerierung deutlich steigern kann, ohne das Modell selbst austauschen zu müssen. Vor diesem Release mussten Nutzer, die beide Techniken nutzen wollten, auf separate Toolchains oder Patches zurückgreifen. Mit b9297 sind beide Features nun nativ in einem Build kombinierbar, was den Einstieg für Local-LLM-Nutzer auf NVIDIA-Hardware erheblich vereinfacht. Der Post stammt vom Reddit-Nutzer mossy_troll_84 und verweist direkt auf die offizielle Release-Seite des llama.cpp-Repositories unter github.com/ggml-org/llama.cpp.
- Release-Tag: b9297 im Repository ggml-org/llama.cpp auf GitHub
- NVFP4 ist ein NVIDIA-spezifisches 4-Bit-Floating-Point-Format, optimiert für moderne Tensor-Cores
- MTP (Multi-Token Prediction) erhöht den Dekodier-Durchsatz, indem mehrere Token pro Schritt vorhergesagt werden
- Die Kombination beider Features war laut Post zuvor in llama.cpp nicht gleichzeitig verfügbar
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.