llama.cpp: Über 50 offene PRs für CPU/RAM/Disk-Inferenz-Optimierung
Der Reddit-Nutzer /u/pmttyji hat sich die Mühe gemacht, nahezu alle offenen Pull Requests im llama.cpp-Repository zu sichten und diejenigen zusammenzustellen, die für CPU-only- und Hybrid-Inferenz (CPU+GPU, RAM+Disk) relevant sind. Die Liste umfasst über 50 PRs und Diskussionen, geordnet nach Themenbereich: Neben architekturspezifischen SIMD-Optimierungen für x86 (AVX2, AVX-512, AVX-VNNI), ARM (NEON, I8MM, SVE) und RISC-V (RVV, Xtheadvector) finden sich PRs zu MoE-spezifischen Features wie Hot-Expert-Pinning (PR #26414 `--pin-hot-experts`), Lazy-Loading von MoE-Experten aus dem Disk-Speicher (PR #26003 `--lazy-experts`) sowie VRAM-Caching häufig genutzter CPU-seitiger Experten (Diskussion #24528). Ein eigener Abschnitt widmet sich neuen Quantisierungsformaten: MXFP8 (PR #26157), MXFP6 (PR #22671), FP8/E4M3 (PR #25336) und ROCmFP4 (PR #24185) sollen das Spektrum jenseits der klassischen GGUF-Quanttypen erweitern. Weitere PRs adressieren NUMA-Architekturen – sowohl Weight-Mirroring auf alle NUMA-Nodes (PR #16000) als auch eine Migration-Strategie zur Reduzierung von Cross-NUMA-Operationen (PR #14232). Work-Stealing-Scheduling ersetzt das bisherige zyklische Chunk-Verfahren (PR #25048), und ein KV-Cache-Klon-Endpunkt für den Server (PR #26204) soll Multi-Slot-Szenarien effizienter machen. Die Community zielt darauf ab, möglichst viele dieser PRs noch bis Ende des Jahres zu mergen – explizit adressiert an Entwickler, die sich einbringen können.
- MoE-Disk-Offloading für Apples Metal-Backend ist ebenfalls in der Liste (PR #23440) — nicht nur x86/ARM-Nutzer profitieren.
- PR #26348 verspricht für VNNI-kompatible CPUs einen 3×-Speedup beim Q2_0-Dot-Product durch einen neuen AVX2-VNNI-Pfad.
- PR #23309 verbessert ggml_gemv_q4_K für AVX-VNNI-Systeme um 12–23 % tok/s.
- Die STQ1_0-Ternär-Quantisierung (PR #22836) erhält sowohl einen ARM-NEON- als auch einen AVX2-Kernel (PR #27377) — ein neuer Quanttyp parallel zur laufenden Infrastrukturarbeit.
- PR #27483 zielt speziell darauf ab, RAM-Spitzen beim Modellladen zu vermeiden — relevant für Systeme, die knapp über der Modellgröße liegen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com3d
Community fragt nach llama.cpp Flash-Kernel für DeepSeek V4.1
- MEINUNGreddit.com2d
Community fordert Hot Expert Reload auf GPU für MoE-Modelle in llama.cpp
- LAUNCHreddit.com3w
llama.cpp: Offener PR für --n-cpu-ffn Option bei Dense-Modellen
- FORSCHUNGreddit.com1w
llama.cpp Metal-Optimierung beschleunigt MoE-Decode auf Apple Silicon
llama.cpp: Über 50 offene PRs für CPU/RAM/Disk-Inferenz-Optimierung
Der Reddit-Nutzer /u/pmttyji hat sich die Mühe gemacht, nahezu alle offenen Pull Requests im llama.cpp-Repository zu sichten und diejenigen zusammenzustellen, die für CPU-only- und Hybrid-Inferenz (CPU+GPU, RAM+Disk) relevant sind. Die Liste umfasst über 50 PRs und Diskussionen, geordnet nach Themenbereich: Neben architekturspezifischen SIMD-Optimierungen für x86 (AVX2, AVX-512, AVX-VNNI), ARM (NEON, I8MM, SVE) und RISC-V (RVV, Xtheadvector) finden sich PRs zu MoE-spezifischen Features wie Hot-Expert-Pinning (PR #26414 `--pin-hot-experts`), Lazy-Loading von MoE-Experten aus dem Disk-Speicher (PR #26003 `--lazy-experts`) sowie VRAM-Caching häufig genutzter CPU-seitiger Experten (Diskussion #24528). Ein eigener Abschnitt widmet sich neuen Quantisierungsformaten: MXFP8 (PR #26157), MXFP6 (PR #22671), FP8/E4M3 (PR #25336) und ROCmFP4 (PR #24185) sollen das Spektrum jenseits der klassischen GGUF-Quanttypen erweitern. Weitere PRs adressieren NUMA-Architekturen – sowohl Weight-Mirroring auf alle NUMA-Nodes (PR #16000) als auch eine Migration-Strategie zur Reduzierung von Cross-NUMA-Operationen (PR #14232). Work-Stealing-Scheduling ersetzt das bisherige zyklische Chunk-Verfahren (PR #25048), und ein KV-Cache-Klon-Endpunkt für den Server (PR #26204) soll Multi-Slot-Szenarien effizienter machen. Die Community zielt darauf ab, möglichst viele dieser PRs noch bis Ende des Jahres zu mergen – explizit adressiert an Entwickler, die sich einbringen können.
- MoE-Disk-Offloading für Apples Metal-Backend ist ebenfalls in der Liste (PR #23440) — nicht nur x86/ARM-Nutzer profitieren.
- PR #26348 verspricht für VNNI-kompatible CPUs einen 3×-Speedup beim Q2_0-Dot-Product durch einen neuen AVX2-VNNI-Pfad.
- PR #23309 verbessert ggml_gemv_q4_K für AVX-VNNI-Systeme um 12–23 % tok/s.
- Die STQ1_0-Ternär-Quantisierung (PR #22836) erhält sowohl einen ARM-NEON- als auch einen AVX2-Kernel (PR #27377) — ein neuer Quanttyp parallel zur laufenden Infrastrukturarbeit.
- PR #27483 zielt speziell darauf ab, RAM-Spitzen beim Modellladen zu vermeiden — relevant für Systeme, die knapp über der Modellgröße liegen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com3d
Community fragt nach llama.cpp Flash-Kernel für DeepSeek V4.1
- MEINUNGreddit.com2d
Community fordert Hot Expert Reload auf GPU für MoE-Modelle in llama.cpp
- LAUNCHreddit.com3w
llama.cpp: Offener PR für --n-cpu-ffn Option bei Dense-Modellen
- FORSCHUNGreddit.com1w
llama.cpp Metal-Optimierung beschleunigt MoE-Decode auf Apple Silicon