llama.cpp PR: Hot-MoE-Expert-Caching verdoppelt Inferenzgeschwindigkeit mit 8 GB VRAM
Warum es zählt
Größere MoE-Modelle lassen sich damit auf Consumer-GPUs mit 8–12 GB VRAM deutlich schneller betreiben, ohne zu aggressiven Quantisierungen greifen zu müssen. Der Effekt ist jedoch modellabhängig – bei geringem Expert-Reuse (z.B. Qwen3.5-122B-A10B) war Caching sogar langsamer.
— Lumeric Redaktion
Qwen3.6-35B-A3B Inferenz (tok/s, 8 GB VRAM, Q2_M) · Spitzenwert
33.25%
Ohne Caching (Q2_M)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com1w
VRAM-Disk-Cache-Strategie erreicht 340 pp/s für Kimi K2.7 auf DGX Spark
- FORSCHUNGreddit.com2w
MoE-Expert-Prefetching via MTP-Head: 78% Hit-Rate bei CPU/GPU-Offload
- BENCHMARKreddit.com1w
llama.cpp: E-Cores schneller als P-Cores bei MoE-Modell mit GPU+CPU-Offloading
- MEINUNGreddit.com0mo
KV-Cache-Skalierung bei Mixture-of-Experts-Modellen erklärt
llama.cpp PR: Hot-MoE-Expert-Caching verdoppelt Inferenzgeschwindigkeit mit 8 GB VRAM
Warum es zählt
Größere MoE-Modelle lassen sich damit auf Consumer-GPUs mit 8–12 GB VRAM deutlich schneller betreiben, ohne zu aggressiven Quantisierungen greifen zu müssen. Der Effekt ist jedoch modellabhängig – bei geringem Expert-Reuse (z.B. Qwen3.5-122B-A10B) war Caching sogar langsamer.
— Lumeric Redaktion
Qwen3.6-35B-A3B Inferenz (tok/s, 8 GB VRAM, Q2_M) · Spitzenwert
33.25%
Ohne Caching (Q2_M)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com1w
VRAM-Disk-Cache-Strategie erreicht 340 pp/s für Kimi K2.7 auf DGX Spark
- FORSCHUNGreddit.com2w
MoE-Expert-Prefetching via MTP-Head: 78% Hit-Rate bei CPU/GPU-Offload
- BENCHMARKreddit.com1w
llama.cpp: E-Cores schneller als P-Cores bei MoE-Modell mit GPU+CPU-Offloading
- MEINUNGreddit.com0mo
KV-Cache-Skalierung bei Mixture-of-Experts-Modellen erklärt