exllamav3 schlägt llama.cpp bei CPU-offloaded Inferenz mit 3,2× schnellerem Prefill
Warum es zählt
Für Consumer-Hardware mit gemischtem GPU-/CPU-Setup kann exllamav3 mit EXL3-Quants deutlich höhere Durchsatzraten als llama.cpp erzielen. Der Vorteil ist jedoch modell- und architekturabhängig: Bei GLM 5.3 Flash war exllamav3 auf demselben System 2× langsamer.
— Lumeric Redaktion
CPU-offloaded Decode Speed (tps) – Qwen 3.8 Flash Next · Spitzenwert
25%
exllamav3 (4.05 EXL3)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
exllamav3 schlägt llama.cpp bei CPU-offloaded Inferenz mit 3,2× schnellerem Prefill
Warum es zählt
Für Consumer-Hardware mit gemischtem GPU-/CPU-Setup kann exllamav3 mit EXL3-Quants deutlich höhere Durchsatzraten als llama.cpp erzielen. Der Vorteil ist jedoch modell- und architekturabhängig: Bei GLM 5.3 Flash war exllamav3 auf demselben System 2× langsamer.
— Lumeric Redaktion
CPU-offloaded Decode Speed (tps) – Qwen 3.8 Flash Next · Spitzenwert
25%
exllamav3 (4.05 EXL3)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.