Expert-only IQ3-Requant von DeepSeek-V4-Flash-0731 mit 1,4× Decode-Speed auf CPU-Spill-Rig
Warum es zählt
Für Nutzer mit gemischten Multi-GPU-Setups, bei denen Experts in den RAM spillen, ermöglicht dieser Ansatz die 3-Bit-Qualitätsstufe ohne Drop auf Q2 – mit messbarer KLD-Verbesserung und 13,9 t/s statt 9,9 t/s. Achtung: bekannte SWA/Rollback-Stall-Bugs in llama.cpp betreffen alle DSV4-GGUFs.
— Lumeric Redaktion
KLD vs. MXFP4 Reference (wikitext-2, 150 chunks, ctx 512) · Spitzenwert
0.2386%
Expert-only IQ3 (dieses Build)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Expert-only IQ3-Requant von DeepSeek-V4-Flash-0731 mit 1,4× Decode-Speed auf CPU-Spill-Rig
Warum es zählt
Für Nutzer mit gemischten Multi-GPU-Setups, bei denen Experts in den RAM spillen, ermöglicht dieser Ansatz die 3-Bit-Qualitätsstufe ohne Drop auf Q2 – mit messbarer KLD-Verbesserung und 13,9 t/s statt 9,9 t/s. Achtung: bekannte SWA/Rollback-Stall-Bugs in llama.cpp betreffen alle DSV4-GGUFs.
— Lumeric Redaktion
KLD vs. MXFP4 Reference (wikitext-2, 150 chunks, ctx 512) · Spitzenwert
0.2386%
Expert-only IQ3 (dieses Build)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.