Qwen3.6-27B: Speculative Decoding profitiert stärker von schweren Quants
Warum es zählt
Wer Qwen3.6-27B lokal betreibt, kann durch Kombination von schwerem Quant (Q6/Q8) und DFlash-Speculative-Decoding den höchsten Durchsatz erzielen. MTP ist solider zweiter Fallback; ngram und EAGLE3 lohnen sich kaum. Anomalie: llama.cpp MTP auf UD-Q4 ist pathologisch langsam.
— Lumeric Redaktion
Spec-Decode Speedup (Qwen3.6-27B, Spec-Bench, batch 1) · Spitzenwert
3%
Q8 (DFlash)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.6-27B: Speculative Decoding profitiert stärker von schweren Quants
Warum es zählt
Wer Qwen3.6-27B lokal betreibt, kann durch Kombination von schwerem Quant (Q6/Q8) und DFlash-Speculative-Decoding den höchsten Durchsatz erzielen. MTP ist solider zweiter Fallback; ngram und EAGLE3 lohnen sich kaum. Anomalie: llama.cpp MTP auf UD-Q4 ist pathologisch langsam.
— Lumeric Redaktion
Spec-Decode Speedup (Qwen3.6-27B, Spec-Bench, batch 1) · Spitzenwert
3%
Q8 (DFlash)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.