KV-Quantisierung bei Qwen3.6-27B: KLD-Vergleich Q8, Q6, Q5
Der Reddit-Nutzer /u/BitGreen1270 hat auf r/LocalLLaMA einen systematischen KLD-Test (KL-Divergenz) für Qwen3.6-27B in den GGUF-Varianten Q8_0, Q6_K_L und Q5_K_L von bartowski durchgeführt. Als Testumgebung diente eine NVIDIA RTX 5090 mit 64 GB RAM; als Referenz-Baseline wurde Q8_0 ohne jede KV-Quantisierung gewählt, da dies das Maximum ist, das auf der Karte Platz findet. Das Testkorpus besteht aus einem 230-MB-Python-Quellcode-File, zusammengesetzt aus bekannten Open-Source-Projekten wie Transformers, PyTorch und dem Hugging-Face-Ökosystem – bewusst auf Coding-Qualität ausgerichtet. Jeder der 23 Testläufe wurde mit llama-perplexity bei 50 000 Token Kontextlänge, Chunk-Größe 32 und aktiviertem Flash Attention durchgeführt; ein Einzellauf dauerte jeweils 17 Minuten. Die Rohdaten zeigen, dass der V-Cache der dominante Faktor ist: Sobald v auf q4_0 fällt, steigt der KLD-Wert bei Q8 von 0,0054 auf 0,0116 (nur q8_0 auf k) bzw. 0,0208 bei (q4_0, q4_0), während Q6_K_L bei vollem KV mit 0,0108 fast gleichauf liegt. Überraschend: Q5_K_L reagiert toleranter auf V-Cache-Quantisierung als Q8 oder Q6. Die Studie entstand als Follow-up auf einen früheren Post des Nutzers über Context-Erweiterung bei Q8 und beantwortet die Community-Frage, ob ein niedrigerer Quant mit unquantisiertem KV einem höheren Quant mit quantisiertem KV überlegen ist.
- Testkorpus: 230-MB-Python-Datei aus Open-Source-Repos (Transformers, PyTorch, Hugging Face), 50 000 Token Kontext, Chunk-Größe 32 — 23 Läufe à 17 Minuten.
- Rohdaten: Q8_0 (q8_0, q8_0) = KLD 0,00541 | Q6_K_L (q8_0, q8_0) = 0,01071 | Q5_K_L (q8_0, q8_0) = 0,02249 — Abstand Q8 zu Q6 ohne KV: 0,0108.
- V-Cache ist entscheidend: (none, q4_0) ergibt bei Q8 KLD 0,0116 — fast doppelt so hoch wie (q8_0, q8_0); K-Cache-Quantisierung allein hat kaum Effekt.
- Bei (q4_0, q4_0) konvergieren Q8 (0,0208) und Q6_K_L (0,0222) fast — ein Q8-Modell verliert durch aggressives KV seinen Vorteil gegenüber Q6.
- Verwendetes Tool: llama-perplexity mit Flags --kl-divergence-base / --kl-divergence, Flash Attention an, -ngl 99, Temperatur 0,6, top_p 0,95, top_k 20.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
KV-Quantisierung bei Qwen3.6-27B: KLD-Vergleich Q8, Q6, Q5
Der Reddit-Nutzer /u/BitGreen1270 hat auf r/LocalLLaMA einen systematischen KLD-Test (KL-Divergenz) für Qwen3.6-27B in den GGUF-Varianten Q8_0, Q6_K_L und Q5_K_L von bartowski durchgeführt. Als Testumgebung diente eine NVIDIA RTX 5090 mit 64 GB RAM; als Referenz-Baseline wurde Q8_0 ohne jede KV-Quantisierung gewählt, da dies das Maximum ist, das auf der Karte Platz findet. Das Testkorpus besteht aus einem 230-MB-Python-Quellcode-File, zusammengesetzt aus bekannten Open-Source-Projekten wie Transformers, PyTorch und dem Hugging-Face-Ökosystem – bewusst auf Coding-Qualität ausgerichtet. Jeder der 23 Testläufe wurde mit llama-perplexity bei 50 000 Token Kontextlänge, Chunk-Größe 32 und aktiviertem Flash Attention durchgeführt; ein Einzellauf dauerte jeweils 17 Minuten. Die Rohdaten zeigen, dass der V-Cache der dominante Faktor ist: Sobald v auf q4_0 fällt, steigt der KLD-Wert bei Q8 von 0,0054 auf 0,0116 (nur q8_0 auf k) bzw. 0,0208 bei (q4_0, q4_0), während Q6_K_L bei vollem KV mit 0,0108 fast gleichauf liegt. Überraschend: Q5_K_L reagiert toleranter auf V-Cache-Quantisierung als Q8 oder Q6. Die Studie entstand als Follow-up auf einen früheren Post des Nutzers über Context-Erweiterung bei Q8 und beantwortet die Community-Frage, ob ein niedrigerer Quant mit unquantisiertem KV einem höheren Quant mit quantisiertem KV überlegen ist.
- Testkorpus: 230-MB-Python-Datei aus Open-Source-Repos (Transformers, PyTorch, Hugging Face), 50 000 Token Kontext, Chunk-Größe 32 — 23 Läufe à 17 Minuten.
- Rohdaten: Q8_0 (q8_0, q8_0) = KLD 0,00541 | Q6_K_L (q8_0, q8_0) = 0,01071 | Q5_K_L (q8_0, q8_0) = 0,02249 — Abstand Q8 zu Q6 ohne KV: 0,0108.
- V-Cache ist entscheidend: (none, q4_0) ergibt bei Q8 KLD 0,0116 — fast doppelt so hoch wie (q8_0, q8_0); K-Cache-Quantisierung allein hat kaum Effekt.
- Bei (q4_0, q4_0) konvergieren Q8 (0,0208) und Q6_K_L (0,0222) fast — ein Q8-Modell verliert durch aggressives KV seinen Vorteil gegenüber Q6.
- Verwendetes Tool: llama-perplexity mit Flags --kl-divergence-base / --kl-divergence, Flash Attention an, -ngl 99, Temperatur 0,6, top_p 0,95, top_k 20.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.