Qwen3.8-27B Heretic-Quant mit MTP auf 16-GB-GPU: 55–68 tok/s
CompaniesHugging Face
Warum es zählt
Die UD-IQ4_XS-Variante verdoppelt die Decode-Geschwindigkeit gegenüber MTP-losen Läufen (55 vs. 29 tok/s) bei moderatem Qualitätsverlust. Praxishinweise zu VRAM-Spill und Draft-Token-Anzahl sind direkt umsetzbar für lokale Inferenz auf Consumer-Hardware.
— Lumeric Redaktion
KLD vs Q8_0 (Prose, wikitext-2) · Spitzenwert
0.0045%
UD-Q5_K_XL (24 GB)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-27B Heretic-Quant mit MTP auf 16-GB-GPU: 55–68 tok/s
CompaniesHugging Face
Warum es zählt
Die UD-IQ4_XS-Variante verdoppelt die Decode-Geschwindigkeit gegenüber MTP-losen Läufen (55 vs. 29 tok/s) bei moderatem Qualitätsverlust. Praxishinweise zu VRAM-Spill und Draft-Token-Anzahl sind direkt umsetzbar für lokale Inferenz auf Consumer-Hardware.
— Lumeric Redaktion
KLD vs Q8_0 (Prose, wikitext-2) · Spitzenwert
0.0045%
UD-Q5_K_XL (24 GB)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.