Qwen3.8-27B als IQ4_XS-Quant mit 262k Kontext auf 24-GB-GPU optimiert
Warum es zählt
36–41 t/s Decode-Speed bei 110k–170k aktiven Kontext-Tokens auf einer RX 7900 XTX, 85 % MTP-Draft-Akzeptanzrate (ca. 2,7 Token/Schritt) – praktisch relevant für lokale Agentic-Coding-Setups mit llama.cpp auf Single-GPU.
— Lumeric Redaktion
85% MTP-Draft-Akzeptanz
bei Tiefe 2, Median aus 98 Requests
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-27B als IQ4_XS-Quant mit 262k Kontext auf 24-GB-GPU optimiert
Warum es zählt
36–41 t/s Decode-Speed bei 110k–170k aktiven Kontext-Tokens auf einer RX 7900 XTX, 85 % MTP-Draft-Akzeptanzrate (ca. 2,7 Token/Schritt) – praktisch relevant für lokale Agentic-Coding-Setups mit llama.cpp auf Single-GPU.
— Lumeric Redaktion
85% MTP-Draft-Akzeptanz
bei Tiefe 2, Median aus 98 Requests
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.