Qwen 3.8 Flash Next mit 130k Kontext auf 16 GB VRAM: Community-Guide
ToolsQwen
Warum es zählt
Der Trick --spec-draft-cpu-moe verlagert Draft-Experten ins RAM, sodass der GPU-Speicher für Hot-Experts des Zielmodells frei bleibt. Damit wird 131k Kontext mit Q4_K_M + Q8-KV auf Consumer-Hardware (16 GB VRAM, 64 GB RAM) erreichbar – mit ~16.5 t/s Generation und ~350 t/s Prefill.
— Lumeric Redaktion
16.5 t/s @ 131k Kontext
Generation-Speed auf RTX 4080 (Q4_K_M, Q8-KV)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen 3.8 Flash Next mit 130k Kontext auf 16 GB VRAM: Community-Guide
ToolsQwen
Warum es zählt
Der Trick --spec-draft-cpu-moe verlagert Draft-Experten ins RAM, sodass der GPU-Speicher für Hot-Experts des Zielmodells frei bleibt. Damit wird 131k Kontext mit Q4_K_M + Q8-KV auf Consumer-Hardware (16 GB VRAM, 64 GB RAM) erreichbar – mit ~16.5 t/s Generation und ~350 t/s Prefill.
— Lumeric Redaktion
16.5 t/s @ 131k Kontext
Generation-Speed auf RTX 4080 (Q4_K_M, Q8-KV)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.