Qwen3.8-Flash-Next: 2,2–2,5× schnelleres Prefill auf 2×RTX 3090 per VRAM-Trick
Warum es zählt
Die Technik (zwei Env-Vars) ist direkt in llama.cpp einsetzbar und senkt die Zeit bis zum ersten Token bei 8k-Prompts von 82 s auf 37 s – ohne Decode-Verluste. Relevant für alle, die MoE-Modelle mit Expert-Offloading auf Consumer-Hardware betreiben.
— Lumeric Redaktion
Prefill-Durchsatz (Qwen3.8-Flash-Next, llama.cpp, 2×RTX 3090) · Spitzenwert
99.9%
8k Kontext (vorher, ub 512)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-Flash-Next: 2,2–2,5× schnelleres Prefill auf 2×RTX 3090 per VRAM-Trick
Warum es zählt
Die Technik (zwei Env-Vars) ist direkt in llama.cpp einsetzbar und senkt die Zeit bis zum ersten Token bei 8k-Prompts von 82 s auf 37 s – ohne Decode-Verluste. Relevant für alle, die MoE-Modelle mit Expert-Offloading auf Consumer-Hardware betreiben.
— Lumeric Redaktion
Prefill-Durchsatz (Qwen3.8-Flash-Next, llama.cpp, 2×RTX 3090) · Spitzenwert
99.9%
8k Kontext (vorher, ub 512)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.