Qwen3.8-Flash-Next: Von 36 auf 400 t/s Prefill mit zwei RTX 3060
Warum es zählt
Wer Qwen3.8-Flash-Next (125B MoE) lokal auf Multi-GPU-Setups betreibt, sollte zwingend -sm layer statt -sm tensor verwenden und den ubatch-Wert maximieren. ik_llama.cpp vermeidet den Split-Mode-Cliff, braucht aber ~75 GB mehr RAM als llama.cpp mit mmap.
— Lumeric Redaktion
Prefill-Durchsatz (t/s) – Qwen3.8-Flash-Next UD-IQ4_XS, 2× RTX 3060 · Spitzenwert
41.7%
llama.cpp -sm tensor
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-Flash-Next: Von 36 auf 400 t/s Prefill mit zwei RTX 3060
Warum es zählt
Wer Qwen3.8-Flash-Next (125B MoE) lokal auf Multi-GPU-Setups betreibt, sollte zwingend -sm layer statt -sm tensor verwenden und den ubatch-Wert maximieren. ik_llama.cpp vermeidet den Split-Mode-Cliff, braucht aber ~75 GB mehr RAM als llama.cpp mit mmap.
— Lumeric Redaktion
Prefill-Durchsatz (t/s) – Qwen3.8-Flash-Next UD-IQ4_XS, 2× RTX 3060 · Spitzenwert
41.7%
llama.cpp -sm tensor
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.