Qwen3.8-Flash-Next mit ExLlamaV3 auf einzelner RX 9700: 863 t/s Prefill, 35 t/s Decode bei 230k Kontext
ToolsQwen
CompaniesAMD
Warum es zählt
Zeigt, dass große MoE-Modelle mit CPU-GPU-Offloading (112 von 512 Experts auf GPU), ngram-Tabellen vom NVMe und ExLlamaV3 auf Consumer-AMD-Hardware praxistauglich bei sehr langen Kontexten laufen. Nützlich als Referenzwert für lokale Long-Context-Setups mit RX 9700.
— Lumeric Redaktion
863 t/s Prefill / 34,7 t/s Decode
bei 230k Kontext auf einer RX 9700
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Qwen3.8-Flash-Next mit ExLlamaV3 auf einzelner RX 9700: 863 t/s Prefill, 35 t/s Decode bei 230k Kontext
ToolsQwen
CompaniesAMD
Warum es zählt
Zeigt, dass große MoE-Modelle mit CPU-GPU-Offloading (112 von 512 Experts auf GPU), ngram-Tabellen vom NVMe und ExLlamaV3 auf Consumer-AMD-Hardware praxistauglich bei sehr langen Kontexten laufen. Nützlich als Referenzwert für lokale Long-Context-Setups mit RX 9700.
— Lumeric Redaktion
863 t/s Prefill / 34,7 t/s Decode
bei 230k Kontext auf einer RX 9700
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.