FreeToken-Fork mit DeepSeek-V4.1, Vision und spekulativem Decoding für 2×RTX 3090
Warum es zählt
Auf 2×RTX 3090 erreicht die Engine bis zu 52,4 tok/s (Median, greedy, MTP off) beim Serving großer MoE-Modelle via CPU+GPU-Offloading. MTP-Spekulativdecoding bringt unter aktueller CUDA-Graph-Konfiguration noch keinen Netto-Gewinn; im Eager-Modus war ein ~1,5× Speed-up messbar.
— Lumeric Redaktion
Throughput auf 2×RTX 3090 (Qwen3.8-Flash-Next-NVFP4, 256 Output Tokens) · Spitzenwert
52.4%
Greedy, MTP off (Median)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
FreeToken-Fork mit DeepSeek-V4.1, Vision und spekulativem Decoding für 2×RTX 3090
Warum es zählt
Auf 2×RTX 3090 erreicht die Engine bis zu 52,4 tok/s (Median, greedy, MTP off) beim Serving großer MoE-Modelle via CPU+GPU-Offloading. MTP-Spekulativdecoding bringt unter aktueller CUDA-Graph-Konfiguration noch keinen Netto-Gewinn; im Eager-Modus war ein ~1,5× Speed-up messbar.
— Lumeric Redaktion
Throughput auf 2×RTX 3090 (Qwen3.8-Flash-Next-NVFP4, 256 Output Tokens) · Spitzenwert
52.4%
Greedy, MTP off (Median)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.