DeepSeek-V4-Flash-0731: 1M-Kontext auf einer RTX 5090 mit CPU-Offloading
Warum es zählt
Zeigt, dass das 284B-MoE-Modell mit 1M Kontext auf Consumer-Hardware lauffähig ist, wenn Experten ins System-RAM ausgelagert werden. DSpark-Spekulation liefert bis zu 17,9 t/s bei 89,8 % Akzeptanzrate – praktisch relevant für lokale Agentic-Coding-Workflows.
— Lumeric Redaktion
~800 t/s Prefill, 17,9 t/s Decode
auf RTX 5090 + 256 GB DDR5, 1M Kontext
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
DeepSeek-V4-Flash-0731: 1M-Kontext auf einer RTX 5090 mit CPU-Offloading
Warum es zählt
Zeigt, dass das 284B-MoE-Modell mit 1M Kontext auf Consumer-Hardware lauffähig ist, wenn Experten ins System-RAM ausgelagert werden. DSpark-Spekulation liefert bis zu 17,9 t/s bei 89,8 % Akzeptanzrate – praktisch relevant für lokale Agentic-Coding-Workflows.
— Lumeric Redaktion
~800 t/s Prefill, 17,9 t/s Decode
auf RTX 5090 + 256 GB DDR5, 1M Kontext
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.