DeepSeek-V4-Flash-0731 (155 GB MoE) auf DGX Spark mit 2-bit-Quantisierung
Warum es zählt
Zeigt, dass ein 155-GB-MoE-Modell auf Consumer-naher Hardware (DGX Spark) läuft – mit konkreten Gotchas: ARM64-Build nativ auf dem Gerät, 128-GB-Swapfile nötig, sm_120-Cubins laufen auf sm_121 per Minor-Version-Kompatibilität. MTP-Head bringt bis +31,5% Decode-Speed bei niedriger Konkurrenz.
— Lumeric Redaktion
Decode-Throughput (tok/s, Concurrency 1) · Spitzenwert
25.2%
MTP (conc1)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
DeepSeek-V4-Flash-0731 (155 GB MoE) auf DGX Spark mit 2-bit-Quantisierung
Warum es zählt
Zeigt, dass ein 155-GB-MoE-Modell auf Consumer-naher Hardware (DGX Spark) läuft – mit konkreten Gotchas: ARM64-Build nativ auf dem Gerät, 128-GB-Swapfile nötig, sm_120-Cubins laufen auf sm_121 per Minor-Version-Kompatibilität. MTP-Head bringt bis +31,5% Decode-Speed bei niedriger Konkurrenz.
— Lumeric Redaktion
Decode-Throughput (tok/s, Concurrency 1) · Spitzenwert
25.2%
MTP (conc1)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.