DeepSeek V4 Flash mit ~105 t/s auf zwei Nvidia 4090d 48G via vLLM
Reddit-Nutzer iSevenDays betreibt DeepSeek V4 Flash auf einem Dell R740 mit zwei 4090d-GPUs à 48 GB VRAM, verbunden über einen P2P-Patch für das open-gpu-kernel-module (Branch 595.71.05-p2p-48g von Duanyll auf GitHub). Da die Blackwell-nativen Kernels — DeepGEMM, FlashInfer sparse-MLA und block-skaliertes FP8 — auf SM89 (Ada Lovelace) schlicht nicht existieren, reimplementierte er sie mit KI-Unterstützung vollständig in Triton. Das Ergebnis ist das Projekt vLLM-Moet, das als angepasstes Docker-Image (Dockerfile.sm89-v0251) auf SM89-Hardware lauffähig ist. Beim Start wird DeepSeek-V4-Flash automatisch auf ca. IQ2 quantisiert, damit das Modell in die 96 GB VRAM-Gesamtkapazität passt; dieser Vorgang kann je nach Hardware bis zu 60 Minuten dauern. Mit Tensor-Parallelism 2 (TP=2) und aktiviertem MTP (Multi-Token Prediction, MTP_TOKENS=1) sowie erzwungener GPU-Residency erreicht der Nutzer ~105 Tokens/Sekunde und nutzt einen Kontextfenster von 262.144 Tokens. Zum Vergleich lief llama.cpp mit dem selben Modell (IQ2XXS-GGUF, split-mode layer, -ts 43,43) zwar stabil, bot aber 2–3× geringeren Durchsatz bei parallelen Agentic-Anfragen. Der Autor gibt an, die Performance-Grenze noch nicht erreicht zu haben und hält weitere Verbesserungen für wahrscheinlich.
- Hardware-Setup: Dell R740 mit zwei Nvidia 4090d à 48 GB (Ada Lovelace, SM89), P2P-Verbindung via Open-GPU-Kernel-Module-Fork (Branch 595.71.05-p2p-48g).
- Quantisierung: Modell wird beim ersten Start automatisch auf ~IQ2 komprimiert, damit es in 96 GB VRAM passt — Dauer bis zu 60 Minuten.
- vLLM-Moet: Angepasstes vLLM-Fork von iSevenDays auf GitHub, Build via Dockerfile.sm89-v0251; unterstützt auch Single-GPU-Betrieb via TP=1.
- llama.cpp-Vergleich: Verwendet GGUF-Datei DeepSeek-V4-Flash-IQ2XXS-w2Q2K-AProjQ8-SExpQ8-OutQ8 mit Flags -ts 43,43, -fa on und 262k Kontext, bleibt aber 2–3× langsamer.
- Inspiration: Post über ~160 t/s auf RTX 6000 Blackwell (96 GB) in r/LocalLLM diente als Ausgangspunkt für die SM89-Portierung.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
DeepSeek V4 Flash mit ~105 t/s auf zwei Nvidia 4090d 48G via vLLM
Reddit-Nutzer iSevenDays betreibt DeepSeek V4 Flash auf einem Dell R740 mit zwei 4090d-GPUs à 48 GB VRAM, verbunden über einen P2P-Patch für das open-gpu-kernel-module (Branch 595.71.05-p2p-48g von Duanyll auf GitHub). Da die Blackwell-nativen Kernels — DeepGEMM, FlashInfer sparse-MLA und block-skaliertes FP8 — auf SM89 (Ada Lovelace) schlicht nicht existieren, reimplementierte er sie mit KI-Unterstützung vollständig in Triton. Das Ergebnis ist das Projekt vLLM-Moet, das als angepasstes Docker-Image (Dockerfile.sm89-v0251) auf SM89-Hardware lauffähig ist. Beim Start wird DeepSeek-V4-Flash automatisch auf ca. IQ2 quantisiert, damit das Modell in die 96 GB VRAM-Gesamtkapazität passt; dieser Vorgang kann je nach Hardware bis zu 60 Minuten dauern. Mit Tensor-Parallelism 2 (TP=2) und aktiviertem MTP (Multi-Token Prediction, MTP_TOKENS=1) sowie erzwungener GPU-Residency erreicht der Nutzer ~105 Tokens/Sekunde und nutzt einen Kontextfenster von 262.144 Tokens. Zum Vergleich lief llama.cpp mit dem selben Modell (IQ2XXS-GGUF, split-mode layer, -ts 43,43) zwar stabil, bot aber 2–3× geringeren Durchsatz bei parallelen Agentic-Anfragen. Der Autor gibt an, die Performance-Grenze noch nicht erreicht zu haben und hält weitere Verbesserungen für wahrscheinlich.
- Hardware-Setup: Dell R740 mit zwei Nvidia 4090d à 48 GB (Ada Lovelace, SM89), P2P-Verbindung via Open-GPU-Kernel-Module-Fork (Branch 595.71.05-p2p-48g).
- Quantisierung: Modell wird beim ersten Start automatisch auf ~IQ2 komprimiert, damit es in 96 GB VRAM passt — Dauer bis zu 60 Minuten.
- vLLM-Moet: Angepasstes vLLM-Fork von iSevenDays auf GitHub, Build via Dockerfile.sm89-v0251; unterstützt auch Single-GPU-Betrieb via TP=1.
- llama.cpp-Vergleich: Verwendet GGUF-Datei DeepSeek-V4-Flash-IQ2XXS-w2Q2K-AProjQ8-SExpQ8-OutQ8 mit Flags -ts 43,43, -fa on und 262k Kontext, bleibt aber 2–3× langsamer.
- Inspiration: Post über ~160 t/s auf RTX 6000 Blackwell (96 GB) in r/LocalLLM diente als Ausgangspunkt für die SM89-Portierung.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.