DeepSeek-V4-Flash-0731 lokal mit 23–24 Token/s auf Epyc + RTX 5090
Der Reddit-Nutzer /u/IntravenusDeMilo beschreibt seinen selbst gebauten lokalen Inferenz-Server, der auf einem AMD Epyc 7663 (56-Kern-Server-CPU) mit 256 GB ECC DDR4-3200-RAM und einer einzelnen NVIDIA RTX 5090 (32 GB VRAM, Blackwell-Architektur) basiert. Das Modell DeepSeek-V4-Flash-0731 liegt in der Quantisierung UD-Q8_K_XL vor und beansprucht damit rund 151 GB – deutlich mehr als der VRAM der GPU fassen kann. Der Ansatz setzt deshalb auf CPU-MoE-Offloading: Die Mixture-of-Experts-Schichten werden über den DDR4-Arbeitsspeicher der CPU abgearbeitet, während die RTX 5090 die restlichen Teile übernimmt. Bei Kontextlängen von 100.000 bis 128.000 Tokens erzielt das System 23,8 bis 24,6 Tokens pro Sekunde (Generierung), was für ein Modell dieser Größenordnung lokal bemerkenswert ist. Die Prefill-Geschwindigkeit (Prompt Processing) variiert stark: 60 Token/s beim ersten Prompt, bis zu 385 Token/s bei späteren Anfragen – ein Hinweis auf ausgeprägte KV-Cache-Nutzung. Der Nutzer stellte fest, dass weder FlashAttention (DFlash) noch eine zusätzliche RTX 3090 die Geschwindigkeit verbesserten; beide verlangsamten das System sogar. Das Setup zeigt exemplarisch, dass MoE-Modelle der aktuellen Spitzenklasse auch ohne mehrere High-End-GPUs im vierstelligen Preissegment lokal betreibbar sind.
- Quantisierungsformat UD-Q8_K_XL belegt ~151 GB, weit mehr als die 32 GB VRAM der RTX 5090 – der Großteil der Gewichte liegt im DDR4-RAM.
- FlashAttention (DFlash) wurde wieder entfernt, da es die Token/s bei diesem Setup messbar verschlechterte.
- Eine temporär eingebaute RTX 3090 brachte ebenfalls keine Verbesserung gegenüber der Solo-5090-Konfiguration.
- Prefill-Rate steigt von ~60 Token/s (Kaltstart) auf bis zu 385 Token/s dank KV-Caching bei langen Sessions.
- Der Nutzer bezeichnet sich als Einsteiger im LLM-Bereich und sucht Community-Tipps zu weiteren Modellen und Optimierungen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
DeepSeek-V4-Flash-0731 lokal mit 23–24 Token/s auf Epyc + RTX 5090
Der Reddit-Nutzer /u/IntravenusDeMilo beschreibt seinen selbst gebauten lokalen Inferenz-Server, der auf einem AMD Epyc 7663 (56-Kern-Server-CPU) mit 256 GB ECC DDR4-3200-RAM und einer einzelnen NVIDIA RTX 5090 (32 GB VRAM, Blackwell-Architektur) basiert. Das Modell DeepSeek-V4-Flash-0731 liegt in der Quantisierung UD-Q8_K_XL vor und beansprucht damit rund 151 GB – deutlich mehr als der VRAM der GPU fassen kann. Der Ansatz setzt deshalb auf CPU-MoE-Offloading: Die Mixture-of-Experts-Schichten werden über den DDR4-Arbeitsspeicher der CPU abgearbeitet, während die RTX 5090 die restlichen Teile übernimmt. Bei Kontextlängen von 100.000 bis 128.000 Tokens erzielt das System 23,8 bis 24,6 Tokens pro Sekunde (Generierung), was für ein Modell dieser Größenordnung lokal bemerkenswert ist. Die Prefill-Geschwindigkeit (Prompt Processing) variiert stark: 60 Token/s beim ersten Prompt, bis zu 385 Token/s bei späteren Anfragen – ein Hinweis auf ausgeprägte KV-Cache-Nutzung. Der Nutzer stellte fest, dass weder FlashAttention (DFlash) noch eine zusätzliche RTX 3090 die Geschwindigkeit verbesserten; beide verlangsamten das System sogar. Das Setup zeigt exemplarisch, dass MoE-Modelle der aktuellen Spitzenklasse auch ohne mehrere High-End-GPUs im vierstelligen Preissegment lokal betreibbar sind.
- Quantisierungsformat UD-Q8_K_XL belegt ~151 GB, weit mehr als die 32 GB VRAM der RTX 5090 – der Großteil der Gewichte liegt im DDR4-RAM.
- FlashAttention (DFlash) wurde wieder entfernt, da es die Token/s bei diesem Setup messbar verschlechterte.
- Eine temporär eingebaute RTX 3090 brachte ebenfalls keine Verbesserung gegenüber der Solo-5090-Konfiguration.
- Prefill-Rate steigt von ~60 Token/s (Kaltstart) auf bis zu 385 Token/s dank KV-Caching bei langen Sessions.
- Der Nutzer bezeichnet sich als Einsteiger im LLM-Bereich und sucht Community-Tipps zu weiteren Modellen und Optimierungen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.