DeepSeek-V4-Flash auf B300: Nur 770 tok/s bei Batch-Inferenz in vLLM
ToolsDeepSeek
CompaniesDeepSeek
Warum es zählt
Der schnelle MoE-Kernel (deep_gemm_mega_moe) erfordert Expert Parallelism und läuft nicht auf Single-GPU. Wer DeepSeek-V4-Flash auf einer einzelnen B300 betreibt, muss auf langsamere Backends (flashinfer_trtllm) ausweichen und verliert möglicherweise CUDA-Graph-Optimierungen für MLA – das ist relevant für Deployment-Planung.
— Lumeric Redaktion
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
DeepSeek-V4-Flash auf B300: Nur 770 tok/s bei Batch-Inferenz in vLLM
ToolsDeepSeek
CompaniesDeepSeek
Warum es zählt
Der schnelle MoE-Kernel (deep_gemm_mega_moe) erfordert Expert Parallelism und läuft nicht auf Single-GPU. Wer DeepSeek-V4-Flash auf einer einzelnen B300 betreibt, muss auf langsamere Backends (flashinfer_trtllm) ausweichen und verliert möglicherweise CUDA-Graph-Optimierungen für MLA – das ist relevant für Deployment-Planung.
— Lumeric Redaktion
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.