vLLM schlägt llama.cpp bei Prefill-Geschwindigkeit deutlich – Community sucht Erklärung
Der Reddit-Nutzer u/dangerous_inference berichtet von beeindruckenden Prefill-Geschwindigkeiten auf einem System mit vier NVIDIA RTX-4090-GPUs (je 48 GB VRAM), die er mit vLLM-Forks erreicht. Mit dem Modell DS4F (DeepSeek Spark) wurden rund 5.000 Tokens/s beim Prefill bei 180 Tokens/s Generierung gemessen; mit Qwen3.8 Flash Next unter MTP (Multi-Token Prediction) sogar ca. 7.500 Tokens/s Prefill bei 135 Tokens/s Generierung. Der Poster stellt fest, dass llama.cpp und der alternative Engine ik_llama diese Prefill-Werte bei vergleichbarer Hardware bei weitem nicht erreichen – obwohl oft behauptet wird, vLLM sei nur bei Batch-Inferenz schneller, nicht bei Single-Request-Szenarien. Technisch liegt der Hauptunterschied typischerweise in vLLMs optimierter CUDA-Kernel-Infrastruktur: Es nutzt hochoptimierte Attention-Kernel (z. B. FlashAttention), Continuous Batching und ist explizit für GPU-Cluster-Betrieb mit NCCL-basiertem Tensor-Parallelismus ausgelegt. llama.cpp hingegen ist primär auf CPU-Inferenz und Quantisierung optimiert und nutzt CUDA nur als sekundären Pfad, was bei reinen GPU-Multi-Card-Setups zu strukturellen Geschwindigkeitsnachteilen führt. Die Community-Diskussion beleuchtet, ob dieser Prefill-Gap prinzipbedingt ist oder ob zukünftige Optimierungen in llama.cpp oder ik_llama ihn schließen könnten.
- 4×RTX-4090-System mit je 48 GB VRAM: Gesamte VRAM-Kapazität von 192 GB ermöglicht große Modelle vollständig auf GPU zu halten.
- DS4F (DeepSeek Spark) erreicht ~5.000 Tokens/s Prefill und ~180 Tokens/s Generierung unter vLLM-Fork.
- Qwen3.8 Flash Next mit MTP (Multi-Token Prediction) erreicht ~7.500 Tokens/s Prefill und ~135 Tokens/s Generierung.
- ik_llama wird explizit als weiterer Engine neben llama.cpp genannt, der die vLLM-Prefill-Werte ebenfalls nicht erreicht.
- Der Poster u/dangerous_inference vermutet einen grundlegenden, strukturellen Unterschied – kein bloßes Tuning-Delta – als Ursache der Lücke.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
vLLM schlägt llama.cpp bei Prefill-Geschwindigkeit deutlich – Community sucht Erklärung
Der Reddit-Nutzer u/dangerous_inference berichtet von beeindruckenden Prefill-Geschwindigkeiten auf einem System mit vier NVIDIA RTX-4090-GPUs (je 48 GB VRAM), die er mit vLLM-Forks erreicht. Mit dem Modell DS4F (DeepSeek Spark) wurden rund 5.000 Tokens/s beim Prefill bei 180 Tokens/s Generierung gemessen; mit Qwen3.8 Flash Next unter MTP (Multi-Token Prediction) sogar ca. 7.500 Tokens/s Prefill bei 135 Tokens/s Generierung. Der Poster stellt fest, dass llama.cpp und der alternative Engine ik_llama diese Prefill-Werte bei vergleichbarer Hardware bei weitem nicht erreichen – obwohl oft behauptet wird, vLLM sei nur bei Batch-Inferenz schneller, nicht bei Single-Request-Szenarien. Technisch liegt der Hauptunterschied typischerweise in vLLMs optimierter CUDA-Kernel-Infrastruktur: Es nutzt hochoptimierte Attention-Kernel (z. B. FlashAttention), Continuous Batching und ist explizit für GPU-Cluster-Betrieb mit NCCL-basiertem Tensor-Parallelismus ausgelegt. llama.cpp hingegen ist primär auf CPU-Inferenz und Quantisierung optimiert und nutzt CUDA nur als sekundären Pfad, was bei reinen GPU-Multi-Card-Setups zu strukturellen Geschwindigkeitsnachteilen führt. Die Community-Diskussion beleuchtet, ob dieser Prefill-Gap prinzipbedingt ist oder ob zukünftige Optimierungen in llama.cpp oder ik_llama ihn schließen könnten.
- 4×RTX-4090-System mit je 48 GB VRAM: Gesamte VRAM-Kapazität von 192 GB ermöglicht große Modelle vollständig auf GPU zu halten.
- DS4F (DeepSeek Spark) erreicht ~5.000 Tokens/s Prefill und ~180 Tokens/s Generierung unter vLLM-Fork.
- Qwen3.8 Flash Next mit MTP (Multi-Token Prediction) erreicht ~7.500 Tokens/s Prefill und ~135 Tokens/s Generierung.
- ik_llama wird explizit als weiterer Engine neben llama.cpp genannt, der die vLLM-Prefill-Werte ebenfalls nicht erreicht.
- Der Poster u/dangerous_inference vermutet einen grundlegenden, strukturellen Unterschied – kein bloßes Tuning-Delta – als Ursache der Lücke.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.