Qwen 3.6 27B auf VLLM: NVFP4 2,6× schneller als BF16 bei Token-Generierung
Der Reddit-Nutzer testete Qwen 3.6 27B unter vLLM 0.24.0 auf einer RTX 6000 Pro Blackwell mit 96 GB VRAM in drei Quantisierungsstufen: BF16 (Originalgewichte von Hugging Face Qwen), FP8 (ebenfalls HF Qwen) und NVFP4 (Nvidia-Variante von Hugging Face). Als Benchmark-Tool kam „llama benchy" zum Einsatz. Die Konfiguration nutzte FlashInfer als Attention-Backend, MTP-Spekulation mit 2 spekulativen Tokens, Prefix-Caching sowie einen KV-Cache in FP8. Der Kontext wurde auf maximal 262.144 Token ausgelegt, wobei max-num-seqs auf 2 und max-num-batched-tokens auf 8.192 begrenzt wurden. Ein praktisch relevanter Befund: NVFP4 erzeugte im Copilot-Betrieb Looping-Artefakte und weniger gründliche Antworten im Agent-Modus, obwohl es bei der Token-Generierung mit bis zu 171 t/s (bei 16k Kontext) das schnellste Format ist. Der Autor wechselte von llama.cpp zu vLLM, weil Paged Attention in der Praxis höheren Durchsatz und bessere Stabilität liefere — llama.cpp habe häufige Fehler produziert, die Prompt-Resets oder Dienstneustart erforderten. Für Produktions-Coding-Workloads empfiehlt der Autor FP8 als optimalen Kompromiss aus Geschwindigkeit und Antwortqualität.
- Token-Generierung (tg32): BF16 ~59–67 t/s, FP8 ~97–103 t/s, NVFP4 ~158–171 t/s – Spitzenwert NVFP4 bei 16k Kontext mit 171,12 t/s.
- Prompt-Prefill (pp2048) bei 0k Kontext: BF16 4.359 t/s, FP8 4.748 t/s (+9 %), NVFP4 4.732 t/s; bei 4k Kontext steigt FP8-Vorteil auf +21 %.
- Hardware: Asus ProArt Z890, Intel Core Ultra 9 270K, 96 GB DDR5-6000, RTX 6000 Pro Blackwell (Max-Q, ECC aktiviert); Software: Ubuntu 26.04 LTS, CUDA 13.2, Python 3.12.13.
- MTP-Spekulation (method: mtp, 2 spekulative Tokens) und FlashInfer-Sampler aktiv; VLLM_USE_DEEP_GEMM wurde explizit deaktiviert (=0).
- NVFP4 muss Gewichte beim Prefill on-the-fly dequantisieren, was einen Rückstand von ~10–15 % gegenüber FP8 bei compute-bound Prefill-Batches erklärt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen 3.6 27B auf VLLM: NVFP4 2,6× schneller als BF16 bei Token-Generierung
Der Reddit-Nutzer testete Qwen 3.6 27B unter vLLM 0.24.0 auf einer RTX 6000 Pro Blackwell mit 96 GB VRAM in drei Quantisierungsstufen: BF16 (Originalgewichte von Hugging Face Qwen), FP8 (ebenfalls HF Qwen) und NVFP4 (Nvidia-Variante von Hugging Face). Als Benchmark-Tool kam „llama benchy" zum Einsatz. Die Konfiguration nutzte FlashInfer als Attention-Backend, MTP-Spekulation mit 2 spekulativen Tokens, Prefix-Caching sowie einen KV-Cache in FP8. Der Kontext wurde auf maximal 262.144 Token ausgelegt, wobei max-num-seqs auf 2 und max-num-batched-tokens auf 8.192 begrenzt wurden. Ein praktisch relevanter Befund: NVFP4 erzeugte im Copilot-Betrieb Looping-Artefakte und weniger gründliche Antworten im Agent-Modus, obwohl es bei der Token-Generierung mit bis zu 171 t/s (bei 16k Kontext) das schnellste Format ist. Der Autor wechselte von llama.cpp zu vLLM, weil Paged Attention in der Praxis höheren Durchsatz und bessere Stabilität liefere — llama.cpp habe häufige Fehler produziert, die Prompt-Resets oder Dienstneustart erforderten. Für Produktions-Coding-Workloads empfiehlt der Autor FP8 als optimalen Kompromiss aus Geschwindigkeit und Antwortqualität.
- Token-Generierung (tg32): BF16 ~59–67 t/s, FP8 ~97–103 t/s, NVFP4 ~158–171 t/s – Spitzenwert NVFP4 bei 16k Kontext mit 171,12 t/s.
- Prompt-Prefill (pp2048) bei 0k Kontext: BF16 4.359 t/s, FP8 4.748 t/s (+9 %), NVFP4 4.732 t/s; bei 4k Kontext steigt FP8-Vorteil auf +21 %.
- Hardware: Asus ProArt Z890, Intel Core Ultra 9 270K, 96 GB DDR5-6000, RTX 6000 Pro Blackwell (Max-Q, ECC aktiviert); Software: Ubuntu 26.04 LTS, CUDA 13.2, Python 3.12.13.
- MTP-Spekulation (method: mtp, 2 spekulative Tokens) und FlashInfer-Sampler aktiv; VLLM_USE_DEEP_GEMM wurde explizit deaktiviert (=0).
- NVFP4 muss Gewichte beim Prefill on-the-fly dequantisieren, was einen Rückstand von ~10–15 % gegenüber FP8 bei compute-bound Prefill-Batches erklärt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.