vLLM mit NVFP4 auf 4×RTX 5060 Ti: 70–80 t/s TG und 2000+ t/s PP
CompaniesNVIDIA
Warum es zählt
Der OOM-Bug in vLLM bei NVFP4-Quants (GitHub Issue #46268) lässt sich mit zwei Umgebungsvariablen (MAX_JOBS=4, NVCC_THREADS=4) umgehen. Die veröffentlichte systemd-Konfiguration mit gpu-memory-utilization 0.60 und MTP-5 liefert auf Consumer-Hardware ~70–80 t/s Token-Generation bei stabilen Tool-Calls.
— Lumeric Redaktion
2000+ t/s PP
Prefill-Durchsatz auf 4× RTX 5060 Ti
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
vLLM mit NVFP4 auf 4×RTX 5060 Ti: 70–80 t/s TG und 2000+ t/s PP
CompaniesNVIDIA
Warum es zählt
Der OOM-Bug in vLLM bei NVFP4-Quants (GitHub Issue #46268) lässt sich mit zwei Umgebungsvariablen (MAX_JOBS=4, NVCC_THREADS=4) umgehen. Die veröffentlichte systemd-Konfiguration mit gpu-memory-utilization 0.60 und MTP-5 liefert auf Consumer-Hardware ~70–80 t/s Token-Generation bei stabilen Tool-Calls.
— Lumeric Redaktion
2000+ t/s PP
Prefill-Durchsatz auf 4× RTX 5060 Ti
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.