GLM-5.3-Flash auf DGX Station GB300: 206 tok/s mit 1M-Kontext
Warum es zählt
206 tok/s Single-Stream bei 1M Kontext auf einer einzigen Blackwell-Station zeigt, dass NVFP4 auf HBM3e die Inferenz von Frontier-MoE-Modellen deutlich beschleunigt. Die vllm-Docker-Konfiguration ist direkt wiederverwendbar, hat aber einen bekannten Bug beim Auto-Download der Gewichte.
— Lumeric Redaktion
206 tok/s
Single-Stream, 1M Kontext, NVFP4
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
GLM-5.3-Flash auf DGX Station GB300: 206 tok/s mit 1M-Kontext
Warum es zählt
206 tok/s Single-Stream bei 1M Kontext auf einer einzigen Blackwell-Station zeigt, dass NVFP4 auf HBM3e die Inferenz von Frontier-MoE-Modellen deutlich beschleunigt. Die vllm-Docker-Konfiguration ist direkt wiederverwendbar, hat aber einen bekannten Bug beim Auto-Download der Gewichte.
— Lumeric Redaktion
206 tok/s
Single-Stream, 1M Kontext, NVFP4
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.