vLLM-Rezept für Qwen3.8 Flash: 212 tok/s auf einem DGX Spark
CompaniesOpenAI
Warum es zählt
Durch MTP-Draft-Head, reduziertes Draft-Vokabular (248K→65K), W4A16-Quant und GB10-optimierte GEMMs sinkt die Decode-Schrittzeit von 68,3 ms auf 52,3 ms – direkt anwendbar auf andere MTP- und Speculative-Decoding-Setups. Vollständiger Code und Benchmarkdaten sind öffentlich verfügbar.
— Lumeric Redaktion
Aggregate Decode Speed (tok/s, DGX Spark GB10) · Spitzenwert
40%
Qwen3.8 Flash – Original-Rezept (typisch)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
vLLM-Rezept für Qwen3.8 Flash: 212 tok/s auf einem DGX Spark
CompaniesOpenAI
Warum es zählt
Durch MTP-Draft-Head, reduziertes Draft-Vokabular (248K→65K), W4A16-Quant und GB10-optimierte GEMMs sinkt die Decode-Schrittzeit von 68,3 ms auf 52,3 ms – direkt anwendbar auf andere MTP- und Speculative-Decoding-Setups. Vollständiger Code und Benchmarkdaten sind öffentlich verfügbar.
— Lumeric Redaktion
Aggregate Decode Speed (tok/s, DGX Spark GB10) · Spitzenwert
40%
Qwen3.8 Flash – Original-Rezept (typisch)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.