Swift 1.5 auf 2× DGX Spark: ~110 tok/s via veloGB10, xhigh schlägt Flash-Next medium
CompaniesNVIDIA
Warum es zählt
Wer Coding-Agents auf GB10-Hardware betreibt, kann durch den Wechsel von vLLM auf veloGB10 die Decode-Rate verdoppeln und damit höhere Reasoning-Effort-Level im gleichen Zeitfenster nutzen. Ein Header-Only-Fix für EXL3-Packs (12 von 14 betroffen) ist nötig und dokumentiert.
— Lumeric Redaktion
Single-Stream Decode (tok/s) auf 2× DGX Spark · Spitzenwert
52%
Base Flash-Next NVFP4 @ medium, vLLM
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Swift 1.5 auf 2× DGX Spark: ~110 tok/s via veloGB10, xhigh schlägt Flash-Next medium
CompaniesNVIDIA
Warum es zählt
Wer Coding-Agents auf GB10-Hardware betreibt, kann durch den Wechsel von vLLM auf veloGB10 die Decode-Rate verdoppeln und damit höhere Reasoning-Effort-Level im gleichen Zeitfenster nutzen. Ein Header-Only-Fix für EXL3-Packs (12 von 14 betroffen) ist nötig und dokumentiert.
— Lumeric Redaktion
Single-Stream Decode (tok/s) auf 2× DGX Spark · Spitzenwert
52%
Base Flash-Next NVFP4 @ medium, vLLM
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.