181 tok/s Aggregat-Durchsatz mit Qwen3.8-Flash-Next auf 2× DGX Spark
Warum es zählt
Die Kombination aus NVMe-mmap für die 47,7-GiB-n-Gram-Tabelle, 64 Gather-Threads und Prefix-Caching befreit erheblich Unified Memory für den KV-Cache (2,89M Token Pool). Praktisch relevant für alle, die Multi-Agent-Workloads auf Unified-Memory-Hardware (DGX Spark / GB10) mit vLLM betreiben.
— Lumeric Redaktion
181 tok/s
Aggregat-Durchsatz, 9 parallele Agent-Sessions
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
181 tok/s Aggregat-Durchsatz mit Qwen3.8-Flash-Next auf 2× DGX Spark
Warum es zählt
Die Kombination aus NVMe-mmap für die 47,7-GiB-n-Gram-Tabelle, 64 Gather-Threads und Prefix-Caching befreit erheblich Unified Memory für den KV-Cache (2,89M Token Pool). Praktisch relevant für alle, die Multi-Agent-Workloads auf Unified-Memory-Hardware (DGX Spark / GB10) mit vLLM betreiben.
— Lumeric Redaktion
181 tok/s
Aggregat-Durchsatz, 9 parallele Agent-Sessions
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.