Qwen3.8-Flash-Next: 38 tok/s bei 1M Kontext auf Strix Halo mit halogen 0.12.0
CompaniesHugging Face
Warum es zählt
Wer Qwen3.8-Flash-Next lokal mit 1M-Kontext betreibt, profitiert mit halogen 0.12.0 direkt von ~40 % mehr Decode-Geschwindigkeit bei maximaler Kontextlänge – ohne Hardware-Upgrade. Relevant für alle, die Strix-Halo-Maschinen mit 128 GB für Long-Context-Inferenz nutzen.
— Lumeric Redaktion
Decode-Throughput @ 1M Kontext (tok/s) · Spitzenwert
27.3%
halogen 0.11.10 @ 1M ctx
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-Flash-Next: 38 tok/s bei 1M Kontext auf Strix Halo mit halogen 0.12.0
CompaniesHugging Face
Warum es zählt
Wer Qwen3.8-Flash-Next lokal mit 1M-Kontext betreibt, profitiert mit halogen 0.12.0 direkt von ~40 % mehr Decode-Geschwindigkeit bei maximaler Kontextlänge – ohne Hardware-Upgrade. Relevant für alle, die Strix-Halo-Maschinen mit 128 GB für Long-Context-Inferenz nutzen.
— Lumeric Redaktion
Decode-Throughput @ 1M Kontext (tok/s) · Spitzenwert
27.3%
halogen 0.11.10 @ 1M ctx
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.