Qwen3.8-Flash-Next-NVFP4 vs Qwen3.8-27B-FP8: Praxistest auf einer RTX PRO 6000
Der Reddit-Nutzer testete beide Modelle auf einer einzigen RTX PRO 6000 Blackwell Max-Q (96 GB VRAM, SM120) mit 256 GB DDR5, wobei vLLM nightly als Inference-Engine diente. Beide Modelle wurden hinter demselben Service-Alias und Port betrieben, den der reale Agent-Stack des Autors konsumiert – darunter Text-Scoring-Pipelines, Memory-Konsolidierung, Browser-Automatisierung und lokale Recherche-Workflows. Das Testdesign umfasste drei Suiten: eine Capability-Battery mit acht Tasks (von Bugfix-from-Traceback über Codeforces 1117-D bis zum IMO Problem 5), einen Production-Grading-Sweep mit 320 Anfragen gegen ein striktes JSON-Schema sowie eine Latenz-/Throughput-Suite. Flash-Next erreichte dabei gemessene ~177 Token/s Generierungsgeschwindigkeit mit einer MTP-Draft-Akzeptanzlänge von ~2,1, während die 27B-Variante mit nur 52 % GPU-Memory-Utilization läuft. Ein kritisches Konfigurationsdetail: Das xgrammar-Backend erwies sich als unverzichtbar – ohne es traten bei Flash-Next stille Hängezustände auf. Flash-Next benötigt außerdem ein speziell gebautes Docker-Image, da die regulären PyPI-Wheels die NVFP4-Architektur nicht unterstützen. Das auffälligste neue Fehlerverhalten von Flash-Next bei symbolischen Mehrstufen-Aufgaben: Das Modell verspricht die Lieferung eines Ergebnisses, deklariert die Aufgabe als abgeschlossen – gibt aber keinen Output aus.
- Flash-Next läuft mit --max-model-len 200704 (~200K Tokens, nativem Kontextfenster 262K) und --gpu-memory-utilization 0.91, die 27B-Variante nur mit 0.52.
- MTP-Spekulation: Flash-Next nutzt 3 spekulative Tokens, Qwen3.8-27B-FP8 nur 2 — Flash-Next erzielt trotzdem ~177 tok/s gemessenen Durchsatz.
- Die Capability-Battery enthält kontrollierte 2026-Faktenfragen zur Kontaminationskontrolle sowie ARC-AGI 227 und einen IMO Problem 5-Sketch als Hard-Tier-Aufgaben.
- Der Production-Sweep umfasst 320 Anfragen mit strikter json_schema-Durchsetzung, 300-Sekunden-SLA und enthält Edge-Cases sowie Injection-Versuche — Flash-Next: null Fehler.
- VLLM_PLE_CPU_OFFLOAD=1 lagert die ~100 GB große N-Gramm-Embed-Tabelle von Flash-Next in den Host-RAM aus, was die VRAM-Nutzung erst praktikabel macht.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-Flash-Next-NVFP4 vs Qwen3.8-27B-FP8: Praxistest auf einer RTX PRO 6000
Der Reddit-Nutzer testete beide Modelle auf einer einzigen RTX PRO 6000 Blackwell Max-Q (96 GB VRAM, SM120) mit 256 GB DDR5, wobei vLLM nightly als Inference-Engine diente. Beide Modelle wurden hinter demselben Service-Alias und Port betrieben, den der reale Agent-Stack des Autors konsumiert – darunter Text-Scoring-Pipelines, Memory-Konsolidierung, Browser-Automatisierung und lokale Recherche-Workflows. Das Testdesign umfasste drei Suiten: eine Capability-Battery mit acht Tasks (von Bugfix-from-Traceback über Codeforces 1117-D bis zum IMO Problem 5), einen Production-Grading-Sweep mit 320 Anfragen gegen ein striktes JSON-Schema sowie eine Latenz-/Throughput-Suite. Flash-Next erreichte dabei gemessene ~177 Token/s Generierungsgeschwindigkeit mit einer MTP-Draft-Akzeptanzlänge von ~2,1, während die 27B-Variante mit nur 52 % GPU-Memory-Utilization läuft. Ein kritisches Konfigurationsdetail: Das xgrammar-Backend erwies sich als unverzichtbar – ohne es traten bei Flash-Next stille Hängezustände auf. Flash-Next benötigt außerdem ein speziell gebautes Docker-Image, da die regulären PyPI-Wheels die NVFP4-Architektur nicht unterstützen. Das auffälligste neue Fehlerverhalten von Flash-Next bei symbolischen Mehrstufen-Aufgaben: Das Modell verspricht die Lieferung eines Ergebnisses, deklariert die Aufgabe als abgeschlossen – gibt aber keinen Output aus.
- Flash-Next läuft mit --max-model-len 200704 (~200K Tokens, nativem Kontextfenster 262K) und --gpu-memory-utilization 0.91, die 27B-Variante nur mit 0.52.
- MTP-Spekulation: Flash-Next nutzt 3 spekulative Tokens, Qwen3.8-27B-FP8 nur 2 — Flash-Next erzielt trotzdem ~177 tok/s gemessenen Durchsatz.
- Die Capability-Battery enthält kontrollierte 2026-Faktenfragen zur Kontaminationskontrolle sowie ARC-AGI 227 und einen IMO Problem 5-Sketch als Hard-Tier-Aufgaben.
- Der Production-Sweep umfasst 320 Anfragen mit strikter json_schema-Durchsetzung, 300-Sekunden-SLA und enthält Edge-Cases sowie Injection-Versuche — Flash-Next: null Fehler.
- VLLM_PLE_CPU_OFFLOAD=1 lagert die ~100 GB große N-Gramm-Embed-Tabelle von Flash-Next in den Host-RAM aus, was die VRAM-Nutzung erst praktikabel macht.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.