Qwen3.8-Flash-Next lokal: 20 tok/s auf RTX 3090 mit 3,49M Token Session
Qwen3.8-Flash-Next ist ein neues Modell mit einer sogenannten „qwen4exp"-Architektur, das eine Mixture-of-Experts (MoE)-Struktur nutzt – 41 der Expertenblöcke werden dabei auf die CPU ausgelagert, während 49 GPU-Schichten auf der RTX 3090 verbleiben. Der Nutzer kompilierte llama.cpp eigenhändig aus dem noch offenen Pull Request #27742 von Daniel Hanchen (Unsloth), da die neue Architektur noch keinen Eingang in einen stabilen Release gefunden hat. Als Quantisierung kam das Unsloth-GGUF-Format UD-Q4_K_XL zum Einsatz, der KV-Cache läuft auf FP16, Batch-Größe ist 2048 bei einem UBatch von 1024. Der vollständige Kontext umfasst 131.072 Tokens; die Session nutzte davon am Ende 53,6 Prozent. Der eigentliche Demonstrationstest bestand aus einem einzigen elaborierten User-Prompt, der das Modell anwies, eine spielbare 3D-Voxel-Browser-Demo als einzelne HTML-Datei zu erstellen – das Modell arbeitete sich dann autonom durch 72 Assistenten-Turns mit 71 Tool-Calls. Die kumulierten 3,49 Millionen verarbeiteten Tokens sind kein Einzelkontext, sondern ergeben sich aus der token-weisen Abrechnung aller Turns und Tool-Interaktionen der gesamten Session. Reasoning war auf „Low" gesetzt, was zur beobachteten Geschwindigkeit von rund 20 Tokens pro Sekunde beigetragen haben dürfte.
- KV Unified Cache ist in diesem Setup deaktiviert (--no-kvu), mmap hingegen aktiv – beides gezielte Optimierungen für die qwen4exp-Architektur.
- Der llama.cpp-Build basiert auf PR #27742 von Daniel Hanchen / Unsloth und ist noch nicht im offiziellen Stable-Release enthalten – Eigencompilierung ist Pflicht.
- CPU-MoE-Offloading: exakt 41 Experten-Blöcke laufen auf der CPU, 49 Schichten auf der RTX 3090 (CUDA0) im Layer-Split-Modus.
- Der Haupt-Prompt verlangte ein vollständiges Cyberpunk-Voxel-Datacenter-Spiel inklusive animierter KI-Kreatur, Partikel-Effekten und einem Unsloth-Easter-Egg (z. B. Neon-Sloth-Monument) als verstecktem Community-Insider.
- Session-Bilanz: 144 Nachrichten gesamt, davon 72 vom Assistenten, 71 Tool-Calls mit je einem Tool-Result – alles aus einem einzigen User-Message ausgelöst.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Qwen3.8-Flash-Next lokal: 20 tok/s auf RTX 3090 mit 3,49M Token Session
Qwen3.8-Flash-Next ist ein neues Modell mit einer sogenannten „qwen4exp"-Architektur, das eine Mixture-of-Experts (MoE)-Struktur nutzt – 41 der Expertenblöcke werden dabei auf die CPU ausgelagert, während 49 GPU-Schichten auf der RTX 3090 verbleiben. Der Nutzer kompilierte llama.cpp eigenhändig aus dem noch offenen Pull Request #27742 von Daniel Hanchen (Unsloth), da die neue Architektur noch keinen Eingang in einen stabilen Release gefunden hat. Als Quantisierung kam das Unsloth-GGUF-Format UD-Q4_K_XL zum Einsatz, der KV-Cache läuft auf FP16, Batch-Größe ist 2048 bei einem UBatch von 1024. Der vollständige Kontext umfasst 131.072 Tokens; die Session nutzte davon am Ende 53,6 Prozent. Der eigentliche Demonstrationstest bestand aus einem einzigen elaborierten User-Prompt, der das Modell anwies, eine spielbare 3D-Voxel-Browser-Demo als einzelne HTML-Datei zu erstellen – das Modell arbeitete sich dann autonom durch 72 Assistenten-Turns mit 71 Tool-Calls. Die kumulierten 3,49 Millionen verarbeiteten Tokens sind kein Einzelkontext, sondern ergeben sich aus der token-weisen Abrechnung aller Turns und Tool-Interaktionen der gesamten Session. Reasoning war auf „Low" gesetzt, was zur beobachteten Geschwindigkeit von rund 20 Tokens pro Sekunde beigetragen haben dürfte.
- KV Unified Cache ist in diesem Setup deaktiviert (--no-kvu), mmap hingegen aktiv – beides gezielte Optimierungen für die qwen4exp-Architektur.
- Der llama.cpp-Build basiert auf PR #27742 von Daniel Hanchen / Unsloth und ist noch nicht im offiziellen Stable-Release enthalten – Eigencompilierung ist Pflicht.
- CPU-MoE-Offloading: exakt 41 Experten-Blöcke laufen auf der CPU, 49 Schichten auf der RTX 3090 (CUDA0) im Layer-Split-Modus.
- Der Haupt-Prompt verlangte ein vollständiges Cyberpunk-Voxel-Datacenter-Spiel inklusive animierter KI-Kreatur, Partikel-Effekten und einem Unsloth-Easter-Egg (z. B. Neon-Sloth-Monument) als verstecktem Community-Insider.
- Session-Bilanz: 144 Nachrichten gesamt, davon 72 vom Assistenten, 71 Tool-Calls mit je einem Tool-Result – alles aus einem einzigen User-Message ausgelöst.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.