Qwen3.8-27B Q8_0 lokal auf Strix Halo: 16–19 tok/s mit 97–99 % MTP-Akzeptanz
Der Reddit-Nutzer seti_at_home demonstriert, dass ein Qwen3.8-27B-Modell in Q8_0-Quantisierung vollständig auf Consumer-Hardware ohne dedizierte GPU betrieben werden kann – konkret auf dem ROG Flow Z13 mit Ryzen AI Max+ 395 und 128 GB Unified Memory. Als Software-Stack kommt Lemonade Server in Kombination mit llama.cpp in der ROCm-Variante zum Einsatz. Der Speicher wird zu gleichen Teilen aufgeteilt: 64 GB als VRAM für das iGPU-Modell, 64 GB als regulärer RAM. Der KV-Cache wird ebenfalls in Q8 gehalten, was bei einem Kontext von rund 142.000 Token eine stabile Inferenz ermöglicht. Als Praxistest diente ein einzelner Prompt, der ein vollständiges Flug-Simulator-HTML per Agenten-Loop mit Datei- und Bash-Werkzeugen erzeugte – ein Szenario, das laut Nutzer andere getestete Modelle nicht bewältigen konnten. Die Generierung dauerte insgesamt rund 20 Minuten. Bemerkenswert ist dabei die Native-MTP-Speculative-Decoding-Akzeptanzrate von 97–99 %, die bedeutet, dass nahezu alle spekulativ erzeugten Token vom Hauptmodell bestätigt werden und die effektive Ausgaberate auf 16–19 tok/s in produktiven Phasen steigt.
- ROG Flow Z13 mit Ryzen AI Max+ 395 und 128 GB Unified Memory: Modell läuft vollständig ohne dedizierte GPU im Speicher.
- Stack: Lemonade Server + llama.cpp ROCm, Q8_0 Gewichte und Q8 KV-Cache.
- Kontextfenster von ~142k Token aktiv genutzt, Speicher-Split 64 GB VRAM / 64 GB RAM.
- Gesamtdauer für die Simulator-Generierung per Agenten-Loop (file/bash tools): ~20 Minuten.
- MTP Speculative Decoding erreicht 97–99 % Akzeptanzrate – annähernd verlustfreie Spekulation auf Consumer-Hardware.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Qwen3.8-27B Q8_0 lokal auf Strix Halo: 16–19 tok/s mit 97–99 % MTP-Akzeptanz
Der Reddit-Nutzer seti_at_home demonstriert, dass ein Qwen3.8-27B-Modell in Q8_0-Quantisierung vollständig auf Consumer-Hardware ohne dedizierte GPU betrieben werden kann – konkret auf dem ROG Flow Z13 mit Ryzen AI Max+ 395 und 128 GB Unified Memory. Als Software-Stack kommt Lemonade Server in Kombination mit llama.cpp in der ROCm-Variante zum Einsatz. Der Speicher wird zu gleichen Teilen aufgeteilt: 64 GB als VRAM für das iGPU-Modell, 64 GB als regulärer RAM. Der KV-Cache wird ebenfalls in Q8 gehalten, was bei einem Kontext von rund 142.000 Token eine stabile Inferenz ermöglicht. Als Praxistest diente ein einzelner Prompt, der ein vollständiges Flug-Simulator-HTML per Agenten-Loop mit Datei- und Bash-Werkzeugen erzeugte – ein Szenario, das laut Nutzer andere getestete Modelle nicht bewältigen konnten. Die Generierung dauerte insgesamt rund 20 Minuten. Bemerkenswert ist dabei die Native-MTP-Speculative-Decoding-Akzeptanzrate von 97–99 %, die bedeutet, dass nahezu alle spekulativ erzeugten Token vom Hauptmodell bestätigt werden und die effektive Ausgaberate auf 16–19 tok/s in produktiven Phasen steigt.
- ROG Flow Z13 mit Ryzen AI Max+ 395 und 128 GB Unified Memory: Modell läuft vollständig ohne dedizierte GPU im Speicher.
- Stack: Lemonade Server + llama.cpp ROCm, Q8_0 Gewichte und Q8 KV-Cache.
- Kontextfenster von ~142k Token aktiv genutzt, Speicher-Split 64 GB VRAM / 64 GB RAM.
- Gesamtdauer für die Simulator-Generierung per Agenten-Loop (file/bash tools): ~20 Minuten.
- MTP Speculative Decoding erreicht 97–99 % Akzeptanzrate – annähernd verlustfreie Spekulation auf Consumer-Hardware.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.