Qwen3.8-Flash-Next mit 350K Kontext auf M5 Max: Decode bis 169K getestet
Der Reddit-Nutzer Artistic_Okra7288 dokumentiert einen 3,5-stündigen Belastungstest mit Qwen3.8-Flash-Next in der Unsloth-Quantisierung UD-Q2_K_XL (78,9 GB) auf einem MacBook Pro M5 Max mit 128 GB Unified Memory. Der Kontext-Slot wurde via YaRN vom nativen Limit von 262.144 auf 358.400 Token erweitert, wobei Weights und der vollständige KV-Cache gemeinsam unter dem Standard-GPU-Wired-Limit von 96 GB blieben — ein sysctl-Hack war nicht nötig. Die Session umfasste 100 Turns in zwei Konversationen: Die erste wuchs bis auf 169.425 Token Kontext — der tiefste Messpunkt des Tests — die zweite wurde bei rund 125K abgebrochen. Ein entscheidender Faktor war die Prefix-Reuse-Funktion von llama.cpp, die dafür sorgt, dass bei normalen Turns nur das Delta neu verarbeitet werden muss, was die meisten Prefills auf wenige Sekunden reduziert. Die einzige lange Prefill-Phase von 333 Sekunden (105K Tokens) entstand nach einer 20-minütigen Idle-Pause, die den Slot-Cache auf den 5,5K-System-Prefix zurücksetzte. Für die Decode-Phase wurde ngram-mod Speculative Decoding aktiviert, dessen Draft-Akzeptanzrate je nach Inhalt zwischen 0 und 81 % variierte — die gemessenen Werte spiegeln also effektiven Durchsatz, nicht die reine Basismodellgeschwindigkeit wider. Ab etwa 100K Token Kontexttiefe beobachtete der Nutzer zunehmende Rollenverwechslungen, bei denen das Modell eigene frühere Ausgaben mit Nutzernachrichten vermischte; als Ursache werden die 2-Bit-Quantisierung und/oder die Long-Context-Qualität des Preview-Modells diskutiert.
- Prefill-Speed beim Cold-Start: 1.561 t/s bei 5,6K Kontext, sinkend auf 318 t/s bei 111K — mit Prefix-Reuse dagegen nur 77–854 t/s für das jeweilige Delta.
- Ein Low-Power-Mode-Einbruch bei ~140K Kontext drückte die Decode-Rate kurzzeitig auf 7,7 t/s, danach Erholung auf 11,5 t/s bei 169K.
- KV-Cache läuft in fp16 — eine schlechtere KV-Quantisierung als Ursache der Rollenverwechslungen wurde damit explizit ausgeschlossen.
- llama.cpp-Build b10686 mit Metal-Backend, 12 Threads, Batch-Größe 2048, Flash-Attention und kv-unified wurde als Basis-Setup verwendet.
- Das native Kontextlimit von Qwen3.8-Flash-Next liegt bei 262.144 Token; die 358.400-Token-Kapazität wurde ausschließlich per YaRN-Extrapolation erreicht.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-Flash-Next mit 350K Kontext auf M5 Max: Decode bis 169K getestet
Der Reddit-Nutzer Artistic_Okra7288 dokumentiert einen 3,5-stündigen Belastungstest mit Qwen3.8-Flash-Next in der Unsloth-Quantisierung UD-Q2_K_XL (78,9 GB) auf einem MacBook Pro M5 Max mit 128 GB Unified Memory. Der Kontext-Slot wurde via YaRN vom nativen Limit von 262.144 auf 358.400 Token erweitert, wobei Weights und der vollständige KV-Cache gemeinsam unter dem Standard-GPU-Wired-Limit von 96 GB blieben — ein sysctl-Hack war nicht nötig. Die Session umfasste 100 Turns in zwei Konversationen: Die erste wuchs bis auf 169.425 Token Kontext — der tiefste Messpunkt des Tests — die zweite wurde bei rund 125K abgebrochen. Ein entscheidender Faktor war die Prefix-Reuse-Funktion von llama.cpp, die dafür sorgt, dass bei normalen Turns nur das Delta neu verarbeitet werden muss, was die meisten Prefills auf wenige Sekunden reduziert. Die einzige lange Prefill-Phase von 333 Sekunden (105K Tokens) entstand nach einer 20-minütigen Idle-Pause, die den Slot-Cache auf den 5,5K-System-Prefix zurücksetzte. Für die Decode-Phase wurde ngram-mod Speculative Decoding aktiviert, dessen Draft-Akzeptanzrate je nach Inhalt zwischen 0 und 81 % variierte — die gemessenen Werte spiegeln also effektiven Durchsatz, nicht die reine Basismodellgeschwindigkeit wider. Ab etwa 100K Token Kontexttiefe beobachtete der Nutzer zunehmende Rollenverwechslungen, bei denen das Modell eigene frühere Ausgaben mit Nutzernachrichten vermischte; als Ursache werden die 2-Bit-Quantisierung und/oder die Long-Context-Qualität des Preview-Modells diskutiert.
- Prefill-Speed beim Cold-Start: 1.561 t/s bei 5,6K Kontext, sinkend auf 318 t/s bei 111K — mit Prefix-Reuse dagegen nur 77–854 t/s für das jeweilige Delta.
- Ein Low-Power-Mode-Einbruch bei ~140K Kontext drückte die Decode-Rate kurzzeitig auf 7,7 t/s, danach Erholung auf 11,5 t/s bei 169K.
- KV-Cache läuft in fp16 — eine schlechtere KV-Quantisierung als Ursache der Rollenverwechslungen wurde damit explizit ausgeschlossen.
- llama.cpp-Build b10686 mit Metal-Backend, 12 Threads, Batch-Größe 2048, Flash-Attention und kv-unified wurde als Basis-Setup verwendet.
- Das native Kontextlimit von Qwen3.8-Flash-Next liegt bei 262.144 Token; die 358.400-Token-Kapazität wurde ausschließlich per YaRN-Extrapolation erreicht.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.