Qwen3.8-Flash-Next durchbricht 94% auf privatem Cupel-Benchmark
Der Reddit-Nutzer tolitius hat Qwen3.8-Flash-Next auf einem Apple-M4-Max-System mit 128 GB RAM unter zwei Inference-Engines getestet: oMLX und llama.cpp. Als Bewertungsgrundlage dient sein selbst entwickelter „Cupel"-Benchmark, der Coding, Allgemeinwissen und Naturwissenschaften abdeckt – und der bislang von keinem Modell die 94-%-Schwelle überwinden ließ. Qwen3.8-Flash-Next ist das erste Modell, das diese Marke knackt. Bei oMLX kam die Mixed-Quantisierung von pipenetwork zum Einsatz (MLX-mixed-4_8bit), die mit einer Perplexität von 4,5286 nur minimal schlechter als bfloat16 (4,4708) abschneidet und reguläre 4-Bit-Quants übertrifft. Für llama.cpp wurde das Unsloth-Quantisat UD-IQ4_XS verwendet, das in der Leaderboard-Rangliste des Nutzers Platz 6 belegt – knapp nicht so stark wie die MLX-Variante, aber das einzige Unsloth-GGUF, das noch in den verfügbaren RAM passte. Technisch ist die Unterstützung für die neue qwen4_exp-Architektur in oMLX noch nicht vollständig: K/V-Caching musste deaktiviert werden. Der Nutzer plant, den Benchmark in nächster Zeit um weitere Aufgaben (u. a. Hermes, Pi, OpenCode) zu erweitern, da die Modelle zunehmend schwerer zu differenzieren sind.
- Perplexitätswerte: bfloat16 erreicht 4,4708 – pipenetwork MLX-mixed-4_8bit liegt mit 4,5286 nur knapp dahinter.
- Das vollständige 4-Bit-Quantisat belegt mit n-Gram-Unterstützung rund 100 GB RAM – nahe am Limit des 128-GB-Systems.
- Qwen 3.8 27B schnitt im Cupel-Benchmark bei Allgemeinwissen schlechter ab als Gemma 31B und Qwen 3.6, obwohl es beim Coding führte.
- Unsloth-GGUF UD-IQ4_XS landet auf Platz 6 der internen Leaderboard-Rangliste des Testers.
- Geplante Benchmark-Erweiterungen umfassen Aufgaben aus Hermes, Pi und OpenCode, um die wachsende Modellqualität besser differenzieren zu können.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-Flash-Next durchbricht 94% auf privatem Cupel-Benchmark
Der Reddit-Nutzer tolitius hat Qwen3.8-Flash-Next auf einem Apple-M4-Max-System mit 128 GB RAM unter zwei Inference-Engines getestet: oMLX und llama.cpp. Als Bewertungsgrundlage dient sein selbst entwickelter „Cupel"-Benchmark, der Coding, Allgemeinwissen und Naturwissenschaften abdeckt – und der bislang von keinem Modell die 94-%-Schwelle überwinden ließ. Qwen3.8-Flash-Next ist das erste Modell, das diese Marke knackt. Bei oMLX kam die Mixed-Quantisierung von pipenetwork zum Einsatz (MLX-mixed-4_8bit), die mit einer Perplexität von 4,5286 nur minimal schlechter als bfloat16 (4,4708) abschneidet und reguläre 4-Bit-Quants übertrifft. Für llama.cpp wurde das Unsloth-Quantisat UD-IQ4_XS verwendet, das in der Leaderboard-Rangliste des Nutzers Platz 6 belegt – knapp nicht so stark wie die MLX-Variante, aber das einzige Unsloth-GGUF, das noch in den verfügbaren RAM passte. Technisch ist die Unterstützung für die neue qwen4_exp-Architektur in oMLX noch nicht vollständig: K/V-Caching musste deaktiviert werden. Der Nutzer plant, den Benchmark in nächster Zeit um weitere Aufgaben (u. a. Hermes, Pi, OpenCode) zu erweitern, da die Modelle zunehmend schwerer zu differenzieren sind.
- Perplexitätswerte: bfloat16 erreicht 4,4708 – pipenetwork MLX-mixed-4_8bit liegt mit 4,5286 nur knapp dahinter.
- Das vollständige 4-Bit-Quantisat belegt mit n-Gram-Unterstützung rund 100 GB RAM – nahe am Limit des 128-GB-Systems.
- Qwen 3.8 27B schnitt im Cupel-Benchmark bei Allgemeinwissen schlechter ab als Gemma 31B und Qwen 3.6, obwohl es beim Coding führte.
- Unsloth-GGUF UD-IQ4_XS landet auf Platz 6 der internen Leaderboard-Rangliste des Testers.
- Geplante Benchmark-Erweiterungen umfassen Aufgaben aus Hermes, Pi und OpenCode, um die wachsende Modellqualität besser differenzieren zu können.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.