Qwen3.8-27B erreicht 29/30 auf AIME 2026 – FP8 mit BF16 gleichauf
Der Reddit-Nutzer /u/No_Run8812 hat Qwen3.8-27B systematisch auf dem MathArena/aime_2026-Datensatz evaluiert und dabei vier Konfigurationen verglichen: BF16 mit medium- und xhigh-Reasoning sowie FP8-Quantisierung mit denselben zwei Stufen. Das zentrale Ergebnis: FP8 xhigh erreicht mit 29/30 (96,7 %) exakt denselben Score wie BF16 xhigh, generiert dabei aber mit 76 tk/s rund 2,7-mal so viele Tokens pro Sekunde wie BF16 (28 tk/s). Bemerkenswert ist auch der Pre-fill-Durchsatz: FP8 schafft hier 3,4K tk/s gegenüber 1,9K tk/s bei BF16. Bei medium-Reasoning hingegen fällt FP8 auf 26/30 (86,7 %) zurück, während BF16 medium noch 28/30 (93,3 %) erreicht – ein klares Indiz, dass FP8 erst bei sehr hohem Reasoning-Budget (xhigh, bis zu 258.048 Max-Tokens) die Qualitätslücke schließt. Aufgabe 7 konnte in keiner xhigh-Konfiguration beantwortet werden: Sowohl BF16 als auch FP8 xhigh erschöpften das gesamte Token-Budget, ohne eine finale Antwort zu produzieren – der Slot wurde als leer, nicht als falsch gewertet. Die Evaluation verwendete Exact-Match-Scoring, deaktiviertes Sampling und Temperatur null; BF16 lief mit Concurrency 4, FP8 mit Concurrency 7. Im Frontier-Vergleich ordnet sich Qwen3.8-27B FP8 xhigh mit 96,7 % auf einem Niveau mit Claude Opus 4.6 max und DeepSeek V4 Pro ein – deutlich über dem Vorgänger Qwen3.6-27B (94,1 %).
- FP8 xhigh nutzt Concurrency 7 (vs. 4 bei BF16), was den höheren Durchsatz miterklärt — gleiche Hardware, mehr parallele Anfragen.
- Problem 7 blieb in beiden xhigh-Läufen (BF16 und FP8) unbeantwortet: Token-Budget von 258.048 vollständig ausgeschöpft, kein finales Ergebnis produziert.
- Der Benchmark-Vergleich gegen Frontier-Modelle ist nicht direkt vergleichbar: Andere Anbieter berichten gemittelte Werte über mehrere Läufe, dieser Run ist ein einmaliges pass@1-Ergebnis.
- Datensatz-Revision d2de22f3c656b4f56cf8981212186377d1e23bc3 auf MathArena/aime_2026 wurde für alle vier Konfigurationen identisch verwendet — gleiche Chat-Template und Prompt-Formatierung.
- GPT-5.6 Sol xhigh führt die Vergleichstabelle mit 99,9 % an, gefolgt von GLM-5.2 und GPT-5.4 xhigh (je 99,2 %); Qwen3.8-27B FP8 liegt auf Platz 8 dieser inoffiziellen Rangliste.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-27B erreicht 29/30 auf AIME 2026 – FP8 mit BF16 gleichauf
Der Reddit-Nutzer /u/No_Run8812 hat Qwen3.8-27B systematisch auf dem MathArena/aime_2026-Datensatz evaluiert und dabei vier Konfigurationen verglichen: BF16 mit medium- und xhigh-Reasoning sowie FP8-Quantisierung mit denselben zwei Stufen. Das zentrale Ergebnis: FP8 xhigh erreicht mit 29/30 (96,7 %) exakt denselben Score wie BF16 xhigh, generiert dabei aber mit 76 tk/s rund 2,7-mal so viele Tokens pro Sekunde wie BF16 (28 tk/s). Bemerkenswert ist auch der Pre-fill-Durchsatz: FP8 schafft hier 3,4K tk/s gegenüber 1,9K tk/s bei BF16. Bei medium-Reasoning hingegen fällt FP8 auf 26/30 (86,7 %) zurück, während BF16 medium noch 28/30 (93,3 %) erreicht – ein klares Indiz, dass FP8 erst bei sehr hohem Reasoning-Budget (xhigh, bis zu 258.048 Max-Tokens) die Qualitätslücke schließt. Aufgabe 7 konnte in keiner xhigh-Konfiguration beantwortet werden: Sowohl BF16 als auch FP8 xhigh erschöpften das gesamte Token-Budget, ohne eine finale Antwort zu produzieren – der Slot wurde als leer, nicht als falsch gewertet. Die Evaluation verwendete Exact-Match-Scoring, deaktiviertes Sampling und Temperatur null; BF16 lief mit Concurrency 4, FP8 mit Concurrency 7. Im Frontier-Vergleich ordnet sich Qwen3.8-27B FP8 xhigh mit 96,7 % auf einem Niveau mit Claude Opus 4.6 max und DeepSeek V4 Pro ein – deutlich über dem Vorgänger Qwen3.6-27B (94,1 %).
- FP8 xhigh nutzt Concurrency 7 (vs. 4 bei BF16), was den höheren Durchsatz miterklärt — gleiche Hardware, mehr parallele Anfragen.
- Problem 7 blieb in beiden xhigh-Läufen (BF16 und FP8) unbeantwortet: Token-Budget von 258.048 vollständig ausgeschöpft, kein finales Ergebnis produziert.
- Der Benchmark-Vergleich gegen Frontier-Modelle ist nicht direkt vergleichbar: Andere Anbieter berichten gemittelte Werte über mehrere Läufe, dieser Run ist ein einmaliges pass@1-Ergebnis.
- Datensatz-Revision d2de22f3c656b4f56cf8981212186377d1e23bc3 auf MathArena/aime_2026 wurde für alle vier Konfigurationen identisch verwendet — gleiche Chat-Template und Prompt-Formatierung.
- GPT-5.6 Sol xhigh führt die Vergleichstabelle mit 99,9 % an, gefolgt von GLM-5.2 und GPT-5.4 xhigh (je 99,2 %); Qwen3.8-27B FP8 liegt auf Platz 8 dieser inoffiziellen Rangliste.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.