Qwen 3.8 27B vs. Qwen 3.6 27B: Bessere Qualität, fünffache Laufzeit
Der Reddit-Nutzer /u/DerTomsn hat auf r/LocalLLaMA einen Community-Benchmark veröffentlicht, der Qwen 3.8 27B und Qwen 3.6 27B auf der oMLX-Plattform direkt gegenüberstellt. Die vollständigen Ergebnisse sind auf llm-bench.io einsehbar und decken verschiedene Hardware-Konfigurationen sowie unterschiedliche Quantisierungsstufen ab. Das auffälligste Ergebnis ist das extreme Missverhältnis zwischen Qualitätsgewinn und Ressourcenverbrauch: Während die Qualitätswertung von 81,1 auf 87,7 Punkte steigt – ein relativer Zuwachs von rund 8 % –, explodiert die Zahl der Output-Tokens von 18.000 auf 78.000, also auf mehr als das Vierfache. Die Laufzeit verlängert sich dadurch von knapp 9 Minuten auf fast 45 Minuten, was einer Verfünffachung entspricht. Gleichzeitig sinkt der Durchsatz von 35 auf 29 Token pro Sekunde, was auf ein rechnerisch aufwendigeres Reasoning-Verhalten von Qwen 3.8 hindeutet. Das Modell scheint deutlich mehr interne Denkschritte zu erzeugen, bevor es eine Antwort ausgibt – ein typisches Merkmal von Thinking-Mode-Architekturen. Für Anwender, die Modelle lokal auf Apple-Silicon oder vergleichbarer Hardware betreiben, ist dieser Trade-off besonders spürbar, da lange Laufzeiten direkt die Nutzbarkeit im Alltag beeinflussen.
- Vollständige Benchmark-Daten (alle Hardware-Varianten, alle Quants) sind auf llm-bench.io veröffentlicht.
- Durchsatz sinkt von 35 tok/s (Qwen 3.6) auf 29 tok/s (Qwen 3.8) — ein Rückgang von 16 %.
- Output-Tokens steigen von 18K auf 78K, was auf intensives Chain-of-Thought- bzw. Thinking-Verhalten bei Qwen 3.8 hindeutet.
- Benchmark wurde auf oMLX durchgeführt — einer Plattform für MLX-basierte Inferenz, typischerweise auf Apple-Silicon-Hardware.
- Beitrag stammt von /u/DerTomsn und wurde am 2026-09-03 auf r/LocalLLaMA veröffentlicht.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen 3.8 27B vs. Qwen 3.6 27B: Bessere Qualität, fünffache Laufzeit
Der Reddit-Nutzer /u/DerTomsn hat auf r/LocalLLaMA einen Community-Benchmark veröffentlicht, der Qwen 3.8 27B und Qwen 3.6 27B auf der oMLX-Plattform direkt gegenüberstellt. Die vollständigen Ergebnisse sind auf llm-bench.io einsehbar und decken verschiedene Hardware-Konfigurationen sowie unterschiedliche Quantisierungsstufen ab. Das auffälligste Ergebnis ist das extreme Missverhältnis zwischen Qualitätsgewinn und Ressourcenverbrauch: Während die Qualitätswertung von 81,1 auf 87,7 Punkte steigt – ein relativer Zuwachs von rund 8 % –, explodiert die Zahl der Output-Tokens von 18.000 auf 78.000, also auf mehr als das Vierfache. Die Laufzeit verlängert sich dadurch von knapp 9 Minuten auf fast 45 Minuten, was einer Verfünffachung entspricht. Gleichzeitig sinkt der Durchsatz von 35 auf 29 Token pro Sekunde, was auf ein rechnerisch aufwendigeres Reasoning-Verhalten von Qwen 3.8 hindeutet. Das Modell scheint deutlich mehr interne Denkschritte zu erzeugen, bevor es eine Antwort ausgibt – ein typisches Merkmal von Thinking-Mode-Architekturen. Für Anwender, die Modelle lokal auf Apple-Silicon oder vergleichbarer Hardware betreiben, ist dieser Trade-off besonders spürbar, da lange Laufzeiten direkt die Nutzbarkeit im Alltag beeinflussen.
- Vollständige Benchmark-Daten (alle Hardware-Varianten, alle Quants) sind auf llm-bench.io veröffentlicht.
- Durchsatz sinkt von 35 tok/s (Qwen 3.6) auf 29 tok/s (Qwen 3.8) — ein Rückgang von 16 %.
- Output-Tokens steigen von 18K auf 78K, was auf intensives Chain-of-Thought- bzw. Thinking-Verhalten bei Qwen 3.8 hindeutet.
- Benchmark wurde auf oMLX durchgeführt — einer Plattform für MLX-basierte Inferenz, typischerweise auf Apple-Silicon-Hardware.
- Beitrag stammt von /u/DerTomsn und wurde am 2026-09-03 auf r/LocalLLaMA veröffentlicht.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.