Qwen3.8-27B auf SlopCodeBench: schwach bei strikten Code-Checkpoints
Der Reddit-Nutzer corruptbytes betreibt regelmäßige Läufe auf dem SlopCodeBench, einem noch weitgehend ungesättigten Benchmark für Code-Agenten-Workflows. Getestet wurde Qwen3.8-27B, das über OpenRouter ausgeführt wurde, da lokales Ausführen auf dem Mac des Autors nicht praktikabel war. Der Benchmark gliedert sich in zwei Subsets: Das HumanLayer-Opus-5-Subset umfasst 3 Probleme und 17 Checkpoints, das HumanLayer-Fable-Sol-Kimi-Subset 6 Probleme und 30 Checkpoints. Dabei wird zwischen „strict checkpoints" – die vollständige, korrekte Umsetzung verlangen – und „core checkpoints" unterschieden, die grundlegende Problemlösekompetenz abbilden. Qwen3.8-27B schnitt im Strict-Modus mit 3/17 (17,6 %) bzw. 4/30 (13,3 %) ab und liegt damit deutlich hinter Fable 5 mit Claude Code (33,3 %) sowie GPT-5.6 Sol mit Codex (33,3 %). Die Ergebnisse wurden unter dem System-Tag „pi" (offenbar ein spezifischer Agenten-Runner des Autors) geführt; die vollständigen Ergebnisse sind auf GitHub einsehbar. Das Fazit des Autors: Qwen3.8-27B ist für autonomes Codebase-Management ungeeignet, kann aber in angeleiteten Copilot-Szenarien nützlich sein.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-27B auf SlopCodeBench: schwach bei strikten Code-Checkpoints
Der Reddit-Nutzer corruptbytes betreibt regelmäßige Läufe auf dem SlopCodeBench, einem noch weitgehend ungesättigten Benchmark für Code-Agenten-Workflows. Getestet wurde Qwen3.8-27B, das über OpenRouter ausgeführt wurde, da lokales Ausführen auf dem Mac des Autors nicht praktikabel war. Der Benchmark gliedert sich in zwei Subsets: Das HumanLayer-Opus-5-Subset umfasst 3 Probleme und 17 Checkpoints, das HumanLayer-Fable-Sol-Kimi-Subset 6 Probleme und 30 Checkpoints. Dabei wird zwischen „strict checkpoints" – die vollständige, korrekte Umsetzung verlangen – und „core checkpoints" unterschieden, die grundlegende Problemlösekompetenz abbilden. Qwen3.8-27B schnitt im Strict-Modus mit 3/17 (17,6 %) bzw. 4/30 (13,3 %) ab und liegt damit deutlich hinter Fable 5 mit Claude Code (33,3 %) sowie GPT-5.6 Sol mit Codex (33,3 %). Die Ergebnisse wurden unter dem System-Tag „pi" (offenbar ein spezifischer Agenten-Runner des Autors) geführt; die vollständigen Ergebnisse sind auf GitHub einsehbar. Das Fazit des Autors: Qwen3.8-27B ist für autonomes Codebase-Management ungeeignet, kann aber in angeleiteten Copilot-Szenarien nützlich sein.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.