Harness-Vergleich: Claude Code vs. OpenCode vs. Pi mit DeepSeek V4 Flash
Ausgangspunkt des Vergleichs war ein Video von Theo, in dem er behauptete, GPT-5.6 schlage sich in Claude Code besser als in anderen Harnesses – was den Reddit-Nutzer xquarx dazu veranlasste, eine eigene Messung mit DeepSeek V4 Flash durchzuführen. Als gemeinsame Basis lief das Modell via vLLM mit rund 180 Tokens pro Sekunde, sodass die einzige Variable tatsächlich das Scaffolding war. Der Testfall war kein synthetisches Benchmark-Problem, sondern reale „Antigenic Work" in einer großen Codebasis – also praktische Refaktorierungs- und Analyseaufgaben unter Produktionsbedingungen. Die drei Harnesses unterscheiden sich fundamental in ihrer Strategie: Claude Code erkundet die Codebasis ausgiebig mit vielen Tool-Calls, Pi arbeitet mit eigenem Reasoning und trifft Entscheidungen intern, während OpenCode Aufgaben stärker delegiert und weniger eigenständig exploriert. Alle drei lieferten am Ende dieselben Code-Diffs – qualitativ war kein Unterschied messbar. Der Unterschied lag ausschließlich in Wanduhrzeit und Token-Verbrauch: Claude Code benötigte fast viermal so lange wie das schnellste System. Die vollständigen Charts, Token-Spreads und Roh-Daten hat xquarx auf einer eigenen GitHub-Pages-Site veröffentlicht, wo einzelne Runs nachvollziehbar sind.
- DeepSeek V4 Flash lief via vLLM mit ~180 tok/s – alle drei Harnesses griffen auf exakt dieselbe Modell-Instanz zu.
- Claude Code wurde über CLIProxyAPI an DeepSeek V4 Flash angebunden, da es nativ kein beliebiges Backend unterstützt.
- Die Benchmark-Aufgaben bestanden aus 'Antigenic Work' in einer großen Codebasis – kein synthetisches Toy-Problem.
- Messgröße waren neben der Wanduhrzeit auch die Anzahl und Struktur der Tool-Calls, nicht nur die reine Token-Zahl.
- Rohdaten und Diagramme sind öffentlich unter nqawhc.github.io/articles/harness-efficiency-not-quality/ abrufbar.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com1w
Nutzervergleich: Opencode vs. DeepSeek-Harness mit Qwen 3.8 27b
- MEINUNGreddit.com1w
DeepSeek-V4-Flash-Vision vs. Qwen3.8-Flash-Next: Praxisvergleich lokal
- MEINUNGreddit.com1w
little-coder vs. just Pi: Welches Coding-Harness für kleine Modelle?
- BENCHMARKreddit.com2w
HumanEval-Vergleich: GLM-5.3-Flash schlägt DeepSeek-V4-Flash-0731 auf 2x DGX Spark
Harness-Vergleich: Claude Code vs. OpenCode vs. Pi mit DeepSeek V4 Flash
Ausgangspunkt des Vergleichs war ein Video von Theo, in dem er behauptete, GPT-5.6 schlage sich in Claude Code besser als in anderen Harnesses – was den Reddit-Nutzer xquarx dazu veranlasste, eine eigene Messung mit DeepSeek V4 Flash durchzuführen. Als gemeinsame Basis lief das Modell via vLLM mit rund 180 Tokens pro Sekunde, sodass die einzige Variable tatsächlich das Scaffolding war. Der Testfall war kein synthetisches Benchmark-Problem, sondern reale „Antigenic Work" in einer großen Codebasis – also praktische Refaktorierungs- und Analyseaufgaben unter Produktionsbedingungen. Die drei Harnesses unterscheiden sich fundamental in ihrer Strategie: Claude Code erkundet die Codebasis ausgiebig mit vielen Tool-Calls, Pi arbeitet mit eigenem Reasoning und trifft Entscheidungen intern, während OpenCode Aufgaben stärker delegiert und weniger eigenständig exploriert. Alle drei lieferten am Ende dieselben Code-Diffs – qualitativ war kein Unterschied messbar. Der Unterschied lag ausschließlich in Wanduhrzeit und Token-Verbrauch: Claude Code benötigte fast viermal so lange wie das schnellste System. Die vollständigen Charts, Token-Spreads und Roh-Daten hat xquarx auf einer eigenen GitHub-Pages-Site veröffentlicht, wo einzelne Runs nachvollziehbar sind.
- DeepSeek V4 Flash lief via vLLM mit ~180 tok/s – alle drei Harnesses griffen auf exakt dieselbe Modell-Instanz zu.
- Claude Code wurde über CLIProxyAPI an DeepSeek V4 Flash angebunden, da es nativ kein beliebiges Backend unterstützt.
- Die Benchmark-Aufgaben bestanden aus 'Antigenic Work' in einer großen Codebasis – kein synthetisches Toy-Problem.
- Messgröße waren neben der Wanduhrzeit auch die Anzahl und Struktur der Tool-Calls, nicht nur die reine Token-Zahl.
- Rohdaten und Diagramme sind öffentlich unter nqawhc.github.io/articles/harness-efficiency-not-quality/ abrufbar.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com1w
Nutzervergleich: Opencode vs. DeepSeek-Harness mit Qwen 3.8 27b
- MEINUNGreddit.com1w
DeepSeek-V4-Flash-Vision vs. Qwen3.8-Flash-Next: Praxisvergleich lokal
- MEINUNGreddit.com1w
little-coder vs. just Pi: Welches Coding-Harness für kleine Modelle?
- BENCHMARKreddit.com2w
HumanEval-Vergleich: GLM-5.3-Flash schlägt DeepSeek-V4-Flash-0731 auf 2x DGX Spark