
Studie: Claude, Codex und Cursor wählen bei 17k Runs unterschiedliche Tools
Armature Tech baute für die Studie ein Panel aus 75 sorgfältig konstruierten Repositories in 10 Programmiersprachen, die mit fiktiven Firmennamen, gefälschten Git-Historien und synthetischen API-Keys bestückt wurden – echte Lockfiles wurden jedoch gegen Paketmanager-Registries wie npm validiert. Jedes der 16.893 Experimente lief in einer eigenen, kurzlebigen Sandbox (rotierend zwischen E2B, Blaxel und Daytona), um Infrastruktur-Bias zu minimieren. Ein besonderer methodischer Kniff war der „Simulated Human in the Loop": Ein Gemini-3.7-Flash-Orchestrator spielte einen menschlichen Gesprächspartner, der den Agenten zunächst nach einer Empfehlung fragt und dann die Top-1-Lösung abnickt – ohne diesen Schritt hätten die Agenten deutlich öfter komplett selbst gebaut statt Drittanbieter zu wählen. Als Beispiel nennt die Studie Object Storage: Erst durch den simulierten Menschen begann Cloudflare R2 gegen Amazon S3 zu gewinnen, das zuvor fast immer ausgewählt wurde. Ein zweiter Gemini-3.7-Flash-Instanz fungierte als Richter und filterte invalide Sessions heraus; von den 16.893 Runs galten 5.292 als auswertbar. Vier Nutzer-Personas – Vibe-Coder, Junior Engineer, Senior Engineer und Enterprise-Engineer – sowie 1.163 Prompt-Variationen sorgten für realistische Aufgabenvielfalt. In 20–25 % der Fälle enthielten Prompts zusätzliche Angaben zu Kosten oder Nutzungsvolumen, um deren Einfluss auf die Toolwahl zu messen.
- Cursor nutzt in 2/3 der Sessions Web-Suche als Entscheidungsgrundlage; Codex sucht in 94 % der Fälle, dabei in 9 von 10 Queries mit gezielten Operatoren wie site:auth0.com.
- Claude Code greift nur in ~30 % der Sessions auf Web-Suche zurück, browst dann aber 3× mehr Seiten als Codex; in neueren Kategorien wie Sandboxes steigt die Web-Such-Quote auf ~80 %.
- Beim E-Mail-Provider gewinnt Resend auf TypeScript (55/89 Runs), Sendgrid auf Python (22/24), Postmark auf Go (20/24) und Azure ACS auf Java (22/23) – derselbe Prompt, vier verschiedene Sprachen, vier verschiedene Sieger.
- Im Voice-Agents-Segment wählt Claude Code Twilio, Codex OpenAI Realtime API und Cursor Vapi – alle drei Agenten landen bei unterschiedlichen Lösungen.
- PayPal wird im Zahlungsdienstleister-Segment in 139 Konversationen erwähnt, landet aber kaum als tatsächliche Implementierungs-Wahl – ein Muster, das die Autoren als 'Getting mentioned isn't winning' beschreiben.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com1w
Community-Diskussion: Welches Agent-Harness ist das Beste?
- MEINUNGtowardsdatascience.com2w
Claude Code vs. Codex: Welcher Coding-Agent für welche Aufgabe?
- MEINUNGtowardsdatascience.com1d
Single Model vs. Agent-Team: Entscheidungshilfe für KI-intensive Aufgaben
- MEINUNGreddit.com0mo
Diskussion: CLI-Coding-Tools vs. IDE – wann macht was Sinn?

Studie: Claude, Codex und Cursor wählen bei 17k Runs unterschiedliche Tools
Armature Tech baute für die Studie ein Panel aus 75 sorgfältig konstruierten Repositories in 10 Programmiersprachen, die mit fiktiven Firmennamen, gefälschten Git-Historien und synthetischen API-Keys bestückt wurden – echte Lockfiles wurden jedoch gegen Paketmanager-Registries wie npm validiert. Jedes der 16.893 Experimente lief in einer eigenen, kurzlebigen Sandbox (rotierend zwischen E2B, Blaxel und Daytona), um Infrastruktur-Bias zu minimieren. Ein besonderer methodischer Kniff war der „Simulated Human in the Loop": Ein Gemini-3.7-Flash-Orchestrator spielte einen menschlichen Gesprächspartner, der den Agenten zunächst nach einer Empfehlung fragt und dann die Top-1-Lösung abnickt – ohne diesen Schritt hätten die Agenten deutlich öfter komplett selbst gebaut statt Drittanbieter zu wählen. Als Beispiel nennt die Studie Object Storage: Erst durch den simulierten Menschen begann Cloudflare R2 gegen Amazon S3 zu gewinnen, das zuvor fast immer ausgewählt wurde. Ein zweiter Gemini-3.7-Flash-Instanz fungierte als Richter und filterte invalide Sessions heraus; von den 16.893 Runs galten 5.292 als auswertbar. Vier Nutzer-Personas – Vibe-Coder, Junior Engineer, Senior Engineer und Enterprise-Engineer – sowie 1.163 Prompt-Variationen sorgten für realistische Aufgabenvielfalt. In 20–25 % der Fälle enthielten Prompts zusätzliche Angaben zu Kosten oder Nutzungsvolumen, um deren Einfluss auf die Toolwahl zu messen.
- Cursor nutzt in 2/3 der Sessions Web-Suche als Entscheidungsgrundlage; Codex sucht in 94 % der Fälle, dabei in 9 von 10 Queries mit gezielten Operatoren wie site:auth0.com.
- Claude Code greift nur in ~30 % der Sessions auf Web-Suche zurück, browst dann aber 3× mehr Seiten als Codex; in neueren Kategorien wie Sandboxes steigt die Web-Such-Quote auf ~80 %.
- Beim E-Mail-Provider gewinnt Resend auf TypeScript (55/89 Runs), Sendgrid auf Python (22/24), Postmark auf Go (20/24) und Azure ACS auf Java (22/23) – derselbe Prompt, vier verschiedene Sprachen, vier verschiedene Sieger.
- Im Voice-Agents-Segment wählt Claude Code Twilio, Codex OpenAI Realtime API und Cursor Vapi – alle drei Agenten landen bei unterschiedlichen Lösungen.
- PayPal wird im Zahlungsdienstleister-Segment in 139 Konversationen erwähnt, landet aber kaum als tatsächliche Implementierungs-Wahl – ein Muster, das die Autoren als 'Getting mentioned isn't winning' beschreiben.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com1w
Community-Diskussion: Welches Agent-Harness ist das Beste?
- MEINUNGtowardsdatascience.com2w
Claude Code vs. Codex: Welcher Coding-Agent für welche Aufgabe?
- MEINUNGtowardsdatascience.com1d
Single Model vs. Agent-Team: Entscheidungshilfe für KI-intensive Aufgaben
- MEINUNGreddit.com0mo
Diskussion: CLI-Coding-Tools vs. IDE – wann macht was Sinn?