
Studie: AI-Coding-Agents unterschätzen Zeitbedarf massiv und überschätzen Qualität
Die Studie untersucht ein bislang wenig beachtetes Problem autonomer KI-Coding-Systeme: ihre vollständige Zeitblindheit. Weder Claude Code noch Codex verfügen über einen internen Mechanismus, der ihnen erlaubt, vergangene oder verbleibende Bearbeitungszeit realistisch einzuschätzen – und entscheidend ist, dass beide Systeme sich dieser Einschränkung nicht bewusst sind. Besonders ausgeprägt ist der Effekt bei Codex, dessen Zeitschätzungen um bis zu das Zehnfache von der tatsächlichen Ausführungsdauer abweichen. Hinzu kommt ein systematischer Selbstbewertungs-Bias: Beide Modelle schätzen die Qualität ihrer eigenen Arbeit konsistent um rund 20 Prozentpunkte zu hoch ein, verglichen mit objektiven Metriken oder menschlichen Beurteilungen. Das Zusammenspiel beider Fehlerquellen ist besonders heikel – ein Agent, der glaubt, schnell und gut gearbeitet zu haben, signalisiert keine Unsicherheit und fordert keine menschliche Überprüfung an. In CI/CD-Pipelines oder mehrstündigen autonomen Workflows, wo menschliche Aufsicht ohnehin reduziert ist, können sich solche Fehleinschätzungen unbemerkt akkumulieren. Die Studie liefert damit ein empirisches Argument für externe Zeitlimits, Fortschritts-Checkpoints und von den Agents unabhängige Qualitätsprüfungen als architektonische Pflichtbestandteile.
- Codex überschätzt die tatsächliche Aufgabendauer um bis zu das Zehnfache – eine der größten dokumentierten Zeitschätzfehler bei Coding-Agents.
- Beide Systeme bewerten ihre eigenen Ergebnisse ca. 20 Prozentpunkte besser als objektive Metriken oder externe Bewerter.
- Beide Modelle sind sich ihrer Zeitblindheit nicht bewusst – sie geben keine Unsicherheitssignale bezüglich ihrer Zeitschätzungen aus.
- Das Problem verschärft sich bei langen, autonomen Tasks, da dort menschliche Korrekturmöglichkeiten zeitlich weit auseinanderliegen.
- Claude Code und Codex wurden als konkrete Untersuchungsobjekte der Studie genannt; andere Coding-Agents wurden nicht erwähnt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGtowardsdatascience.com2w
Warum Claude Code Zeitschätzungen zu pessimistisch sind
- MEINUNGtowardsdatascience.com0mo
LLM-gestütztes Projektmanagement: So arbeiten Software-Engineers effizienter
- FORSCHUNGarxiv.org4d
LLM-Agents melden Aufgabenfortschritt unzuverlässig – neue Studie
- MEINUNGarxiv.org2w
Position Paper: AI Agents untergraben menschliche Aufsichtsfähigkeiten

Studie: AI-Coding-Agents unterschätzen Zeitbedarf massiv und überschätzen Qualität
Die Studie untersucht ein bislang wenig beachtetes Problem autonomer KI-Coding-Systeme: ihre vollständige Zeitblindheit. Weder Claude Code noch Codex verfügen über einen internen Mechanismus, der ihnen erlaubt, vergangene oder verbleibende Bearbeitungszeit realistisch einzuschätzen – und entscheidend ist, dass beide Systeme sich dieser Einschränkung nicht bewusst sind. Besonders ausgeprägt ist der Effekt bei Codex, dessen Zeitschätzungen um bis zu das Zehnfache von der tatsächlichen Ausführungsdauer abweichen. Hinzu kommt ein systematischer Selbstbewertungs-Bias: Beide Modelle schätzen die Qualität ihrer eigenen Arbeit konsistent um rund 20 Prozentpunkte zu hoch ein, verglichen mit objektiven Metriken oder menschlichen Beurteilungen. Das Zusammenspiel beider Fehlerquellen ist besonders heikel – ein Agent, der glaubt, schnell und gut gearbeitet zu haben, signalisiert keine Unsicherheit und fordert keine menschliche Überprüfung an. In CI/CD-Pipelines oder mehrstündigen autonomen Workflows, wo menschliche Aufsicht ohnehin reduziert ist, können sich solche Fehleinschätzungen unbemerkt akkumulieren. Die Studie liefert damit ein empirisches Argument für externe Zeitlimits, Fortschritts-Checkpoints und von den Agents unabhängige Qualitätsprüfungen als architektonische Pflichtbestandteile.
- Codex überschätzt die tatsächliche Aufgabendauer um bis zu das Zehnfache – eine der größten dokumentierten Zeitschätzfehler bei Coding-Agents.
- Beide Systeme bewerten ihre eigenen Ergebnisse ca. 20 Prozentpunkte besser als objektive Metriken oder externe Bewerter.
- Beide Modelle sind sich ihrer Zeitblindheit nicht bewusst – sie geben keine Unsicherheitssignale bezüglich ihrer Zeitschätzungen aus.
- Das Problem verschärft sich bei langen, autonomen Tasks, da dort menschliche Korrekturmöglichkeiten zeitlich weit auseinanderliegen.
- Claude Code und Codex wurden als konkrete Untersuchungsobjekte der Studie genannt; andere Coding-Agents wurden nicht erwähnt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGtowardsdatascience.com2w
Warum Claude Code Zeitschätzungen zu pessimistisch sind
- MEINUNGtowardsdatascience.com0mo
LLM-gestütztes Projektmanagement: So arbeiten Software-Engineers effizienter
- FORSCHUNGarxiv.org4d
LLM-Agents melden Aufgabenfortschritt unzuverlässig – neue Studie
- MEINUNGarxiv.org2w
Position Paper: AI Agents untergraben menschliche Aufsichtsfähigkeiten