Real-SWE: Benchmark für KI-Coding-Agenten auf echten Enterprise-Codebases
Warum es zählt
Im Gegensatz zu SWE-Bench nutzt Real-SWE nicht-öffentliche Codebases mit echten Business-Anforderungen (Billing, Steuern, Migrationen), was Overfitting auf bekannte Repos ausschließt. Die niedrigen Resolution Rates (max. 38,8 %) zeigen, wie weit Coding-Agenten von produktionsreifem Engineering noch entfernt sind.
— Lumeric Redaktion
Real-SWE · Spitzenwert
38.8%
Fable 5.1
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Real-SWE: Benchmark für KI-Coding-Agenten auf echten Enterprise-Codebases
Warum es zählt
Im Gegensatz zu SWE-Bench nutzt Real-SWE nicht-öffentliche Codebases mit echten Business-Anforderungen (Billing, Steuern, Migrationen), was Overfitting auf bekannte Repos ausschließt. Die niedrigen Resolution Rates (max. 38,8 %) zeigen, wie weit Coding-Agenten von produktionsreifem Engineering noch entfernt sind.
— Lumeric Redaktion
Real-SWE · Spitzenwert
38.8%
Fable 5.1
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.