★ Begriff· Evaluation
HumanEval
Code-Benchmark: 164 Python-Aufgaben mit Unit-Tests. Misst Pass@1-Rate (erste Antwort korrekt). Frontier-Models 2026 bei >95% — Saturation, daher Ablöse durch LiveCodeBench, SWE-Bench.
Verwandte Tools
Auch bekannt als
human eval · swe-bench · livecodebench
Aktivität
7
Mentions in den letzten 7 Tagen
4 Wochen
⚡neu · 7×
Zuletzt erwähnt in
- Real-SWE: Benchmark für KI-Coding-Agenten auf echten Enterprise-Codebases2026-09-12
- Belief-Shift Branching verbessert Step-Level RL für LLMs deutlich2026-09-12
- Fehlende Benchmarks für Agent-Runtimes: Community diskutiert Lücke2026-09-11
- Studie: Kommentare helfen Code-Generierung nur bei korrektem Lösungsinhalt2026-09-11
- CyberTiel 35B-A3B: Uncensored 4-Bit-Quant übertrifft Opus 4.6 auf SWE-bench-Live2026-09-10