Community-Benchmark: Ox Alpha erreicht 96% auf SWE-bench Verified Mini
Der Reddit-Nutzer verwendete als Scaffold mini-swe-agent v2.4.6 in der offiziellen Bash-Only-Konfiguration – exakt jene, die auch auf dem swebench.com-Leaderboard zum Einsatz kommt – und ließ Ox Alpha über opencode's Go-Gateway auf dem 50-Aufgaben-Set laufen. Die Auswertung erfolgte lokal mit dem offiziellen SWE-bench-Docker-Harness: Eine Aufgabe gilt nur dann als gelöst, wenn sämtliche FAIL_TO_PASS- und PASS_TO_PASS-Tests bestehen. Bemerkenswert ist, dass alle 50 Instanzen einen echten Patch lieferten – weder leere Einreichungen noch Laufzeitfehler. Die beiden nicht gelösten Fälle (django__django-11790 und django__django-11815) stammen beide aus dem Django-Teilset, während Sphinx mit 25/25 vollständig abgeschlossen wurde. Kritisch ist der Vergleichsrahmen: Die frontier-Zahlen von 72–77%, die als Bash-Only-Baseline auf swebench.com gelistet sind, basieren auf dem vollen 500-Aufgaben-Set über 12 Repositories – deutlich breiter und schwerer als das django+sphinx-only-Mini-Set. Alle Tasks im Mini-Set stammen aus dem Zeitraum 2019–2022, sodass eine Kontamination durch Trainingsdaten nicht ausgeschlossen werden kann, auch wenn die Schwierigkeitsverteilung laut OpenAIs eigenen Human-Annotations dem vollen Set entspricht. Der Autor verzichtet bewusst auf eine abschließende Bewertung und lädt die Community zur Reproduktion und Kritik ein.
- Scaffold-Details: mini-swe-agent v2.4.6, offizielles swebench.yaml-Template, Step-Limit 250, 4 parallele Worker auf Windows 11 / Docker Desktop (WSL2).
- Laufzeit: ca. 2 Stunden 4 Minuten gesamt; durchschnittlich 40 Schritte pro Task, Maximum 116 Schritte.
- Repo-Aufteilung: django 23/25 (2 Fehler), sphinx-doc 25/25 – Sphinx vollständig fehlerfrei gelöst.
- Das Mini-50-Set enthält laut OpenAI-Annotations sogar anteilig mehr >1-Stunden-Tasks (16 %) als das volle 500er-Set (9 %) – es ist also nicht bewusst auf leichte Aufgaben selektiert.
- Ox Alpha wurde über den Free-Tier von opencode genutzt; der Autor kann Caching oder serverseitiges Rate-Limiting nicht vollständig ausschließen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Community-Benchmark: Ox Alpha erreicht 96% auf SWE-bench Verified Mini
Der Reddit-Nutzer verwendete als Scaffold mini-swe-agent v2.4.6 in der offiziellen Bash-Only-Konfiguration – exakt jene, die auch auf dem swebench.com-Leaderboard zum Einsatz kommt – und ließ Ox Alpha über opencode's Go-Gateway auf dem 50-Aufgaben-Set laufen. Die Auswertung erfolgte lokal mit dem offiziellen SWE-bench-Docker-Harness: Eine Aufgabe gilt nur dann als gelöst, wenn sämtliche FAIL_TO_PASS- und PASS_TO_PASS-Tests bestehen. Bemerkenswert ist, dass alle 50 Instanzen einen echten Patch lieferten – weder leere Einreichungen noch Laufzeitfehler. Die beiden nicht gelösten Fälle (django__django-11790 und django__django-11815) stammen beide aus dem Django-Teilset, während Sphinx mit 25/25 vollständig abgeschlossen wurde. Kritisch ist der Vergleichsrahmen: Die frontier-Zahlen von 72–77%, die als Bash-Only-Baseline auf swebench.com gelistet sind, basieren auf dem vollen 500-Aufgaben-Set über 12 Repositories – deutlich breiter und schwerer als das django+sphinx-only-Mini-Set. Alle Tasks im Mini-Set stammen aus dem Zeitraum 2019–2022, sodass eine Kontamination durch Trainingsdaten nicht ausgeschlossen werden kann, auch wenn die Schwierigkeitsverteilung laut OpenAIs eigenen Human-Annotations dem vollen Set entspricht. Der Autor verzichtet bewusst auf eine abschließende Bewertung und lädt die Community zur Reproduktion und Kritik ein.
- Scaffold-Details: mini-swe-agent v2.4.6, offizielles swebench.yaml-Template, Step-Limit 250, 4 parallele Worker auf Windows 11 / Docker Desktop (WSL2).
- Laufzeit: ca. 2 Stunden 4 Minuten gesamt; durchschnittlich 40 Schritte pro Task, Maximum 116 Schritte.
- Repo-Aufteilung: django 23/25 (2 Fehler), sphinx-doc 25/25 – Sphinx vollständig fehlerfrei gelöst.
- Das Mini-50-Set enthält laut OpenAI-Annotations sogar anteilig mehr >1-Stunden-Tasks (16 %) als das volle 500er-Set (9 %) – es ist also nicht bewusst auf leichte Aufgaben selektiert.
- Ox Alpha wurde über den Free-Tier von opencode genutzt; der Autor kann Caching oder serverseitiges Rate-Limiting nicht vollständig ausschließen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.