
Terminal-Bench-Science bewertet KI-Agenten auf echten wissenschaftlichen Workflows
Warum es zählt
KI-Agenten werden erstmals auf realen Forschungsworkflows statt Schulbuchwissen gemessen – mit verifizierbaren Artefakten wie Code, Simulationen und Beweisen. Die niedrige Top-Score von 30 % zeigt, wie weit aktuelle Frontier-Modelle von praktischer wissenschaftlicher Assistenz entfernt sind.
— Lumeric Redaktion
Terminal-Bench-Science 0.1 · Spitzenwert
30%
Claude Opus 5
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGhuggingface.co3w
ASI-Bench: Erster Benchmark für autonome wissenschaftliche Exploration von KI
- FORSCHUNGarxiv.org4d
AgentIdeaBench: Benchmark für wissenschaftliche Ideenfindung durch KI-Agenten
- FORSCHUNGarxiv.org1w
TruthInsightBench: Benchmark für echte Entdeckungen durch KI-Wissenschaftsagenten

Terminal-Bench-Science bewertet KI-Agenten auf echten wissenschaftlichen Workflows
Warum es zählt
KI-Agenten werden erstmals auf realen Forschungsworkflows statt Schulbuchwissen gemessen – mit verifizierbaren Artefakten wie Code, Simulationen und Beweisen. Die niedrige Top-Score von 30 % zeigt, wie weit aktuelle Frontier-Modelle von praktischer wissenschaftlicher Assistenz entfernt sind.
— Lumeric Redaktion
Terminal-Bench-Science 0.1 · Spitzenwert
30%
Claude Opus 5
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGhuggingface.co3w
ASI-Bench: Erster Benchmark für autonome wissenschaftliche Exploration von KI
- FORSCHUNGarxiv.org4d
AgentIdeaBench: Benchmark für wissenschaftliche Ideenfindung durch KI-Agenten
- FORSCHUNGarxiv.org1w
TruthInsightBench: Benchmark für echte Entdeckungen durch KI-Wissenschaftsagenten