Audit: Bis zu 12 % der Fragen in GPQA, MMLU-Pro und MMMU-Pro fehlerhaft
ToolsHugging Face
CompaniesHugging Face
Warum es zählt
Wer Modelle auf diesen Benchmarks evaluiert, misst bisher teils gegen falsche Antwortschlüssel. Die bereinigten „-Clean"-Versionen auf Hugging Face sowie lm-eval-harness-Tasks ermöglichen ab sofort aussagekräftigere Vergleiche.
— Lumeric Redaktion
~12 % entfernt
Fehlerhafte Fragen in GPQA-Ext., MMLU-Pro, MMMU-Pro
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Audit: Bis zu 12 % der Fragen in GPQA, MMLU-Pro und MMMU-Pro fehlerhaft
ToolsHugging Face
CompaniesHugging Face
Warum es zählt
Wer Modelle auf diesen Benchmarks evaluiert, misst bisher teils gegen falsche Antwortschlüssel. Die bereinigten „-Clean"-Versionen auf Hugging Face sowie lm-eval-harness-Tasks ermöglichen ab sofort aussagekräftigere Vergleiche.
— Lumeric Redaktion
~12 % entfernt
Fehlerhafte Fragen in GPQA-Ext., MMLU-Pro, MMMU-Pro
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.