Audit: Bis zu 12 % der Fragen in GPQA, MMLU-Pro und MMMU-Pro fehlerhaft
ToolsHugging Face
CompaniesHugging Face
Warum es zählt
Wer Modelle auf diesen Benchmarks evaluiert, misst bisher teils gegen falsche Antwortschlüssel. Die bereinigten „-Clean"-Versionen auf Hugging Face sowie lm-eval-harness-Tasks ermöglichen ab sofort aussagekräftigere Vergleiche.
— Lumeric Redaktion
~12 % entfernt
Fehlerhafte Fragen in GPQA-Ext., MMLU-Pro, MMMU-Pro
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org14h
Benchmark-Bereinigung: Studie deckt Surface-Leakage in TruthfulQA auf
- FORSCHUNGarxiv.org4d
Studie: 1,6% der Ollama-Modellartefakte sind still defekt
- FORSCHUNGarxiv.org1w
Test-Time-Methode verbessert Treue von LLM-Erklärungen ohne Training
- FORSCHUNGarxiv.org1w
KoNA-Benchmark testet selektive Antwortverweigerung in Vision-Language-Modellen
Audit: Bis zu 12 % der Fragen in GPQA, MMLU-Pro und MMMU-Pro fehlerhaft
ToolsHugging Face
CompaniesHugging Face
Warum es zählt
Wer Modelle auf diesen Benchmarks evaluiert, misst bisher teils gegen falsche Antwortschlüssel. Die bereinigten „-Clean"-Versionen auf Hugging Face sowie lm-eval-harness-Tasks ermöglichen ab sofort aussagekräftigere Vergleiche.
— Lumeric Redaktion
~12 % entfernt
Fehlerhafte Fragen in GPQA-Ext., MMLU-Pro, MMMU-Pro
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org14h
Benchmark-Bereinigung: Studie deckt Surface-Leakage in TruthfulQA auf
- FORSCHUNGarxiv.org4d
Studie: 1,6% der Ollama-Modellartefakte sind still defekt
- FORSCHUNGarxiv.org1w
Test-Time-Methode verbessert Treue von LLM-Erklärungen ohne Training
- FORSCHUNGarxiv.org1w
KoNA-Benchmark testet selektive Antwortverweigerung in Vision-Language-Modellen