
PerceptionBench: Kein Frontier-Modell erreicht 60 % bei visueller Wahrnehmung
ToolsGPT
CompaniesMoonshot AI
Warum es zählt
Viele vermeintliche Reasoning-Fehler entstehen bereits beim Bildlesen – nicht erst beim Schlussfolgern. AI-Builder sollten Wahrnehmung und Reasoning als getrennte Schwachstellen evaluieren und gezielt adressieren.
— Lumeric Redaktion
PerceptionBench · Spitzenwert
59%
GPT-5.6 Sol
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org2w
Illusion-Reasoning: Benchmark testet LVLMs mit visuellen Illusionen
- FORSCHUNGarxiv.org3w
Studie: VLMs verletzen eigene Introspektionsregeln in bis zu 60 % der Fälle
- FORSCHUNGarxiv.org1d
GroundBench: Neuer Benchmark lokalisiert Affordance-Fehler in VLMs
- BENCHMARKarxiv.org3w
StateSight: Neuer Benchmark testet räumliches Schlussfolgern von VLMs

PerceptionBench: Kein Frontier-Modell erreicht 60 % bei visueller Wahrnehmung
ToolsGPT
CompaniesMoonshot AI
Warum es zählt
Viele vermeintliche Reasoning-Fehler entstehen bereits beim Bildlesen – nicht erst beim Schlussfolgern. AI-Builder sollten Wahrnehmung und Reasoning als getrennte Schwachstellen evaluieren und gezielt adressieren.
— Lumeric Redaktion
PerceptionBench · Spitzenwert
59%
GPT-5.6 Sol
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org2w
Illusion-Reasoning: Benchmark testet LVLMs mit visuellen Illusionen
- FORSCHUNGarxiv.org3w
Studie: VLMs verletzen eigene Introspektionsregeln in bis zu 60 % der Fälle
- FORSCHUNGarxiv.org1d
GroundBench: Neuer Benchmark lokalisiert Affordance-Fehler in VLMs
- BENCHMARKarxiv.org3w
StateSight: Neuer Benchmark testet räumliches Schlussfolgern von VLMs