Nonobench v1.2: 43 LLMs auf Nonogramm-Rätseln – GPT-6 Astra als erstes Modell perfekt
CompaniesDeepSeek
Warum es zählt
Open-Weight-Modelle scheitern kollektiv am 20×20-Hard-Mode (0/10), während proprietäre Modelle wie Opus 5.5 (8/10) klar führen – zeigt eine konkrete Lücke bei komplexem kombinatorischen Schlussfolgern. DeepSeek V4 Pro (83%) bietet das beste Open-Weight-Ergebnis zu niedrigen Kosten ($0.84 gesamt).
— Lumeric Redaktion
Nonobench v1.2 (15×15) · Spitzenwert
100%
GPT-6 Astra
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Nonobench v1.2: 43 LLMs auf Nonogramm-Rätseln – GPT-6 Astra als erstes Modell perfekt
CompaniesDeepSeek
Warum es zählt
Open-Weight-Modelle scheitern kollektiv am 20×20-Hard-Mode (0/10), während proprietäre Modelle wie Opus 5.5 (8/10) klar führen – zeigt eine konkrete Lücke bei komplexem kombinatorischen Schlussfolgern. DeepSeek V4 Pro (83%) bietet das beste Open-Weight-Ergebnis zu niedrigen Kosten ($0.84 gesamt).
— Lumeric Redaktion
Nonobench v1.2 (15×15) · Spitzenwert
100%
GPT-6 Astra
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.