Encode Bench: Base64-Generierung korreliert 0.91 mit AI Intelligence Index
CompaniesDeepSeek
Warum es zählt
Base64-Ausgabe als indirekter Kompetenztest: Modelle müssen Problem lösen, Ergebnis exakt erhalten und korrekt enkodieren – ein Fehler bricht das Ergebnis. GPT-5.6 Sol erreicht 97.2%, Gemma 4 26B nur 23.6%. Für Evals-Praktiker interessant, aber Stichprobengröße (9 Modelle, 24 Tasks) verlangt Vorsicht.
— Lumeric Redaktion
Encode Bench (Base64 Pass Rate) · Spitzenwert
97.2%
GPT-5.6 Sol
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Encode Bench: Base64-Generierung korreliert 0.91 mit AI Intelligence Index
CompaniesDeepSeek
Warum es zählt
Base64-Ausgabe als indirekter Kompetenztest: Modelle müssen Problem lösen, Ergebnis exakt erhalten und korrekt enkodieren – ein Fehler bricht das Ergebnis. GPT-5.6 Sol erreicht 97.2%, Gemma 4 26B nur 23.6%. Für Evals-Praktiker interessant, aber Stichprobengröße (9 Modelle, 24 Tasks) verlangt Vorsicht.
— Lumeric Redaktion
Encode Bench (Base64 Pass Rate) · Spitzenwert
97.2%
GPT-5.6 Sol
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.