GLM-5.2 schlägt GPT-5.5 bei Halluzinationsrate auf AA-Omniscience
Der Beitrag beleuchtet eine wachsende Skepsis gegenüber reiner Parameterskalierung bei großen Sprachmodellen und nutzt den AA-Omniscience-Benchmark als konkreten Prüfstein für Unsicherheitskalibrierung. Als dramatischer Aufhänger dient das Beispiel von Claude Fable 5, das laut dem Artikel drei Tage nach seiner Veröffentlichung vom US-Regierung aufgrund nationaler Sicherheitsbedenken gesperrt wurde – das erste derartige US-KI-Verbot überhaupt, ausgelöst durch eine einzige kritische Jailbreak-Schwachstelle. Auf dem Artificial Analysis Intelligence Index liegen GPT-5.5 und Fable 5 zwar vorn, doch GLM-5.2 (753B Parameter, davon ~40B aktiv) kommt diesen Modellen auf 4 bzw. 9 Punkte nahe – obwohl die proprietären Modelle auf 1,5- bis 2-fache Parameterzahl geschätzt werden. Den zentralen Befund illustriert der Autor anhand einer konkreten Python-Aufgabe: DeepSeek V4 Pro benötigte 3 Minuten 52 Sekunden und rund 7.700 Reasoning-Tokens, um eine fachlich falsche Antwort zu einer technisch unmöglichen asyncio-Anforderung zu produzieren, während GLM-5.2 die logische Unmöglichkeit der Aufgabe in 12 Sekunden und ~800 Tokens korrekt identifizierte. Der Artikel schließt mit einem strukturellen Dreiklang, den er als „Trilemma moderner LLMs" bezeichnet: rohe Leistungsfähigkeit, Unsicherheitskalibrierung bzw. Halluzinationsrate und Recheneffizienz lassen sich bisher nicht gleichzeitig optimieren. Beide Modelle wurden für den Test über OpenRouter bei Temperatur 1 und „high" Reasoning Effort ausgeführt, GLM-5.2 via Z.ai und DeepSeek V4 Pro via Baidu Qianfan, jeweils in FP8-Präzision.
- DeepSeek V4 Pro hat 1,6T Parameter (49B aktiv) und erreicht einen AA Intelligence Index Score von 44 – trotzdem die höchste Halluzinationsrate im Vergleichsfeld mit 94%.
- Opus 4.8 liegt bei 36% Halluzinationsrate, Fable 5 bei 48% – beide deutlich zwischen GLM-5.2 (28%) und GPT-5.5 (86%).
- Claude Fable 5 wurde laut Artikel drei Tage nach Release von der US-Regierung aus nationalen Sicherheitsgründen gesperrt – als erstes US-KI-Modell überhaupt.
- GLM-5.2 identifizierte die technische Unmöglichkeit einer nicht-yieldenden asyncio-Event-Loop korrekt; DeepSeek V4 Pro lieferte nach 7.700 Reasoning-Tokens eine selbstsichere, aber falsche Implementierung.
- Der Test erfolgte mit identischem System-Prompt, Temperatur 1 und 'high' Reasoning Effort auf OpenRouter; GLM-5.2 wurde in FP8 via Z.ai, DeepSeek V4 Pro via Baidu Qianfan ausgeliefert.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
GLM-5.2 schlägt GPT-5.5 bei Halluzinationsrate auf AA-Omniscience
Der Beitrag beleuchtet eine wachsende Skepsis gegenüber reiner Parameterskalierung bei großen Sprachmodellen und nutzt den AA-Omniscience-Benchmark als konkreten Prüfstein für Unsicherheitskalibrierung. Als dramatischer Aufhänger dient das Beispiel von Claude Fable 5, das laut dem Artikel drei Tage nach seiner Veröffentlichung vom US-Regierung aufgrund nationaler Sicherheitsbedenken gesperrt wurde – das erste derartige US-KI-Verbot überhaupt, ausgelöst durch eine einzige kritische Jailbreak-Schwachstelle. Auf dem Artificial Analysis Intelligence Index liegen GPT-5.5 und Fable 5 zwar vorn, doch GLM-5.2 (753B Parameter, davon ~40B aktiv) kommt diesen Modellen auf 4 bzw. 9 Punkte nahe – obwohl die proprietären Modelle auf 1,5- bis 2-fache Parameterzahl geschätzt werden. Den zentralen Befund illustriert der Autor anhand einer konkreten Python-Aufgabe: DeepSeek V4 Pro benötigte 3 Minuten 52 Sekunden und rund 7.700 Reasoning-Tokens, um eine fachlich falsche Antwort zu einer technisch unmöglichen asyncio-Anforderung zu produzieren, während GLM-5.2 die logische Unmöglichkeit der Aufgabe in 12 Sekunden und ~800 Tokens korrekt identifizierte. Der Artikel schließt mit einem strukturellen Dreiklang, den er als „Trilemma moderner LLMs" bezeichnet: rohe Leistungsfähigkeit, Unsicherheitskalibrierung bzw. Halluzinationsrate und Recheneffizienz lassen sich bisher nicht gleichzeitig optimieren. Beide Modelle wurden für den Test über OpenRouter bei Temperatur 1 und „high" Reasoning Effort ausgeführt, GLM-5.2 via Z.ai und DeepSeek V4 Pro via Baidu Qianfan, jeweils in FP8-Präzision.
- DeepSeek V4 Pro hat 1,6T Parameter (49B aktiv) und erreicht einen AA Intelligence Index Score von 44 – trotzdem die höchste Halluzinationsrate im Vergleichsfeld mit 94%.
- Opus 4.8 liegt bei 36% Halluzinationsrate, Fable 5 bei 48% – beide deutlich zwischen GLM-5.2 (28%) und GPT-5.5 (86%).
- Claude Fable 5 wurde laut Artikel drei Tage nach Release von der US-Regierung aus nationalen Sicherheitsgründen gesperrt – als erstes US-KI-Modell überhaupt.
- GLM-5.2 identifizierte die technische Unmöglichkeit einer nicht-yieldenden asyncio-Event-Loop korrekt; DeepSeek V4 Pro lieferte nach 7.700 Reasoning-Tokens eine selbstsichere, aber falsche Implementierung.
- Der Test erfolgte mit identischem System-Prompt, Temperatur 1 und 'high' Reasoning Effort auf OpenRouter; GLM-5.2 wurde in FP8 via Z.ai, DeepSeek V4 Pro via Baidu Qianfan ausgeliefert.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.