
GLM-5.3 übertrifft OpenAI- und Anthropic-Modelle bei 1/5 der Kosten
Das Ed-O-Meter-Leaderboard von Reinvently bewertet LLMs anhand von 28 praxisnahen Einzelaufgaben in fünf Kategorien: Coding, Data, Realworld, Security und Tool-use. Die Suite ist bewusst günstig gehalten – ein kompletter Durchlauf kostet rund 30 US-Dollar – und soll agentic Workflows als eine Art Unit-Test abbilden. GLM-5.3 (open-weight, von Zhipu AI) ist das einzige Modell, das alle fünf Kategorien mit 100% Bestehensquote abschließt und dabei nur $0,28 pro Durchlauf kostet; der nächste Allrounder GPT-5.5 kostet $1,43 und erreicht im Realworld-Bereich nur 89%. Schlusslicht im Sicherheitstest ist die GPT-5.6-Linie: Luna, Terra und Sol lösten in 11 von 12 Jailbreak-Szenarien den Canary-Trigger aus, was auf ernsthafte Sicherheitslücken in dieser Modellreihe hindeutet. Fable-5 und Claude Opus-5 fallen durch Verweigerungen auf – Fable-5 lehnte fünf der 28 Aufgaben ab, Opus-5 blockierte vier Coding-Aufgaben bereits vor dem ersten Token. DeepSeek-V4-Pro erzielt bei nur $0,0029 pro Aufgabe eine 96%-Rate, ist mit 40,0 Sekunden medianer TTFT jedoch ausschließlich für Batch-Verarbeitung geeignet. Kimi-K3 führt im Rubrik-Score (9,5/10, bewertet durch Fable-5) trotz 26,4 Sekunden TTFT und 75% in der Data-Kategorie. Das Leaderboard listet zudem Haiku-4-5 als praktische Mittelklasse-Option: 96% Bestehensquote bei $0,0044 pro Aufgabe und lediglich 0,9 Sekunden TTFT.
- GLM-5.3 erzielt einen Rubrik-Score von 9,3/10 (dritthöchster Wert im Feld) – trotz 16,3 s medianer TTFT, dem zweitlangsamsten nach Kimi-K3.
- GPT-5.6-Luna ist mit $0,064 pro Lap und $0,0023 pro Aufgabe das günstigste Modell im Test, scheitert aber bei Security mit nur 33% Bestehensquote.
- Fable-5's Rubrik-Score von 9,3 ist selbstbewertet (Richter = Fable-5 selbst) und stammt aus einem früheren Teillauf vom 5. Juli 2026 mit nur 11 von 28 bewerteten Trials.
- Claude Opus-5 erreicht 100% in Realworld und Security sowie den höchsten Rubrik-Score (9,4) auf dem Standard-Panel, fällt aber auf 43% in Coding durch automatische Classifier-Blockaden.
- Der Rubrik-Score wurde nachträglich am 14. Juli 2026 von Fable-5 gegen gespeicherte Antworten berechnet – mit demselben Blind-Prompt-Setup wie alle anderen Bewertungszeilen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge

GLM-5.3 übertrifft OpenAI- und Anthropic-Modelle bei 1/5 der Kosten
Das Ed-O-Meter-Leaderboard von Reinvently bewertet LLMs anhand von 28 praxisnahen Einzelaufgaben in fünf Kategorien: Coding, Data, Realworld, Security und Tool-use. Die Suite ist bewusst günstig gehalten – ein kompletter Durchlauf kostet rund 30 US-Dollar – und soll agentic Workflows als eine Art Unit-Test abbilden. GLM-5.3 (open-weight, von Zhipu AI) ist das einzige Modell, das alle fünf Kategorien mit 100% Bestehensquote abschließt und dabei nur $0,28 pro Durchlauf kostet; der nächste Allrounder GPT-5.5 kostet $1,43 und erreicht im Realworld-Bereich nur 89%. Schlusslicht im Sicherheitstest ist die GPT-5.6-Linie: Luna, Terra und Sol lösten in 11 von 12 Jailbreak-Szenarien den Canary-Trigger aus, was auf ernsthafte Sicherheitslücken in dieser Modellreihe hindeutet. Fable-5 und Claude Opus-5 fallen durch Verweigerungen auf – Fable-5 lehnte fünf der 28 Aufgaben ab, Opus-5 blockierte vier Coding-Aufgaben bereits vor dem ersten Token. DeepSeek-V4-Pro erzielt bei nur $0,0029 pro Aufgabe eine 96%-Rate, ist mit 40,0 Sekunden medianer TTFT jedoch ausschließlich für Batch-Verarbeitung geeignet. Kimi-K3 führt im Rubrik-Score (9,5/10, bewertet durch Fable-5) trotz 26,4 Sekunden TTFT und 75% in der Data-Kategorie. Das Leaderboard listet zudem Haiku-4-5 als praktische Mittelklasse-Option: 96% Bestehensquote bei $0,0044 pro Aufgabe und lediglich 0,9 Sekunden TTFT.
- GLM-5.3 erzielt einen Rubrik-Score von 9,3/10 (dritthöchster Wert im Feld) – trotz 16,3 s medianer TTFT, dem zweitlangsamsten nach Kimi-K3.
- GPT-5.6-Luna ist mit $0,064 pro Lap und $0,0023 pro Aufgabe das günstigste Modell im Test, scheitert aber bei Security mit nur 33% Bestehensquote.
- Fable-5's Rubrik-Score von 9,3 ist selbstbewertet (Richter = Fable-5 selbst) und stammt aus einem früheren Teillauf vom 5. Juli 2026 mit nur 11 von 28 bewerteten Trials.
- Claude Opus-5 erreicht 100% in Realworld und Security sowie den höchsten Rubrik-Score (9,4) auf dem Standard-Panel, fällt aber auf 43% in Coding durch automatische Classifier-Blockaden.
- Der Rubrik-Score wurde nachträglich am 14. Juli 2026 von Fable-5 gegen gespeicherte Antworten berechnet – mit demselben Blind-Prompt-Setup wie alle anderen Bewertungszeilen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.