Grok 4.5 veröffentlicht – GLM-5.2 nur 2,6 Punkte dahinter auf SWE Bench Pro
CompaniesxAI
Warum es zählt
Das MIT-lizenzierte, selbst-hostbare GLM-5.2 liegt laut xAIs eigenem Marketing-Chart nur 2,6 Punkte hinter Grok 4.5 und schlägt GPT 5.5 – relevant für Teams, die Frontier-nahe Coding-Performance ohne API-Abhängigkeit suchen. Zudem zeigt die Harness-Diskrepanz (Grok 62 % intern vs. 53 % bei unabhängigem DataCurve-Run), dass Benchmark-Bedingungen kritisch zu hinterfragen sind.
— Lumeric Redaktion
SWE Bench Pro · Spitzenwert
80.4%
Fable
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreinvently.co.uk3w
GLM-5.3 übertrifft OpenAI- und Anthropic-Modelle bei 1/5 der Kosten
- BENCHMARKreddit.com2w
Terminal Bench 4.0: GLM-5.3 auf Augenhöhe mit Fable 5
- MEINUNGreddit.com3w
GLM-5.3 erscheint: Nutzer kritisiert Artificial Analysis Intelligence/Cost-Plot
- GERÜCHTreddit.com2w
Agent Arena Code: GLM 6 und Qwen 4 auf Augenhöhe mit Spitzenmodellen erwartet
Grok 4.5 veröffentlicht – GLM-5.2 nur 2,6 Punkte dahinter auf SWE Bench Pro
CompaniesxAI
Warum es zählt
Das MIT-lizenzierte, selbst-hostbare GLM-5.2 liegt laut xAIs eigenem Marketing-Chart nur 2,6 Punkte hinter Grok 4.5 und schlägt GPT 5.5 – relevant für Teams, die Frontier-nahe Coding-Performance ohne API-Abhängigkeit suchen. Zudem zeigt die Harness-Diskrepanz (Grok 62 % intern vs. 53 % bei unabhängigem DataCurve-Run), dass Benchmark-Bedingungen kritisch zu hinterfragen sind.
— Lumeric Redaktion
SWE Bench Pro · Spitzenwert
80.4%
Fable
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreinvently.co.uk3w
GLM-5.3 übertrifft OpenAI- und Anthropic-Modelle bei 1/5 der Kosten
- BENCHMARKreddit.com2w
Terminal Bench 4.0: GLM-5.3 auf Augenhöhe mit Fable 5
- MEINUNGreddit.com3w
GLM-5.3 erscheint: Nutzer kritisiert Artificial Analysis Intelligence/Cost-Plot
- GERÜCHTreddit.com2w
Agent Arena Code: GLM 6 und Qwen 4 auf Augenhöhe mit Spitzenmodellen erwartet