DeepSeek V4 Flash 0731 übertrifft GPT-5.6 Terra auf Toolathlon um 17 Punkte
CompaniesDeepSeek
Warum es zählt
DeepSeek V4 Flash 0731 schlägt GPT-5.6 Terra auf Tool-Use-Benchmarks (Toolathlon +17,2), schwächelt aber bei Agentic-Tasks (Agents' Last Exam −25,2). Für Builder relevant: Modellwahl hängt stark vom Task-Typ ab.
— Lumeric Redaktion
Toolathlon · Spitzenwert
51.8%
DeepSeek V4 Flash Preview
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
DeepSeek V4 Flash 0731 übertrifft GPT-5.6 Terra auf Toolathlon um 17 Punkte
CompaniesDeepSeek
Warum es zählt
DeepSeek V4 Flash 0731 schlägt GPT-5.6 Terra auf Tool-Use-Benchmarks (Toolathlon +17,2), schwächelt aber bei Agentic-Tasks (Agents' Last Exam −25,2). Für Builder relevant: Modellwahl hängt stark vom Task-Typ ab.
— Lumeric Redaktion
Toolathlon · Spitzenwert
51.8%
DeepSeek V4 Flash Preview
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.