LLM-Maze-Benchmark testet räumliches Denken und Tool-Nutzung
ToolsGPT
Warum es zählt
Räumliches Denken und konsistente Tool-Nutzung über lange Kontexte bleiben für aktuelle Modelle schwierig – GLM-5.2 vergaß bis Schritt 730, dass es 45-Grad-Drehungen ausführen kann. Wer Agenten mit Navigationsfähigkeiten baut, sollte solche Szenarien explizit evaluieren.
— Lumeric Redaktion
LLM Maze Benchmark (räumliches Denken) · Spitzenwert
9%
K2.6
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
LLM-Maze-Benchmark testet räumliches Denken und Tool-Nutzung
ToolsGPT
Warum es zählt
Räumliches Denken und konsistente Tool-Nutzung über lange Kontexte bleiben für aktuelle Modelle schwierig – GLM-5.2 vergaß bis Schritt 730, dass es 45-Grad-Drehungen ausführen kann. Wer Agenten mit Navigationsfähigkeiten baut, sollte solche Szenarien explizit evaluieren.
— Lumeric Redaktion
LLM Maze Benchmark (räumliches Denken) · Spitzenwert
9%
K2.6
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.