GLM-5.2 Long-Context-Bug in ik_llama.cpp: NaN-Crash ab 32k Token
ToolsLlama
Warum es zählt
GLM-5.2 ist für 1M-Kontext trainiert, bleibt aber in der Praxis auf kurze Kontexte beschränkt. Bestehende Workarounds (FA off, KV-Cache auf CPU, reduzierter Batch) helfen nicht — GPU-seitige f16-Overflows im DSA/Indexer-Pfad sind der Verdacht. CPU-only als einziger stabiler Pfad wäre ein erheblicher Performance-Verlust.
— Lumeric Redaktion
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
GLM-5.2 Long-Context-Bug in ik_llama.cpp: NaN-Crash ab 32k Token
ToolsLlama
Warum es zählt
GLM-5.2 ist für 1M-Kontext trainiert, bleibt aber in der Praxis auf kurze Kontexte beschränkt. Bestehende Workarounds (FA off, KV-Cache auf CPU, reduzierter Batch) helfen nicht — GPU-seitige f16-Overflows im DSA/Indexer-Pfad sind der Verdacht. CPU-only als einziger stabiler Pfad wäre ein erheblicher Performance-Verlust.
— Lumeric Redaktion
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.