Ling-3.0-Flash 124B generiert 15.128 Tokens auf einem DGX Spark mit stabilen 35,68 tok/s
ToolsLlama
Warum es zählt
Die nahezu konstante Decode-Rate über 12.000 zusätzliche KV-Cache-Token zeigt, dass llama.cpp auf DGX Spark beim 124B-Modell keinen messbaren Durchsatzabfall durch wachsenden Kontext zeigt – relevant für Long-Context-Inference-Setups auf Consumer-naher Hardware.
— Lumeric Redaktion
35,68 tok/s
Decode-Rate bei 15.062 Tokens, ein DGX Spark
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Ling-3.0-Flash 124B generiert 15.128 Tokens auf einem DGX Spark mit stabilen 35,68 tok/s
ToolsLlama
Warum es zählt
Die nahezu konstante Decode-Rate über 12.000 zusätzliche KV-Cache-Token zeigt, dass llama.cpp auf DGX Spark beim 124B-Modell keinen messbaren Durchsatzabfall durch wachsenden Kontext zeigt – relevant für Long-Context-Inference-Setups auf Consumer-naher Hardware.
— Lumeric Redaktion
35,68 tok/s
Decode-Rate bei 15.062 Tokens, ein DGX Spark
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.