TensorSharp schlägt llama.cpp bei GLM-5.3-Flash Decode mit 2× Durchsatz
ToolsLlama
Warum es zählt
Der 2× Decode-Vorteil von TensorSharp entsteht durch einen shape-basierten LRU Graph Cache, der CUDA-captured Graphen wiederverwenden kann statt sie pro Token neu zu bauen – besonders relevant bei tiefen MoE-Modellen mit vielen kleinen Ops. Prefill-Performance ist dagegen GEMM-bound und nahezu identisch.
— Lumeric Redaktion
Inference Throughput – tg64 (Token Generation) · Spitzenwert
36.6%
llama.cpp
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
TensorSharp schlägt llama.cpp bei GLM-5.3-Flash Decode mit 2× Durchsatz
ToolsLlama
Warum es zählt
Der 2× Decode-Vorteil von TensorSharp entsteht durch einen shape-basierten LRU Graph Cache, der CUDA-captured Graphen wiederverwenden kann statt sie pro Token neu zu bauen – besonders relevant bei tiefen MoE-Modellen mit vielen kleinen Ops. Prefill-Performance ist dagegen GEMM-bound und nahezu identisch.
— Lumeric Redaktion
Inference Throughput – tg64 (Token Generation) · Spitzenwert
36.6%
llama.cpp
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.