Tesla P40: F16 KV-Cache schlägt Q8 bei Generation-Speed
Warum es zählt
Wer Long-Context-Inferenz auf P40-GPUs betreibt, sollte KV-Cache auf F16 umstellen – der Dequantisierungs-Overhead von Q8 überwiegt den VRAM-Vorteil deutlich, solange der Cache in den VRAM passt.
— Lumeric Redaktion
KV-Cache F16 vs Q8 – Token Generation TPS (Q5, 45k ctx) · Spitzenwert
24.11%
F16 KV
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Tesla P40: F16 KV-Cache schlägt Q8 bei Generation-Speed
Warum es zählt
Wer Long-Context-Inferenz auf P40-GPUs betreibt, sollte KV-Cache auf F16 umstellen – der Dequantisierungs-Overhead von Q8 überwiegt den VRAM-Vorteil deutlich, solange der Cache in den VRAM passt.
— Lumeric Redaktion
KV-Cache F16 vs Q8 – Token Generation TPS (Q5, 45k ctx) · Spitzenwert
24.11%
F16 KV
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.