llama.cpp PR: AVX2-Optimierung beschleunigt IQ-Quants auf CPU um bis zu 1278%
Warum es zählt
Wer IQ-Quants auf CPU für imatrix-Berechnungen oder Perplexitäts-Evaluierungen nutzt, könnte durch diesen PR drastisch kürzere Laufzeiten erzielen. Der Patch ist noch Draft/Open, aber die Benchmark-Daten auf AMD EPYC 9654 sind reproduzierbar und überzeugend.
— Lumeric Redaktion
llama.cpp Prompt Processing Speed (tok/s, batch 512) · Spitzenwert
4.75%
IQ3_S master
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
llama.cpp PR: AVX2-Optimierung beschleunigt IQ-Quants auf CPU um bis zu 1278%
Warum es zählt
Wer IQ-Quants auf CPU für imatrix-Berechnungen oder Perplexitäts-Evaluierungen nutzt, könnte durch diesen PR drastisch kürzere Laufzeiten erzielen. Der Patch ist noch Draft/Open, aber die Benchmark-Daten auf AMD EPYC 9654 sind reproduzierbar und überzeugend.
— Lumeric Redaktion
llama.cpp Prompt Processing Speed (tok/s, batch 512) · Spitzenwert
4.75%
IQ3_S master
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.