llama.cpp PR beschleunigt Q2_0 auf x86-CPUs um Faktor 3,0–3,6×
ToolsLlama
Warum es zählt
Lokale Inferenz mit Q2_0-Modellen (z. B. Bonsai-GGUFs) wird auf x86-Hardware drastisch schneller, ohne GPU. Wichtig: Der PR ist noch nicht gemergt, und der Gewinn gilt nur für Q2_0 – nicht für Q4/Q5-Quants.
— Lumeric Redaktion
llama-bench tg128 (CPU-only, Q2_0) · Spitzenwert
10.22%
1.7B vorher
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
llama.cpp PR beschleunigt Q2_0 auf x86-CPUs um Faktor 3,0–3,6×
ToolsLlama
Warum es zählt
Lokale Inferenz mit Q2_0-Modellen (z. B. Bonsai-GGUFs) wird auf x86-Hardware drastisch schneller, ohne GPU. Wichtig: Der PR ist noch nicht gemergt, und der Gewinn gilt nur für Q2_0 – nicht für Q4/Q5-Quants.
— Lumeric Redaktion
llama-bench tg128 (CPU-only, Q2_0) · Spitzenwert
10.22%
1.7B vorher
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.