beellama-Fork optimiert kvarn KV-Quants: bis zu 76 % schnelleres Token-Gen
CompaniesPerplexity
Warum es zählt
Wer lokal auf begrenztem VRAM (z. B. 16 GB) mit langen Kontexten inferiert, kann durch diesen Fork kvarn-Quants ohne Geschwindigkeitsverlust bei tiefen Kontexten nutzen. Bei ctx 163 840 sollen die Ergebnisse mit regulären qx_x-Quants vergleichbar sein – allerdings ist die Auswirkung auf Qualität (KLD) noch ungeprüft.
— Lumeric Redaktion
76% schneller
Token-Gen vs. beellama kvarn bei hohem Kontext
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
beellama-Fork optimiert kvarn KV-Quants: bis zu 76 % schnelleres Token-Gen
CompaniesPerplexity
Warum es zählt
Wer lokal auf begrenztem VRAM (z. B. 16 GB) mit langen Kontexten inferiert, kann durch diesen Fork kvarn-Quants ohne Geschwindigkeitsverlust bei tiefen Kontexten nutzen. Bei ctx 163 840 sollen die Ergebnisse mit regulären qx_x-Quants vergleichbar sein – allerdings ist die Auswirkung auf Qualität (KLD) noch ungeprüft.
— Lumeric Redaktion
76% schneller
Token-Gen vs. beellama kvarn bei hohem Kontext
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.