OSCAR RotationZoo: 2-Bit KV-Cache-Quantisierung für llama.cpp und sglang
CompaniesHugging Face
Warum es zählt
Mit OSCAR lässt sich der KV-Cache auf 2 Bit quantisieren, was den VRAM-Bedarf bei langen Kontexten drastisch senkt. Die Unterstützung für llama.cpp und sglang macht die Methode sofort für lokale Deployments nutzbar.
— Lumeric Redaktion
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com3w
ConvRot-Quantisierung in llama-cpp-turboquant integriert
- FORSCHUNGarxiv.org6d
KV-Cache-Quantisierung für On-Chip-NVM spart 3,1–3,6× Leseenergie
- FORSCHUNGarxiv.org1mo
QUASAR: QAT-Methode senkt Loss Floor bei 2-Bit-Quantisierung um 29%
- FORSCHUNGarxiv.org0mo
SchurQuant: Neue PTQ-Methode verbessert 2-Bit-LLM-Genauigkeit um 9,65 pp
OSCAR RotationZoo: 2-Bit KV-Cache-Quantisierung für llama.cpp und sglang
CompaniesHugging Face
Warum es zählt
Mit OSCAR lässt sich der KV-Cache auf 2 Bit quantisieren, was den VRAM-Bedarf bei langen Kontexten drastisch senkt. Die Unterstützung für llama.cpp und sglang macht die Methode sofort für lokale Deployments nutzbar.
— Lumeric Redaktion
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com3w
ConvRot-Quantisierung in llama-cpp-turboquant integriert
- FORSCHUNGarxiv.org6d
KV-Cache-Quantisierung für On-Chip-NVM spart 3,1–3,6× Leseenergie
- FORSCHUNGarxiv.org1mo
QUASAR: QAT-Methode senkt Loss Floor bei 2-Bit-Quantisierung um 29%
- FORSCHUNGarxiv.org0mo
SchurQuant: Neue PTQ-Methode verbessert 2-Bit-LLM-Genauigkeit um 9,65 pp