Gemma 4 QAT MTP-Heads auf HuggingFace + PARALLEL=2-Fix + 12B-Benchmark
Warum es zählt
QAT-abgestimmte MTP-Heads steigern die Akzeptanzrate des 26B-A4B-Modells von 56,9 % auf 91,8 %. Mit PARALLEL=2 erreicht das 12B-Modell auf Strix Halo +31 % aggregierten Durchsatz gegenüber Plain-2-Slot – relevanter Praxis-Gewinn für lokale Multi-Slot-Inferenz.
— Lumeric Redaktion
MTP Acceptance Rate (QAT-matched vs. Non-QAT heads) · Spitzenwert
71.3%
12B QAT Q4_0 – non-QAT head
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com2w
MTP verlangsamt Gemma 4 12B QAT auf AMD RX 9060 XT im Vulkan-Backend
- FORSCHUNGreddit.com3w
Community-Fix für Ornith1.5 35B A3B: MTP-Head-Patch bringt 33% Zeitersparnis
- MEINUNGreddit.com1w
Nutzer optimiert MTP-Draft-Acceptance in llama.cpp mit Qwen3-35B
- LAUNCHreddit.com3w
MTP-Unterstützung für GLM-4.5-Air in llama.cpp verfügbar
Gemma 4 QAT MTP-Heads auf HuggingFace + PARALLEL=2-Fix + 12B-Benchmark
Warum es zählt
QAT-abgestimmte MTP-Heads steigern die Akzeptanzrate des 26B-A4B-Modells von 56,9 % auf 91,8 %. Mit PARALLEL=2 erreicht das 12B-Modell auf Strix Halo +31 % aggregierten Durchsatz gegenüber Plain-2-Slot – relevanter Praxis-Gewinn für lokale Multi-Slot-Inferenz.
— Lumeric Redaktion
MTP Acceptance Rate (QAT-matched vs. Non-QAT heads) · Spitzenwert
71.3%
12B QAT Q4_0 – non-QAT head
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com2w
MTP verlangsamt Gemma 4 12B QAT auf AMD RX 9060 XT im Vulkan-Backend
- FORSCHUNGreddit.com3w
Community-Fix für Ornith1.5 35B A3B: MTP-Head-Patch bringt 33% Zeitersparnis
- MEINUNGreddit.com1w
Nutzer optimiert MTP-Draft-Acceptance in llama.cpp mit Qwen3-35B
- LAUNCHreddit.com3w
MTP-Unterstützung für GLM-4.5-Air in llama.cpp verfügbar