Quantisierung und MTP-Akzeptanzraten bei Gemma 4-31B im Vergleich
Das Experiment von Reddit-Nutzer /u/professormunchies untersucht eine konkrete Frage aus der lokalen Inferenzpraxis: Wie stark sinkt die Akzeptanzrate beim spekulativen Dekodieren (MTP), wenn das Hauptmodell (Trunk) aggressiver quantisiert wird? Beim spekulativen Dekodieren schlägt ein kleines Draft-Modell mehrere Token vor, die das Hauptmodell dann in einem einzigen Forward-Pass verifiziert – je besser Trunk und Drafter übereinstimmen, desto höher die Akzeptanzrate und damit der Speedup. Als Trunk diente Gemma 4-31B-it in vier Quantisierungsstufen (Q5_K_S, IQ4_XS, IQ3_M, IQ2_M), als Drafter das zugehörige Gemma 4-31B-it-assistant-MTP-Modell. Die Messung erfolgte mit 5 gemischten Coding- und Reasoning-Prompts à 200 Token, Temperatur 0,3, deaktiviertem Thinking-Modus und je 3 Wiederholungen mit unterschiedlichen Seeds. Auffällig ist, dass IQ4_XS und IQ3_M bei n=1 mit 86,7 % bzw. 86,8 % nahezu gleichauf liegen und Q5_K_S mit 88,5 % nur knapp überbieten. Selbst das 2-Bit-Modell IQ2_M hält bei n=1 noch 84,5 %. Mit steigender Draft-Tiefe (n=2 bis n=4) fällt die Akzeptanzrate über alle Quanten hinweg ab, bleibt aber auch bei IQ2_M und n=4 noch bei 61,2 %. Hardware-seitig betont der Autor, dass CUDA-Systeme mit n=2 den größten Speedup erzielen, während Apple Metal nur marginal von n=1 profitiert. Die gesamte Umgebung lässt sich mit llama-server und dem öffentlichen GGUF-Repository pearsonkyle/gemma4-31b-imatrix-mtp-GGUF reproduzieren.
- Messprotokoll: 3 Wiederholungen à 5 Prompts (gemischtes Coding/Reasoning) × 200 Token, Temperatur 0,3, Thinking-Modus deaktiviert, je unterschiedliche Seeds.
- Speicherbedarf: ~12 GB RAM/VRAM für den 31B-Trunk bei IQ2_M; ~24 GB für Q5_K_S mit Vision- und MTP-Unterstützung.
- Akzeptanzrate bei n=4: Q5_K_S 66,7 %, IQ4_XS 65,2 %, IQ3_M 65,0 %, IQ2_M 61,2 % — alle Quanten bleiben auch bei tiefstem Draft-Level über 61 %.
- Ausführung via llama-server mit Flag --spec-type draft-mtp und --spec-draft-n-max 2; Gewichte sind öffentlich auf HuggingFace verfügbar (pearsonkyle/gemma4-31b-imatrix-mtp-GGUF).
- Standardabweichung (±1σ) steigt bei IQ2_M mit zunehmender Draft-Tiefe merklich an (±2,5 % bei n=2), was auf höhere Variabilität bei stärkerer Quantisierung hindeutet.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com1w
Nutzer optimiert MTP-Draft-Acceptance in llama.cpp mit Qwen3-35B
- MEINUNGreddit.com2w
MTP verlangsamt Gemma 4 12B QAT auf AMD RX 9060 XT im Vulkan-Backend
- BENCHMARKreddit.com1w
Ling MTP n=1/2/3: Mehr Akzeptanzlänge, weniger Prose-Durchsatz auf DGX Spark
- MEINUNGreddit.com2w
Speculative Decoding mit bloßem Auge sichtbar bei 2–3 t/s
Quantisierung und MTP-Akzeptanzraten bei Gemma 4-31B im Vergleich
Das Experiment von Reddit-Nutzer /u/professormunchies untersucht eine konkrete Frage aus der lokalen Inferenzpraxis: Wie stark sinkt die Akzeptanzrate beim spekulativen Dekodieren (MTP), wenn das Hauptmodell (Trunk) aggressiver quantisiert wird? Beim spekulativen Dekodieren schlägt ein kleines Draft-Modell mehrere Token vor, die das Hauptmodell dann in einem einzigen Forward-Pass verifiziert – je besser Trunk und Drafter übereinstimmen, desto höher die Akzeptanzrate und damit der Speedup. Als Trunk diente Gemma 4-31B-it in vier Quantisierungsstufen (Q5_K_S, IQ4_XS, IQ3_M, IQ2_M), als Drafter das zugehörige Gemma 4-31B-it-assistant-MTP-Modell. Die Messung erfolgte mit 5 gemischten Coding- und Reasoning-Prompts à 200 Token, Temperatur 0,3, deaktiviertem Thinking-Modus und je 3 Wiederholungen mit unterschiedlichen Seeds. Auffällig ist, dass IQ4_XS und IQ3_M bei n=1 mit 86,7 % bzw. 86,8 % nahezu gleichauf liegen und Q5_K_S mit 88,5 % nur knapp überbieten. Selbst das 2-Bit-Modell IQ2_M hält bei n=1 noch 84,5 %. Mit steigender Draft-Tiefe (n=2 bis n=4) fällt die Akzeptanzrate über alle Quanten hinweg ab, bleibt aber auch bei IQ2_M und n=4 noch bei 61,2 %. Hardware-seitig betont der Autor, dass CUDA-Systeme mit n=2 den größten Speedup erzielen, während Apple Metal nur marginal von n=1 profitiert. Die gesamte Umgebung lässt sich mit llama-server und dem öffentlichen GGUF-Repository pearsonkyle/gemma4-31b-imatrix-mtp-GGUF reproduzieren.
- Messprotokoll: 3 Wiederholungen à 5 Prompts (gemischtes Coding/Reasoning) × 200 Token, Temperatur 0,3, Thinking-Modus deaktiviert, je unterschiedliche Seeds.
- Speicherbedarf: ~12 GB RAM/VRAM für den 31B-Trunk bei IQ2_M; ~24 GB für Q5_K_S mit Vision- und MTP-Unterstützung.
- Akzeptanzrate bei n=4: Q5_K_S 66,7 %, IQ4_XS 65,2 %, IQ3_M 65,0 %, IQ2_M 61,2 % — alle Quanten bleiben auch bei tiefstem Draft-Level über 61 %.
- Ausführung via llama-server mit Flag --spec-type draft-mtp und --spec-draft-n-max 2; Gewichte sind öffentlich auf HuggingFace verfügbar (pearsonkyle/gemma4-31b-imatrix-mtp-GGUF).
- Standardabweichung (±1σ) steigt bei IQ2_M mit zunehmender Draft-Tiefe merklich an (±2,5 % bei n=2), was auf höhere Variabilität bei stärkerer Quantisierung hindeutet.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com1w
Nutzer optimiert MTP-Draft-Acceptance in llama.cpp mit Qwen3-35B
- MEINUNGreddit.com2w
MTP verlangsamt Gemma 4 12B QAT auf AMD RX 9060 XT im Vulkan-Backend
- BENCHMARKreddit.com1w
Ling MTP n=1/2/3: Mehr Akzeptanzlänge, weniger Prose-Durchsatz auf DGX Spark
- MEINUNGreddit.com2w
Speculative Decoding mit bloßem Auge sichtbar bei 2–3 t/s