Ornith-1.0-35B GGUF: MTP-Speculative-Decode-Graft bringt 1,35× Token-Durchsatz
Der Reddit-Nutzer /u/Blahblahblakha hat als Follow-up zu seinem früheren Q3_K_M-Post einen nativen MTP-Draft-Head auf den IQ4_XS-Body von Ornith-1.0-35B gepfropft, wobei der Head selbst in Q6 quantisiert ist. Das Besondere am Ansatz: Der graftete Draft-Head ermöglicht Self-Speculative-Decoding vollständig auf einer einzigen GPU, ohne dass ein separates kleineres Draft-Modell vorgehalten werden muss. Die resultierende GGUF-Variante belegt ~19,6 GB und liegt damit knapp unter Q4_K_M (21,2 GB), übertrifft dieses aber in der KLD-Fidelity (0,073 vs. 0,086) bei identischer Top-1-Genauigkeit von 90,6 %. Ein bekannter Vorbehalt: Über lange deterministische Generierungen ist das Ergebnis nicht bitgenau zum reinen Zielmodell — 6 von 8 Sequenzen stimmten exakt überein, was einem Token-Match von 93,4 % entspricht. Für Serving-Szenarien mit Nebenläufigkeit zeigt Q4_K_M etwa 243 tok/s bei c=1 und skaliert auf ~656 tok/s bei c=16 mit einem p95-TTFT von ~76 ms bei c=1. Der REASONING-Modus bleibt aufgrund eines bekannten Bugs deaktiviert (REASONING=off als gepinnter Serving-Default). Alle Artefakte sind unter dem HuggingFace-Repository LordNeel/Ornith-1.0-35B-GGUF-llamacpp-tp1 verfügbar; Q4 bis Q8 sind gespiegelte und revalidierte Upstream-Artefakte, während Q3_K_M, IQ4_XS und der MTP-Graft lokal erzeugt wurden.
- KLD-Fidelitätsleiter: Q8_0 führt mit KLD 0,011 (96,9% Top-1, 36,9 GB), Q6_K erreicht 100% Top-1 bei KLD 0,017 — der IQ4_XS-MTP-Graft liegt mit 0,073 zwischen Q5_K_M und Q4_K_M.
- Durchsatz-Skalierung (Q4_K_M als Referenz): von ~243 tok/s bei Concurrency 1 auf ~656 tok/s bei Concurrency 16; p95-TTFT beträgt ~76 ms bei c=1.
- Long-Context-TTFT (Single-Stream, IQ4_XS+Graft): 94 ms bei 512 Tokens, ~6,3 s bei 32k Tokens — leicht schneller als Q4_K_M auf allen Längen.
- Next-Token-Verteilung des Grafts ist byte-identisch zum reinen Zielmodell (KLD 0,0 über 32/32 Tokens), aber über lange deterministische Generierungen nur 93,4% Token-Match (6/8 Sequenzen exakt).
- REASONING-Modus ist wegen eines bereits im Vorgänger-Post dokumentierten Bugs weiterhin deaktiviert; tp=1 (single GPU) ist die einzige getestete Tensor-Parallelismus-Konfiguration.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com3w
Ornith-1.5-35B-A3B MoE läuft mit 60 t/s auf RTX 4070 Ti
- LAUNCHreddit.com1w
Qwen3.8-Flash-Next MTP in ik_llama.cpp: 45 → 90 tok/s auf RTX 5090
- LAUNCHreddit.com3w
MTP-Unterstützung für GLM-4.5-Air in llama.cpp verfügbar
- FORSCHUNGreddit.com3w
Community-Fix für Ornith1.5 35B A3B: MTP-Head-Patch bringt 33% Zeitersparnis
Ornith-1.0-35B GGUF: MTP-Speculative-Decode-Graft bringt 1,35× Token-Durchsatz
Der Reddit-Nutzer /u/Blahblahblakha hat als Follow-up zu seinem früheren Q3_K_M-Post einen nativen MTP-Draft-Head auf den IQ4_XS-Body von Ornith-1.0-35B gepfropft, wobei der Head selbst in Q6 quantisiert ist. Das Besondere am Ansatz: Der graftete Draft-Head ermöglicht Self-Speculative-Decoding vollständig auf einer einzigen GPU, ohne dass ein separates kleineres Draft-Modell vorgehalten werden muss. Die resultierende GGUF-Variante belegt ~19,6 GB und liegt damit knapp unter Q4_K_M (21,2 GB), übertrifft dieses aber in der KLD-Fidelity (0,073 vs. 0,086) bei identischer Top-1-Genauigkeit von 90,6 %. Ein bekannter Vorbehalt: Über lange deterministische Generierungen ist das Ergebnis nicht bitgenau zum reinen Zielmodell — 6 von 8 Sequenzen stimmten exakt überein, was einem Token-Match von 93,4 % entspricht. Für Serving-Szenarien mit Nebenläufigkeit zeigt Q4_K_M etwa 243 tok/s bei c=1 und skaliert auf ~656 tok/s bei c=16 mit einem p95-TTFT von ~76 ms bei c=1. Der REASONING-Modus bleibt aufgrund eines bekannten Bugs deaktiviert (REASONING=off als gepinnter Serving-Default). Alle Artefakte sind unter dem HuggingFace-Repository LordNeel/Ornith-1.0-35B-GGUF-llamacpp-tp1 verfügbar; Q4 bis Q8 sind gespiegelte und revalidierte Upstream-Artefakte, während Q3_K_M, IQ4_XS und der MTP-Graft lokal erzeugt wurden.
- KLD-Fidelitätsleiter: Q8_0 führt mit KLD 0,011 (96,9% Top-1, 36,9 GB), Q6_K erreicht 100% Top-1 bei KLD 0,017 — der IQ4_XS-MTP-Graft liegt mit 0,073 zwischen Q5_K_M und Q4_K_M.
- Durchsatz-Skalierung (Q4_K_M als Referenz): von ~243 tok/s bei Concurrency 1 auf ~656 tok/s bei Concurrency 16; p95-TTFT beträgt ~76 ms bei c=1.
- Long-Context-TTFT (Single-Stream, IQ4_XS+Graft): 94 ms bei 512 Tokens, ~6,3 s bei 32k Tokens — leicht schneller als Q4_K_M auf allen Längen.
- Next-Token-Verteilung des Grafts ist byte-identisch zum reinen Zielmodell (KLD 0,0 über 32/32 Tokens), aber über lange deterministische Generierungen nur 93,4% Token-Match (6/8 Sequenzen exakt).
- REASONING-Modus ist wegen eines bereits im Vorgänger-Post dokumentierten Bugs weiterhin deaktiviert; tp=1 (single GPU) ist die einzige getestete Tensor-Parallelismus-Konfiguration.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com3w
Ornith-1.5-35B-A3B MoE läuft mit 60 t/s auf RTX 4070 Ti
- LAUNCHreddit.com1w
Qwen3.8-Flash-Next MTP in ik_llama.cpp: 45 → 90 tok/s auf RTX 5090
- LAUNCHreddit.com3w
MTP-Unterstützung für GLM-4.5-Air in llama.cpp verfügbar
- FORSCHUNGreddit.com3w
Community-Fix für Ornith1.5 35B A3B: MTP-Head-Patch bringt 33% Zeitersparnis