Qwen3.6 27B Speculative Decoding: bis 96 TPS auf einer RTX 3090
Der Benchmark wurde auf einem System mit Intel Xeon E5-2666v3, 64 GB RAM und einer einzelnen RTX 3090 (24 GB VRAM) durchgeführt. Verglichen wurden fünf Engines: drei llama.cpp-Forks (ik_llama, Spiritbuun, beellama), mainline llama.cpp und LUCEBOX – jeweils mit verschiedenen Speculative-Decoding-Strategien (MTP und DFlash). Als Modell kam Qwen3.6-27B in zwei Quantisierungen zum Einsatz: IQ4_KS (erstellt von ubergarm, exklusiv für ik_llama) und das verbreitetere Q4_K_M. Die Bench-Skripte stammen aus dem GitHub-Projekt „club-3090" von noonghunna; für Kontexttests wurden lange Prompts auf Basis englischsprachiger Wikipedia-Texte (en8wiki) konstruiert und die Generierungsgeschwindigkeit bei 72k und 128k gefülltem Kontext gemessen. Auffälligstes Ergebnis ist die hohe Kontextdegradation bei ik_llama mit ubergarm-Konfiguration (−32 % von 72k auf 128k), verglichen mit nahezu null Degradation bei mainline llama.cpp. Mainline erreicht dabei mit 288 ms die niedrigste Time-to-First-Token (TTFT) aller getesteten Setups. Spiritbuun schnitt beim 35B-A3B-MoE-Modell besser ab als hier beim 27B-Modell, weshalb der Autor diesen Fork explizit zum Vergleich aufnahm. LUCEBOX mit DFlash und TQ3-KV-Cache blieb mit 32,6 TPS (Code) deutlich hinter den anderen Setups zurück.
- ik_llama (ubergarm-Konfiguration) nutzt zusätzliche Flags: -muge, --merge-qkv, -mtprot iq4_ks, -cram 32768, --slot-save-path und --ctx-checkpoints 32 — letzteres erhöht den VRAM-Verbrauch auf 22.304 MiB.
- beellama DFlash erreicht mit 96,8 TPS den höchsten Code-Durchsatz, zeigt aber mit −41,3 % die stärkste Kontextdegradation aller Setups und einen hohen TTFT von 504 ms.
- Mainline llama.cpp ist die einzige Engine mit quasi keiner Kontextdegradation: Generierungsgeschwindigkeit bleibt zwischen 72k und 128k Kontext stabil bei ~31 TPS (−6,6 %).
- Spiritbuun DFlash erzielte beim Qwen3.6-27B nur 30,4 TPS Narrative — schlechter als alle MTP-Konfigurationen; Langkontext-Tests wurden vom Autor deshalb nicht durchgeführt.
- Die ngram+MTP-Kombination in ik_llama verwendet n_max=4 (ngram, Fenstergröße 16) kombiniert mit MTP n_max=3 und verbraucht dabei nur 20.508 MiB VRAM — weniger als die ubergarm-Konfiguration.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.6 27B Speculative Decoding: bis 96 TPS auf einer RTX 3090
Der Benchmark wurde auf einem System mit Intel Xeon E5-2666v3, 64 GB RAM und einer einzelnen RTX 3090 (24 GB VRAM) durchgeführt. Verglichen wurden fünf Engines: drei llama.cpp-Forks (ik_llama, Spiritbuun, beellama), mainline llama.cpp und LUCEBOX – jeweils mit verschiedenen Speculative-Decoding-Strategien (MTP und DFlash). Als Modell kam Qwen3.6-27B in zwei Quantisierungen zum Einsatz: IQ4_KS (erstellt von ubergarm, exklusiv für ik_llama) und das verbreitetere Q4_K_M. Die Bench-Skripte stammen aus dem GitHub-Projekt „club-3090" von noonghunna; für Kontexttests wurden lange Prompts auf Basis englischsprachiger Wikipedia-Texte (en8wiki) konstruiert und die Generierungsgeschwindigkeit bei 72k und 128k gefülltem Kontext gemessen. Auffälligstes Ergebnis ist die hohe Kontextdegradation bei ik_llama mit ubergarm-Konfiguration (−32 % von 72k auf 128k), verglichen mit nahezu null Degradation bei mainline llama.cpp. Mainline erreicht dabei mit 288 ms die niedrigste Time-to-First-Token (TTFT) aller getesteten Setups. Spiritbuun schnitt beim 35B-A3B-MoE-Modell besser ab als hier beim 27B-Modell, weshalb der Autor diesen Fork explizit zum Vergleich aufnahm. LUCEBOX mit DFlash und TQ3-KV-Cache blieb mit 32,6 TPS (Code) deutlich hinter den anderen Setups zurück.
- ik_llama (ubergarm-Konfiguration) nutzt zusätzliche Flags: -muge, --merge-qkv, -mtprot iq4_ks, -cram 32768, --slot-save-path und --ctx-checkpoints 32 — letzteres erhöht den VRAM-Verbrauch auf 22.304 MiB.
- beellama DFlash erreicht mit 96,8 TPS den höchsten Code-Durchsatz, zeigt aber mit −41,3 % die stärkste Kontextdegradation aller Setups und einen hohen TTFT von 504 ms.
- Mainline llama.cpp ist die einzige Engine mit quasi keiner Kontextdegradation: Generierungsgeschwindigkeit bleibt zwischen 72k und 128k Kontext stabil bei ~31 TPS (−6,6 %).
- Spiritbuun DFlash erzielte beim Qwen3.6-27B nur 30,4 TPS Narrative — schlechter als alle MTP-Konfigurationen; Langkontext-Tests wurden vom Autor deshalb nicht durchgeführt.
- Die ngram+MTP-Kombination in ik_llama verwendet n_max=4 (ngram, Fenstergröße 16) kombiniert mit MTP n_max=3 und verbraucht dabei nur 20.508 MiB VRAM — weniger als die ubergarm-Konfiguration.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.