DFlash in llama.cpp: 4,44× schnellere Inferenz bei 36K Kontext auf RTX 6000 PRO
DFlash ist ein spekulativer Dekodierungsansatz, der statt einzelner Token-Drafts einen ganzen Block von bis zu 15 Token in einem einzigen Forward-Pass durch einen sogenannten Block-Diffusion-Drafter füllt – entwickelt vom z-lab. Im Gegensatz zu MTP (Multi-Token Prediction), das pro gedraftetem Token einen eigenen Forward-Pass benötigt, amortisiert DFlash die Drafter-Kosten über den gesamten Block, was besonders bei langen Kontexten zum Tragen kommt. Der Tester verwendete als Zielmodell Qwen 3.6 27B (UD-Q4_K_XL) und als Drafter das Modell „Alittlehammmer/Qwen3.6-27B-DFlash-GGUF-llama.cpp" in Q8_0 (~1,9 GB). Bemerkenswert ist das Skalierungsverhalten: Während klassische Inferenz mit wachsendem Kontext deutlich langsamer wird, hält DFlash die Geschwindigkeit weitgehend stabil – bei 98K Kontext wurden noch 241 tok/s gemessen. Ein kontraintuitiver Befund aus den Leaderboard-Tests: Eine Akzeptanzrate von nur 43 % bei n_max=12 schlug eine 91%-Akzeptanzrate bei n_max=2, weil der entscheidende Faktor die akzeptierten Token pro Verifikations-Pass sind, nicht die prozentuale Akzeptanz. Die Docker-Compose-Integration erlaubt einen Ein-Klick-Start als llama.cpp-Server, was die Reproduzierbarkeit für lokale Setups erleichtert.
- Drafter-Modell: Alittlehammmer/Qwen3.6-27B-DFlash-GGUF-llama.cpp in Q8_0, Größe ~1,9 GB, VRAM-Overhead insgesamt ~5 GB gegenüber Baseline.
- Benchmark-Methodik: NVIDIA aiperf synthetische Sweeps, ISL = OSL, Greedy Decoding (temp 0, top-k 1), Concurrency 1, Seed 42; bis zu 30 Anfragen bei 512-Token-Kontext, nur 3 bei 36K.
- Leaderboard-Bestconfig n_max=12 erzielte 256 tok/s (3,64×), während die beste MTP-Konfiguration auf demselben Setup bei 190 tok/s (2,70×) blieb.
- Tau (durchschnittlich akzeptierte Token pro Zyklus): DFlash ~7,3 vs. MTP ~6,7 – bei deutlich geringerem Drafter-Aufwand pro Zyklus.
- Hardware: AMD Ryzen 9 9950X, NVIDIA RTX PRO 6000 Blackwell, 96 GB VRAM, CUDA 13, Ubuntu; llama.cpp PR #22105 ist der Merge-Commit.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
DFlash in llama.cpp: 4,44× schnellere Inferenz bei 36K Kontext auf RTX 6000 PRO
DFlash ist ein spekulativer Dekodierungsansatz, der statt einzelner Token-Drafts einen ganzen Block von bis zu 15 Token in einem einzigen Forward-Pass durch einen sogenannten Block-Diffusion-Drafter füllt – entwickelt vom z-lab. Im Gegensatz zu MTP (Multi-Token Prediction), das pro gedraftetem Token einen eigenen Forward-Pass benötigt, amortisiert DFlash die Drafter-Kosten über den gesamten Block, was besonders bei langen Kontexten zum Tragen kommt. Der Tester verwendete als Zielmodell Qwen 3.6 27B (UD-Q4_K_XL) und als Drafter das Modell „Alittlehammmer/Qwen3.6-27B-DFlash-GGUF-llama.cpp" in Q8_0 (~1,9 GB). Bemerkenswert ist das Skalierungsverhalten: Während klassische Inferenz mit wachsendem Kontext deutlich langsamer wird, hält DFlash die Geschwindigkeit weitgehend stabil – bei 98K Kontext wurden noch 241 tok/s gemessen. Ein kontraintuitiver Befund aus den Leaderboard-Tests: Eine Akzeptanzrate von nur 43 % bei n_max=12 schlug eine 91%-Akzeptanzrate bei n_max=2, weil der entscheidende Faktor die akzeptierten Token pro Verifikations-Pass sind, nicht die prozentuale Akzeptanz. Die Docker-Compose-Integration erlaubt einen Ein-Klick-Start als llama.cpp-Server, was die Reproduzierbarkeit für lokale Setups erleichtert.
- Drafter-Modell: Alittlehammmer/Qwen3.6-27B-DFlash-GGUF-llama.cpp in Q8_0, Größe ~1,9 GB, VRAM-Overhead insgesamt ~5 GB gegenüber Baseline.
- Benchmark-Methodik: NVIDIA aiperf synthetische Sweeps, ISL = OSL, Greedy Decoding (temp 0, top-k 1), Concurrency 1, Seed 42; bis zu 30 Anfragen bei 512-Token-Kontext, nur 3 bei 36K.
- Leaderboard-Bestconfig n_max=12 erzielte 256 tok/s (3,64×), während die beste MTP-Konfiguration auf demselben Setup bei 190 tok/s (2,70×) blieb.
- Tau (durchschnittlich akzeptierte Token pro Zyklus): DFlash ~7,3 vs. MTP ~6,7 – bei deutlich geringerem Drafter-Aufwand pro Zyklus.
- Hardware: AMD Ryzen 9 9950X, NVIDIA RTX PRO 6000 Blackwell, 96 GB VRAM, CUDA 13, Ubuntu; llama.cpp PR #22105 ist der Merge-Commit.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.