BeeLlama v0.3.1: llama.cpp-Fork mit DFlash erreicht 177,8 tps auf RTX 3090
BeeLlama ist ein Fork von llama.cpp, der speziell auf maximalen Inferenz-Durchsatz auf Consumer-Hardware ausgelegt ist. Der Kern der Performance-Gewinne liegt in DFlash, einer spekulativen Dekodierungsmethode, bei der ein kleineres Drafter-Modell Token-Vorschläge generiert, die das Zielmodell dann gebündelt verifiziert – was auf der RTX 3090 bei kurzen Prompts (~1K Tokens) einen Durchsatz von bis zu 177,8 tps (Median) bzw. 182,0 tps (Best) für Gemma 4 31B Q4_K_S ermöglicht. Zum Vergleich: Die Baseline ohne spekulative Dekodierung liegt bei etwa 36 tps. Die Akzeptanzrate der Draft-Tokens beträgt dabei je nach Aufgabe 44–66 % (akzeptierte zu vorgeschlagenen Tokens) bzw. 85–90 % (akzeptierte Tokens zu finalen generierten Tokens). Version 0.3.1 bringt gegenüber v0.2.0 vor allem architektonische Verbesserungen: DFlash wurde auf Multi-Slot- und Multi-GPU-Betrieb ausgeweitet, die adaptive Draft-Depth-Steuerung wurde überarbeitet (Seeding, Probing, Backoff, Request-Reset) und die spekulative Verifikation ist nun fehlertoleranter. Neu hinzugekommen sind außerdem q6_0 als KV-Cache-Quantisierung sowie die Modellformate TQ3_1S und TQ4_1S (TurboQuant). Die Community-Gruppe club-3090 hat BeeLlama v0.3.0 eigenständig auf einem Multi-GPU-Setup getestet und empfiehlt es seither als Standard. Bei langen Kontexten (Multi-Turn Coding, ~28K Tokens) fällt der DFlash-Speedup auf ~1,94× zurück, da die Akzeptanzrate auf rund 25 % sinkt – Prompt-Processing-Geschwindigkeit ist mit DFlash gegenüber der Baseline marginal niedriger.
- Test-System: Windows 11, AMD Ryzen 7 5700X3D, 32 GB DDR4 RAM, RTX 3090 24 GB – Baseline-Referenz: llama.cpp b9275 CUDA 13.1 Windows Prebuilt.
- Qwen 3.6 27B Zielmodell: Q5_K_S; DFlash-Drafter: Q4_K_M – bestes Ergebnis 181,9 tps (Task store, ~1K Tokens, 4,40× Speedup).
- Bei Multi-Turn Coding (~28K Tokens) sinkt die DFlash-Akzeptanzrate auf 24,9 % / 72,9 %, wodurch der Speedup auf 1,94× fällt.
- Prebuilt-Binaries und Docker-Images werden für alle großen Plattformen bereitgestellt; Backends umfassen CUDA, Metal und Vulkan.
- MTP (Multi-Token Prediction) ist laut Post seit v0.2.0 um 5–10 % schneller geworden und erreichte für Qwen 3.6 27B Werte um 69 tps (1,86–1,94× Speedup).
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
BeeLlama v0.3.1: llama.cpp-Fork mit DFlash erreicht 177,8 tps auf RTX 3090
BeeLlama ist ein Fork von llama.cpp, der speziell auf maximalen Inferenz-Durchsatz auf Consumer-Hardware ausgelegt ist. Der Kern der Performance-Gewinne liegt in DFlash, einer spekulativen Dekodierungsmethode, bei der ein kleineres Drafter-Modell Token-Vorschläge generiert, die das Zielmodell dann gebündelt verifiziert – was auf der RTX 3090 bei kurzen Prompts (~1K Tokens) einen Durchsatz von bis zu 177,8 tps (Median) bzw. 182,0 tps (Best) für Gemma 4 31B Q4_K_S ermöglicht. Zum Vergleich: Die Baseline ohne spekulative Dekodierung liegt bei etwa 36 tps. Die Akzeptanzrate der Draft-Tokens beträgt dabei je nach Aufgabe 44–66 % (akzeptierte zu vorgeschlagenen Tokens) bzw. 85–90 % (akzeptierte Tokens zu finalen generierten Tokens). Version 0.3.1 bringt gegenüber v0.2.0 vor allem architektonische Verbesserungen: DFlash wurde auf Multi-Slot- und Multi-GPU-Betrieb ausgeweitet, die adaptive Draft-Depth-Steuerung wurde überarbeitet (Seeding, Probing, Backoff, Request-Reset) und die spekulative Verifikation ist nun fehlertoleranter. Neu hinzugekommen sind außerdem q6_0 als KV-Cache-Quantisierung sowie die Modellformate TQ3_1S und TQ4_1S (TurboQuant). Die Community-Gruppe club-3090 hat BeeLlama v0.3.0 eigenständig auf einem Multi-GPU-Setup getestet und empfiehlt es seither als Standard. Bei langen Kontexten (Multi-Turn Coding, ~28K Tokens) fällt der DFlash-Speedup auf ~1,94× zurück, da die Akzeptanzrate auf rund 25 % sinkt – Prompt-Processing-Geschwindigkeit ist mit DFlash gegenüber der Baseline marginal niedriger.
- Test-System: Windows 11, AMD Ryzen 7 5700X3D, 32 GB DDR4 RAM, RTX 3090 24 GB – Baseline-Referenz: llama.cpp b9275 CUDA 13.1 Windows Prebuilt.
- Qwen 3.6 27B Zielmodell: Q5_K_S; DFlash-Drafter: Q4_K_M – bestes Ergebnis 181,9 tps (Task store, ~1K Tokens, 4,40× Speedup).
- Bei Multi-Turn Coding (~28K Tokens) sinkt die DFlash-Akzeptanzrate auf 24,9 % / 72,9 %, wodurch der Speedup auf 1,94× fällt.
- Prebuilt-Binaries und Docker-Images werden für alle großen Plattformen bereitgestellt; Backends umfassen CUDA, Metal und Vulkan.
- MTP (Multi-Token Prediction) ist laut Post seit v0.2.0 um 5–10 % schneller geworden und erreichte für Qwen 3.6 27B Werte um 69 tps (1,86–1,94× Speedup).
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.