llama.cpp-Fork für AMD gfx906: +14% Prompt-Throughput, +9% Long-Context-Fill
Der Fork stammt von Reddit-Nutzer /u/milpster und entstand als direkte Reaktion auf Kritik an einem früheren Post, dem konkrete Benchmarkzahlen fehlten. Der Auslöser für die Überarbeitung war der Umstieg des Produktions-Setups des Autors auf DFlash2 mit dem Modell Qwen 3.8 27B: Dabei stellte sich heraus, dass mehrere der bisherigen gfx906-Optimierungen unter DFlash2 neutral oder sogar regressiv wirkten. Das Team isolierte die Problemstellen, überarbeitete den Small-Q-Flash-Attention-Pfad grundlegend und ergänzte eine adaptive Selektion zwischen nativem und Convert-Modus. Die Benchmark-Ergebnisse wurden direkt gegen den aktuellen llama.cpp-Mainline-Upstream gemessen: 379,2 vs. 332,3 Token/s beim First-Batch Prompt Processing und 252,6 vs. 231,1 Token/s beim 120k-Context-Fill. Token Generation in tiefen Kontexten liegt mit 13,6 vs. 13,5 t/s gleichauf – der Fork verzichtet also bewusst auf Optimierungen, die dort keine Wirkung zeigen. Bemerkenswert ist, dass DFlash-Akzeptanzrate (0,691) und deterministischer Output (byte-for-byte identisch) gegenüber Upstream unverändert sind, was Reproduzierbarkeit und Modell-Korrektheit sicherstellt. Der Code ist öffentlich auf GitHub unter milpster/gfx906-llama-cpp verfügbar; eine ausführlichere Diskussion läuft im Level1Techs-Forum.
- Benchmark-Hardware: AMD gfx906-GPUs (Radeon VII, MI50, MI60) — ältere GCN-Architektur, kein offizieller Mainline-Support für neuere HIP-Pfade.
- Produktions-Modell im Test: Qwen 3.8 27B — der Fork wurde explizit unter realen Produktionsbedingungen mit diesem Modell validiert.
- DFlash2-Kompatibilität: Akzeptanzrate von 0,691 bleibt identisch zu Upstream; Output ist byte-for-byte deterministisch reproduzierbar.
- Kernänderungen: Überarbeiteter Small-Q-Flash-Attention-Pfad + adaptive native/convert-Selektion ersetzen die zuvor regressiven gfx906-Einzeloptimierungen.
- Projekt ist kollaborativ: Mitautor GLM wird im Level1Techs-Forumstitel genannt; öffentliches GitHub-Repo unter milpster/gfx906-llama-cpp.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
llama.cpp-Fork für AMD gfx906: +14% Prompt-Throughput, +9% Long-Context-Fill
Der Fork stammt von Reddit-Nutzer /u/milpster und entstand als direkte Reaktion auf Kritik an einem früheren Post, dem konkrete Benchmarkzahlen fehlten. Der Auslöser für die Überarbeitung war der Umstieg des Produktions-Setups des Autors auf DFlash2 mit dem Modell Qwen 3.8 27B: Dabei stellte sich heraus, dass mehrere der bisherigen gfx906-Optimierungen unter DFlash2 neutral oder sogar regressiv wirkten. Das Team isolierte die Problemstellen, überarbeitete den Small-Q-Flash-Attention-Pfad grundlegend und ergänzte eine adaptive Selektion zwischen nativem und Convert-Modus. Die Benchmark-Ergebnisse wurden direkt gegen den aktuellen llama.cpp-Mainline-Upstream gemessen: 379,2 vs. 332,3 Token/s beim First-Batch Prompt Processing und 252,6 vs. 231,1 Token/s beim 120k-Context-Fill. Token Generation in tiefen Kontexten liegt mit 13,6 vs. 13,5 t/s gleichauf – der Fork verzichtet also bewusst auf Optimierungen, die dort keine Wirkung zeigen. Bemerkenswert ist, dass DFlash-Akzeptanzrate (0,691) und deterministischer Output (byte-for-byte identisch) gegenüber Upstream unverändert sind, was Reproduzierbarkeit und Modell-Korrektheit sicherstellt. Der Code ist öffentlich auf GitHub unter milpster/gfx906-llama-cpp verfügbar; eine ausführlichere Diskussion läuft im Level1Techs-Forum.
- Benchmark-Hardware: AMD gfx906-GPUs (Radeon VII, MI50, MI60) — ältere GCN-Architektur, kein offizieller Mainline-Support für neuere HIP-Pfade.
- Produktions-Modell im Test: Qwen 3.8 27B — der Fork wurde explizit unter realen Produktionsbedingungen mit diesem Modell validiert.
- DFlash2-Kompatibilität: Akzeptanzrate von 0,691 bleibt identisch zu Upstream; Output ist byte-for-byte deterministisch reproduzierbar.
- Kernänderungen: Überarbeiteter Small-Q-Flash-Attention-Pfad + adaptive native/convert-Selektion ersetzen die zuvor regressiven gfx906-Einzeloptimierungen.
- Projekt ist kollaborativ: Mitautor GLM wird im Level1Techs-Forumstitel genannt; öffentliches GitHub-Repo unter milpster/gfx906-llama-cpp.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.