AMD RX 7900 XTX: Qwen3-27B auf ROCm vs. Vulkan – Performance-Vergleich
Der Reddit-Nutzer /u/Thin_Pollution8843 betreibt llama.cpp (Build b9630) auf Ubuntu 24.04.4 LTS mit einer AMD RX 7900 XTX (gfx1100-Architektur) und vergleicht systematisch die Backends ROCm 7.2.4 und Vulkan (API 1.4.330, Mesa 26.0.0-devel). Beim reinen Prompt-Processing (pp32768) ist Vulkan mit 634,80 tok/s fast dreimal schneller als ROCm mit 235,73 tok/s. Beim Token-Generieren (tg128) kehrt sich das Bild drastisch um: ROCm liefert 31,14 tok/s, Vulkan bricht auf 13,32 tok/s ein – weniger als die Hälfte. Im realen API-Betrieb mit 32.201 Prompt-Tokens und 128 generierten Tokens unter ROCm erzielt die normale 27B-Konfiguration durchschnittlich 26,84 Gen-tok/s bei 139,8 Sekunden Wandzeit. Die MTP-Spekulation mit n=3 Draft-Tokens erreicht trotz einer Akzeptanzrate von 78,76 % nur 17,14 Gen-tok/s und erhöht die Wandzeit auf 149,9 Sekunden – ein klarer Rückschritt. Der Nutzer versuchte zusätzlich vLLM, scheiterte jedoch an fehlender Hardware-Kompatibilität. Kontextfenster sind auf 65.565 Tokens gesetzt, Flash-Attention ist aktiviert, und das Modell läuft vollständig im VRAM (--n-gpu-layers 99, --no-mmap). Nach mehrtägigem Tuning sucht der Autor nun Community-Hilfe, unter anderem zum möglichen Einfluss eines Kernel-Updates.
- Modell-Datei: Qwen3.6-27B-MTP-UD-Q4_K_XL.gguf bzw. Qwen3.6-27B-UD-Q4_K_XL.gguf (Ultra-Dynamic Quantisierung, 4-Bit-Basis)
- llama-server-Flags: --ctx-size 65565, --ubatch-size 2048, --parallel 1, --cont-batching, --flash-attn on, --no-mmap
- MTP-Konfiguration: --spec-type draft-mtp mit --spec-draft-n-max 3; Draft-Modell läuft auf Port 18080, Hauptmodell auf Port 8000
- Kernel-Version 6.8.0-124-generic (Ubuntu 24.04.4 LTS); AMD-Treiber 6.16.13 – Nutzer erwägt Kernel-Upgrade als mögliche Abhilfe
- vLLM wurde als Alternative getestet, ist aber laut Nutzer auf dieser Hardware-Konfiguration nicht lauffähig
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
AMD RX 7900 XTX: Qwen3-27B auf ROCm vs. Vulkan – Performance-Vergleich
Der Reddit-Nutzer /u/Thin_Pollution8843 betreibt llama.cpp (Build b9630) auf Ubuntu 24.04.4 LTS mit einer AMD RX 7900 XTX (gfx1100-Architektur) und vergleicht systematisch die Backends ROCm 7.2.4 und Vulkan (API 1.4.330, Mesa 26.0.0-devel). Beim reinen Prompt-Processing (pp32768) ist Vulkan mit 634,80 tok/s fast dreimal schneller als ROCm mit 235,73 tok/s. Beim Token-Generieren (tg128) kehrt sich das Bild drastisch um: ROCm liefert 31,14 tok/s, Vulkan bricht auf 13,32 tok/s ein – weniger als die Hälfte. Im realen API-Betrieb mit 32.201 Prompt-Tokens und 128 generierten Tokens unter ROCm erzielt die normale 27B-Konfiguration durchschnittlich 26,84 Gen-tok/s bei 139,8 Sekunden Wandzeit. Die MTP-Spekulation mit n=3 Draft-Tokens erreicht trotz einer Akzeptanzrate von 78,76 % nur 17,14 Gen-tok/s und erhöht die Wandzeit auf 149,9 Sekunden – ein klarer Rückschritt. Der Nutzer versuchte zusätzlich vLLM, scheiterte jedoch an fehlender Hardware-Kompatibilität. Kontextfenster sind auf 65.565 Tokens gesetzt, Flash-Attention ist aktiviert, und das Modell läuft vollständig im VRAM (--n-gpu-layers 99, --no-mmap). Nach mehrtägigem Tuning sucht der Autor nun Community-Hilfe, unter anderem zum möglichen Einfluss eines Kernel-Updates.
- Modell-Datei: Qwen3.6-27B-MTP-UD-Q4_K_XL.gguf bzw. Qwen3.6-27B-UD-Q4_K_XL.gguf (Ultra-Dynamic Quantisierung, 4-Bit-Basis)
- llama-server-Flags: --ctx-size 65565, --ubatch-size 2048, --parallel 1, --cont-batching, --flash-attn on, --no-mmap
- MTP-Konfiguration: --spec-type draft-mtp mit --spec-draft-n-max 3; Draft-Modell läuft auf Port 18080, Hauptmodell auf Port 8000
- Kernel-Version 6.8.0-124-generic (Ubuntu 24.04.4 LTS); AMD-Treiber 6.16.13 – Nutzer erwägt Kernel-Upgrade als mögliche Abhilfe
- vLLM wurde als Alternative getestet, ist aber laut Nutzer auf dieser Hardware-Konfiguration nicht lauffähig
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.