Llama.cpp ROCm 7.14 vs. Vulkan: Benchmarks auf Radeon 780m iGPU
Der Reddit-Nutzer /u/MaximusSenior hat nach dem ROCm-Upgrade in Llama.cpp von Version 7.2 auf 7.14 systematische Benchmarks auf einem Ryzen 7 260 mit integrierter Radeon 780m (gfx1103) und 64 GB DDR5-5600-RAM unter Ubuntu 26 durchgeführt. Da gfx1103 zwar ab ROCm 7.14 offiziell unterstützt wird, in den vorgefertigten Binaries aber kein Build-Target gesetzt ist, musste er Llama.cpp aus dem Quellcode kompilieren – nach eigener Aussage deutlich einfacher als ein CUDA-Build. Die Benchmarks wurden mit llama-bench bei Kontextlängen von 8192 und 16384 Token sowie Token-Generierung über 128 und 256 Token durchgeführt, mit aktiviertem Flash-Attention, Q8_0-KV-Cache und vollständigem GPU-Offloading (ngl 99). Beim dichten Modell Qwen 3.8 27B Q8 erreicht ROCm beim Prompt-Processing rund 97 t/s gegenüber 66 t/s unter Vulkan – ein Plus von knapp 47 %. Beim MoE-Modell Qwen 3.5 35B A3B Q8 fällt der ROCm-Vorteil beim Prompt-Processing mit rund 8 % deutlich geringer aus. Bei der Token-Generierung kehrt sich das Bild beim MoE-Modell sogar um: Vulkan liefert dort mit 21 t/s merklich mehr als ROCm mit 18 t/s. Ein praktisch relevanter Unterschied betrifft die Kernel-Parameter: Für Vulkan nutzte der Autor amdgpu.gttsize=49152 sowie amd_iommu=off, was mit der für ROCm empfohlenen Umgebungsvariable GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 inkompatibel zu sein scheint und zu häufigen Abstürzen führte.
- Testsystem: Ryzen 7 260, 64 GB DDR5-5600, Ubuntu 26 — vollständiges GPU-Offloading mit -ngl 99 und --load-mode none.
- Qwen 3.5 35B A3B Q8 (MoE): ROCm pp8192 = 311,44 t/s vs. Vulkan 288,31 t/s; tg128 jedoch Vulkan (21,14 t/s) > ROCm (18,35 t/s).
- Qwen 3.8 27B Q8 (dense): ROCm pp8192 = 97,48 t/s vs. Vulkan 66,45 t/s — größter gemessener Vorteil von ~47 %.
- Kernel-Parameter-Konflikt: amdgpu.gttsize=49152 stabilisiert Vulkan, muss für ROCm entfernt werden (inkompatibel mit GGML_CUDA_ENABLE_UNIFIED_MEMORY=1).
- Build aus Quellen nötig, da gfx1103 kein vorgebautes Binary-Target in Llama.cpp ist; Autor folgte offiziellen ROCm-Build-Anweisungen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Llama.cpp ROCm 7.14 vs. Vulkan: Benchmarks auf Radeon 780m iGPU
Der Reddit-Nutzer /u/MaximusSenior hat nach dem ROCm-Upgrade in Llama.cpp von Version 7.2 auf 7.14 systematische Benchmarks auf einem Ryzen 7 260 mit integrierter Radeon 780m (gfx1103) und 64 GB DDR5-5600-RAM unter Ubuntu 26 durchgeführt. Da gfx1103 zwar ab ROCm 7.14 offiziell unterstützt wird, in den vorgefertigten Binaries aber kein Build-Target gesetzt ist, musste er Llama.cpp aus dem Quellcode kompilieren – nach eigener Aussage deutlich einfacher als ein CUDA-Build. Die Benchmarks wurden mit llama-bench bei Kontextlängen von 8192 und 16384 Token sowie Token-Generierung über 128 und 256 Token durchgeführt, mit aktiviertem Flash-Attention, Q8_0-KV-Cache und vollständigem GPU-Offloading (ngl 99). Beim dichten Modell Qwen 3.8 27B Q8 erreicht ROCm beim Prompt-Processing rund 97 t/s gegenüber 66 t/s unter Vulkan – ein Plus von knapp 47 %. Beim MoE-Modell Qwen 3.5 35B A3B Q8 fällt der ROCm-Vorteil beim Prompt-Processing mit rund 8 % deutlich geringer aus. Bei der Token-Generierung kehrt sich das Bild beim MoE-Modell sogar um: Vulkan liefert dort mit 21 t/s merklich mehr als ROCm mit 18 t/s. Ein praktisch relevanter Unterschied betrifft die Kernel-Parameter: Für Vulkan nutzte der Autor amdgpu.gttsize=49152 sowie amd_iommu=off, was mit der für ROCm empfohlenen Umgebungsvariable GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 inkompatibel zu sein scheint und zu häufigen Abstürzen führte.
- Testsystem: Ryzen 7 260, 64 GB DDR5-5600, Ubuntu 26 — vollständiges GPU-Offloading mit -ngl 99 und --load-mode none.
- Qwen 3.5 35B A3B Q8 (MoE): ROCm pp8192 = 311,44 t/s vs. Vulkan 288,31 t/s; tg128 jedoch Vulkan (21,14 t/s) > ROCm (18,35 t/s).
- Qwen 3.8 27B Q8 (dense): ROCm pp8192 = 97,48 t/s vs. Vulkan 66,45 t/s — größter gemessener Vorteil von ~47 %.
- Kernel-Parameter-Konflikt: amdgpu.gttsize=49152 stabilisiert Vulkan, muss für ROCm entfernt werden (inkompatibel mit GGML_CUDA_ENABLE_UNIFIED_MEMORY=1).
- Build aus Quellen nötig, da gfx1103 kein vorgebautes Binary-Target in Llama.cpp ist; Autor folgte offiziellen ROCm-Build-Anweisungen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.