2× AMD Radeon RX 9700 via NVMe-Adapter in Strix-Halo-Mini-PC für LLM-Inferenz
CompaniesAMD
Warum es zählt
Tensor-Parallelism mit Consumer-GPUs über NVMe/USB4 ist möglich, erfordert aber ROCm mit RCCL-Flag (-DGGML_HIP_RCCL=ON). Prompt-Processing skaliert dabei nicht, Decoding-Throughput steigt um ~32 %.
— Lumeric Redaktion
llama-bench (Qwen3.8-27B-UD-Q4_K_XL, tg128) · Spitzenwert
37%
2× RX 9700 Tensor Parallelism
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
2× AMD Radeon RX 9700 via NVMe-Adapter in Strix-Halo-Mini-PC für LLM-Inferenz
CompaniesAMD
Warum es zählt
Tensor-Parallelism mit Consumer-GPUs über NVMe/USB4 ist möglich, erfordert aber ROCm mit RCCL-Flag (-DGGML_HIP_RCCL=ON). Prompt-Processing skaliert dabei nicht, Decoding-Throughput steigt um ~32 %.
— Lumeric Redaktion
llama-bench (Qwen3.8-27B-UD-Q4_K_XL, tg128) · Spitzenwert
37%
2× RX 9700 Tensor Parallelism
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.