ROCm 10 + llama.cpp: Qwen3.8 27B Q8 mit MTP auf 2× RX 9700
Der Reddit-Nutzer setzt das Modell Qwen3.8-27B in der Q8_K_XL-Quantisierung auf zwei AMD RX 9700 GPUs auf, wobei jede Karte laut amd-smi 27 GB VRAM belegt – das Modell wird also vollständig im GPU-Speicher gehalten. Als Software-Stack kommt das offizielle ROCm-10-Docker-Image (`rocm/dev-ubuntu-24.04:10.0.0-full`) zum Einsatz, in das lediglich Git und CMake nachinstalliert wurden, bevor llama.cpp nach der Standard-HIP-Buildanleitung kompiliert wurde. Ein einziger zusätzlicher Schritt war nötig: das Setzen der Umgebungsvariable `LD_LIBRARY_PATH=/opt/rocm/core-10.0/lib/`, damit llama.cpp die ROCm-Bibliotheken findet. Das Modell läuft im Tensor-Split-Modus (`-sm tensor`) über beide Karten mit einem Kontextfenster von 255.000 Tokens und Flash-Attention aktiviert. Multi-Token-Prediction (MTP) wird über `--spec-type draft-mtp --spec-draft-n-max 3` aktiviert und schlägt besonders bei Code-Output durch, wo MTP repetitive, strukturell vorhersehbare Token-Sequenzen besonders effizient vorausbeschleunigt. Der ältere Mainboard-Chipsatz X370 des Nutzers gilt dabei als möglicher Flaschenhals, sodass auf neuerer Hardware noch höhere Durchsatzwerte zu erwarten sind.
- Kontextfenster: 255.000 Tokens (-c 255000), KV-Cache mit f16 für Keys und Values, 4 Checkpoint-Slots mit je 1.024 Schritten Mindestabstand.
- Sampling-Parameter: Temperatur 0,8 / Top-P 0,95 / Top-K 20 / Min-P 0 / kein Repeat-Penalty – Standard für Qwen3-Thinking-Modelle mit `preserve_thinking: true`.
- Batch-Größen: -b 1024 / -ub 1024; llama-server läuft mit 7 CPU-Threads (-t 7), MMAP ist deaktiviert (--no-mmap).
- Modell-Download direkt über llama.cpp HuggingFace-Flag: `-hf unsloth/Qwen3.8-27B-GGUF:Q8_K_XL`, kein manuelles Herunterladen nötig.
- Tatsächliche tg-Spitzen aus dem Server-Log: 62,17 t/s (n_gen=981) und 61,24 t/s (n_gen=2324) – beides während Code-Blöcken mit hoher MTP-Trefferrate.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
ROCm 10 + llama.cpp: Qwen3.8 27B Q8 mit MTP auf 2× RX 9700
Der Reddit-Nutzer setzt das Modell Qwen3.8-27B in der Q8_K_XL-Quantisierung auf zwei AMD RX 9700 GPUs auf, wobei jede Karte laut amd-smi 27 GB VRAM belegt – das Modell wird also vollständig im GPU-Speicher gehalten. Als Software-Stack kommt das offizielle ROCm-10-Docker-Image (`rocm/dev-ubuntu-24.04:10.0.0-full`) zum Einsatz, in das lediglich Git und CMake nachinstalliert wurden, bevor llama.cpp nach der Standard-HIP-Buildanleitung kompiliert wurde. Ein einziger zusätzlicher Schritt war nötig: das Setzen der Umgebungsvariable `LD_LIBRARY_PATH=/opt/rocm/core-10.0/lib/`, damit llama.cpp die ROCm-Bibliotheken findet. Das Modell läuft im Tensor-Split-Modus (`-sm tensor`) über beide Karten mit einem Kontextfenster von 255.000 Tokens und Flash-Attention aktiviert. Multi-Token-Prediction (MTP) wird über `--spec-type draft-mtp --spec-draft-n-max 3` aktiviert und schlägt besonders bei Code-Output durch, wo MTP repetitive, strukturell vorhersehbare Token-Sequenzen besonders effizient vorausbeschleunigt. Der ältere Mainboard-Chipsatz X370 des Nutzers gilt dabei als möglicher Flaschenhals, sodass auf neuerer Hardware noch höhere Durchsatzwerte zu erwarten sind.
- Kontextfenster: 255.000 Tokens (-c 255000), KV-Cache mit f16 für Keys und Values, 4 Checkpoint-Slots mit je 1.024 Schritten Mindestabstand.
- Sampling-Parameter: Temperatur 0,8 / Top-P 0,95 / Top-K 20 / Min-P 0 / kein Repeat-Penalty – Standard für Qwen3-Thinking-Modelle mit `preserve_thinking: true`.
- Batch-Größen: -b 1024 / -ub 1024; llama-server läuft mit 7 CPU-Threads (-t 7), MMAP ist deaktiviert (--no-mmap).
- Modell-Download direkt über llama.cpp HuggingFace-Flag: `-hf unsloth/Qwen3.8-27B-GGUF:Q8_K_XL`, kein manuelles Herunterladen nötig.
- Tatsächliche tg-Spitzen aus dem Server-Log: 62,17 t/s (n_gen=981) und 61,24 t/s (n_gen=2324) – beides während Code-Blöcken mit hoher MTP-Trefferrate.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.