Dual-3090-Setup: llama.cpp Split-Mode-Wechsel vervierfacht Prompt-Throughput auf Qwen 3.5 27B
CompaniesNVIDIA
Warum es zählt
Wer llama.cpp mit mehreren GPUs ohne NVLink betreibt, sollte --split-mode layer statt tensor nutzen, um das volle Prompt-Processing auf der GPU zu nutzen – der Trade-off ist ein messbarer Rückgang beim Token-Generation-Durchsatz (ca. 60–70 → 40–55 tps).
— Lumeric Redaktion
llama.cpp pp t/s (Qwen 3.5 27B Q8_0, Dual RTX 3090) · Spitzenwert
430%
split-mode tensor (CPU sampling)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Dual-3090-Setup: llama.cpp Split-Mode-Wechsel vervierfacht Prompt-Throughput auf Qwen 3.5 27B
CompaniesNVIDIA
Warum es zählt
Wer llama.cpp mit mehreren GPUs ohne NVLink betreibt, sollte --split-mode layer statt tensor nutzen, um das volle Prompt-Processing auf der GPU zu nutzen – der Trade-off ist ein messbarer Rückgang beim Token-Generation-Durchsatz (ca. 60–70 → 40–55 tps).
— Lumeric Redaktion
llama.cpp pp t/s (Qwen 3.5 27B Q8_0, Dual RTX 3090) · Spitzenwert
430%
split-mode tensor (CPU sampling)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.