llama.cpp-Optimierung: +70% Generation und +40% Prefill auf 40-GB-VRAM-Setup
Der Autor betreibt ein ungewöhnliches Hybrid-Setup: Ein Lenovo ThinkPad P1 Gen 6 mit einer RTX-4090-Laptop-GPU (16 GB VRAM, ~95 W TDP, ~536 GB/s Bandbreite) ist via Thunderbolt 4 mit einem AG02-eGPU-Dock verbunden, das eine AMD RX 7900 XTX (60 % Layer-Split) trägt – zusammen 40 GB VRAM. Auf dieser Hardware läuft Qwen3.8-27B-UD-Q6_K_XL.gguf mit vollem 262k-Kontext. Der finale Befehl kombiniert Flash-Attention, KV-Cache-Quantisierung auf q8_0, MTP-Spekulation mit Draft-Tiefe 3 sowie ngram-map-k4v als zweite Spekulationsstufe. Beim direkten Kartenvergleich zeigt sich: Die RTX 4090 schlägt die XTX beim Prefill um 34 % (22k Cold Prompt) und sogar um 82 % beim 7B-Depth-0-Prefill; die XTX hingegen dominiert bei reiner Generierung – ohne Spekulation um 27 %, mit MTP sogar um 72 %, und bei tiefer Kontextposition (98k Depth) sogar 2,5-fach. Der TB4-Engpass (40 GB/s, ~0,025 ms Latenz) erwies sich als weniger limitierend als erwartet: Im Layer-Split-Modus sind theoretisch ~1000 Prefill-Token/s erreichbar, wenn MTP deaktiviert ist. Der entdeckte MTP-Bug (Issue #27428 im ggml-org/llama.cpp-Repository) verursacht bei Multi-GPU-Betrieb einen Prefill-Einbruch von ca. 900 auf 500 t/s, tritt aber auf keiner der beiden Karten im Einzelbetrieb auf. Früher testete der Autor auch RPC-Betrieb über TB4-Netzwerk zwischen zwei Laptops (3080 + 4090) und erzielte dabei bereits brauchbare Ergebnisse mit Qwen 27B Q5 bei vollem Kontext.
- RTX 4090 Laptop läuft mit ~95 W TDP-Cap und erzielt ~536 GB/s VRAM-Bandbreite — deutlich unter Desktop-Niveau.
- Layer-Split 40/60 (CUDA0:Vulkan2) erwies sich als optimal; Umverteilung zugunsten der XTX brachte nur ≤3 % Mehrleistung, aber Kontextverlust.
- MTP-Bug (llama.cpp Issue #27428): Prefill-Einbruch ~900→500 t/s nur bei Multi-GPU, nicht auf Einzelkarte — gilt für Vulkan und NVIDIA gleichermaßen.
- RPC-Experiment: Zwei TB4-Laptops (3080 + 4090) als verteiltes System liefen Qwen 27B Q5 @ 262k Kontext mit brauchbaren t/s über TB4-Ethernet.
- ngram-map-k4v als zweite Spekulationsstufe kombiniert mit draft-mtp; Draft-Device explizit auf CUDA0 fixiert, Draft-Max-Tiefe auf 3 gesetzt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
llama.cpp-Optimierung: +70% Generation und +40% Prefill auf 40-GB-VRAM-Setup
Der Autor betreibt ein ungewöhnliches Hybrid-Setup: Ein Lenovo ThinkPad P1 Gen 6 mit einer RTX-4090-Laptop-GPU (16 GB VRAM, ~95 W TDP, ~536 GB/s Bandbreite) ist via Thunderbolt 4 mit einem AG02-eGPU-Dock verbunden, das eine AMD RX 7900 XTX (60 % Layer-Split) trägt – zusammen 40 GB VRAM. Auf dieser Hardware läuft Qwen3.8-27B-UD-Q6_K_XL.gguf mit vollem 262k-Kontext. Der finale Befehl kombiniert Flash-Attention, KV-Cache-Quantisierung auf q8_0, MTP-Spekulation mit Draft-Tiefe 3 sowie ngram-map-k4v als zweite Spekulationsstufe. Beim direkten Kartenvergleich zeigt sich: Die RTX 4090 schlägt die XTX beim Prefill um 34 % (22k Cold Prompt) und sogar um 82 % beim 7B-Depth-0-Prefill; die XTX hingegen dominiert bei reiner Generierung – ohne Spekulation um 27 %, mit MTP sogar um 72 %, und bei tiefer Kontextposition (98k Depth) sogar 2,5-fach. Der TB4-Engpass (40 GB/s, ~0,025 ms Latenz) erwies sich als weniger limitierend als erwartet: Im Layer-Split-Modus sind theoretisch ~1000 Prefill-Token/s erreichbar, wenn MTP deaktiviert ist. Der entdeckte MTP-Bug (Issue #27428 im ggml-org/llama.cpp-Repository) verursacht bei Multi-GPU-Betrieb einen Prefill-Einbruch von ca. 900 auf 500 t/s, tritt aber auf keiner der beiden Karten im Einzelbetrieb auf. Früher testete der Autor auch RPC-Betrieb über TB4-Netzwerk zwischen zwei Laptops (3080 + 4090) und erzielte dabei bereits brauchbare Ergebnisse mit Qwen 27B Q5 bei vollem Kontext.
- RTX 4090 Laptop läuft mit ~95 W TDP-Cap und erzielt ~536 GB/s VRAM-Bandbreite — deutlich unter Desktop-Niveau.
- Layer-Split 40/60 (CUDA0:Vulkan2) erwies sich als optimal; Umverteilung zugunsten der XTX brachte nur ≤3 % Mehrleistung, aber Kontextverlust.
- MTP-Bug (llama.cpp Issue #27428): Prefill-Einbruch ~900→500 t/s nur bei Multi-GPU, nicht auf Einzelkarte — gilt für Vulkan und NVIDIA gleichermaßen.
- RPC-Experiment: Zwei TB4-Laptops (3080 + 4090) als verteiltes System liefen Qwen 27B Q5 @ 262k Kontext mit brauchbaren t/s über TB4-Ethernet.
- ngram-map-k4v als zweite Spekulationsstufe kombiniert mit draft-mtp; Draft-Device explizit auf CUDA0 fixiert, Draft-Max-Tiefe auf 3 gesetzt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.