Asymmetrisches V100-Paar (16+32 GB) erreicht 1.377 tok/s mit Qwen3.8 27B
CompaniesNVIDIA
Warum es zählt
Tensor-Split (statt Layer-Split) und die größere GPU als Main-GPU sind auf asymmetrischen Multi-GPU-Setups entscheidend. Das Setup zeigt, dass gebrauchte Datacenter-V100s mit llama.cpp-Tuning noch wettbewerbsfähige Inferenzgeschwindigkeiten für 27B-Modelle liefern.
— Lumeric Redaktion
llama-bench pp2048 (Qwen3.8 27B Q6_K_M) · Spitzenwert
1376.87%
Tensor Split (main GPU = 32 GB V100)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Asymmetrisches V100-Paar (16+32 GB) erreicht 1.377 tok/s mit Qwen3.8 27B
CompaniesNVIDIA
Warum es zählt
Tensor-Split (statt Layer-Split) und die größere GPU als Main-GPU sind auf asymmetrischen Multi-GPU-Setups entscheidend. Das Setup zeigt, dass gebrauchte Datacenter-V100s mit llama.cpp-Tuning noch wettbewerbsfähige Inferenzgeschwindigkeiten für 27B-Modelle liefern.
— Lumeric Redaktion
llama-bench pp2048 (Qwen3.8 27B Q6_K_M) · Spitzenwert
1376.87%
Tensor Split (main GPU = 32 GB V100)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.