Qwen3.6-27B-FP8 mit 262K Kontext auf 4× RTX 5060 Ti für ~1.800 USD
Der Reddit-Nutzer joorklee demonstriert, wie sich das Modell Qwen3.6-27B-FP8 mit einer Kontextlänge von 262.144 Tokens auf vier RTX-5060-Ti-Karten à 16 GB betreiben lässt – einem Consumer-GPU-Setup, das er für 425 bis 475 USD pro Karte gebraucht auf Plattformen wie Facebook Marketplace oder Slickdeals zusammengestellt hat. Entscheidend für die Machbarkeit ist die Peer-to-Peer-Verbindung (P2P) zwischen den Karten sowie Tensor-Parallelismus mit dem Faktor 4 unter vLLM. Als KV-Cache-Datenformat wird BF16 gewählt, die GPU-Speicherauslastung auf 0,92 gesetzt und die maximale Sequenzzahl auf 4 konfiguriert – obwohl der Benchmark selbst mit Concurrency 1 lief, was der Autor nachträglich als Inkonsistenz einräumt. Spekulatives Dekodieren erfolgt via der Methode „qwen3_next_mtp" mit 3 spekulativen Tokens; die Akzeptanzrate lag im Benchmark bei 65,25 %, wobei Position 0 mit 78,29 % am zuverlässigsten akzeptiert wurde. Als Attention-Backend kommt FlashInfer zum Einsatz, Prefix-Caching ist aktiviert, und die Kompilierung läuft im VLLM_COMPILE-Modus mit einem maximalen CUDAGraph-Capture-Size von 16. Der Autor betont ausdrücklich, dass das Setup ausschließlich für Single-User-Inferenz konzipiert ist und für Multi-User-Betrieb nicht geeignet wäre.
- vLLM-Flag --performance-mode interactivity priorisiert niedrige Latenz über maximalen Durchsatz – passend für Single-User-Szenarien.
- Mean TTFT (Time to First Token) beträgt 4.226,91 ms, der mittlere TPOT (Time per Output Token) liegt bei 13,85 ms.
- Spekulatives Dekodieren: 13.853 Drafts erzeugt, 27.116 Tokens akzeptiert – Acceptance Length im Schnitt 2,96 Tokens pro Draft.
- NCCL_CUMEM_ENABLE=1 und NCCL_P2P_DISABLE=0 sind zentrale Umgebungsvariablen, um P2P-Kommunikation zwischen den vier GPUs zu aktivieren.
- Tool-Calling und Reasoning-Parser (qwen3_coder / qwen3) sind in der vLLM-Konfiguration aktiv eingebunden.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.6-27B-FP8 mit 262K Kontext auf 4× RTX 5060 Ti für ~1.800 USD
Der Reddit-Nutzer joorklee demonstriert, wie sich das Modell Qwen3.6-27B-FP8 mit einer Kontextlänge von 262.144 Tokens auf vier RTX-5060-Ti-Karten à 16 GB betreiben lässt – einem Consumer-GPU-Setup, das er für 425 bis 475 USD pro Karte gebraucht auf Plattformen wie Facebook Marketplace oder Slickdeals zusammengestellt hat. Entscheidend für die Machbarkeit ist die Peer-to-Peer-Verbindung (P2P) zwischen den Karten sowie Tensor-Parallelismus mit dem Faktor 4 unter vLLM. Als KV-Cache-Datenformat wird BF16 gewählt, die GPU-Speicherauslastung auf 0,92 gesetzt und die maximale Sequenzzahl auf 4 konfiguriert – obwohl der Benchmark selbst mit Concurrency 1 lief, was der Autor nachträglich als Inkonsistenz einräumt. Spekulatives Dekodieren erfolgt via der Methode „qwen3_next_mtp" mit 3 spekulativen Tokens; die Akzeptanzrate lag im Benchmark bei 65,25 %, wobei Position 0 mit 78,29 % am zuverlässigsten akzeptiert wurde. Als Attention-Backend kommt FlashInfer zum Einsatz, Prefix-Caching ist aktiviert, und die Kompilierung läuft im VLLM_COMPILE-Modus mit einem maximalen CUDAGraph-Capture-Size von 16. Der Autor betont ausdrücklich, dass das Setup ausschließlich für Single-User-Inferenz konzipiert ist und für Multi-User-Betrieb nicht geeignet wäre.
- vLLM-Flag --performance-mode interactivity priorisiert niedrige Latenz über maximalen Durchsatz – passend für Single-User-Szenarien.
- Mean TTFT (Time to First Token) beträgt 4.226,91 ms, der mittlere TPOT (Time per Output Token) liegt bei 13,85 ms.
- Spekulatives Dekodieren: 13.853 Drafts erzeugt, 27.116 Tokens akzeptiert – Acceptance Length im Schnitt 2,96 Tokens pro Draft.
- NCCL_CUMEM_ENABLE=1 und NCCL_P2P_DISABLE=0 sind zentrale Umgebungsvariablen, um P2P-Kommunikation zwischen den vier GPUs zu aktivieren.
- Tool-Calling und Reasoning-Parser (qwen3_coder / qwen3) sind in der vLLM-Konfiguration aktiv eingebunden.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.