Qwen3.8-27B mit 70+ tok/s auf 2× RTX 3090 via vLLM – optimierte Konfiguration
Warum es zählt
Die Kombination aus RedHatAI-INT4-Quant, FP8-KV-Cache und MTP-Spekulativdekodierung liefert auf Consumer-Ampere-Hardware (2× 3090 / 48 GB) Throughput, den viele auf gleicher Hardware nicht erreichen. Die vLLM-Konfiguration ist direkt kopierbar und für Agent-Workloads mit Tool-Calling ausgelegt.
— Lumeric Redaktion
vLLM Decode Throughput (Qwen3.8-27B INT4, 2× RTX 3090) · Spitzenwert
70%
Single-Stream Decode
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-27B mit 70+ tok/s auf 2× RTX 3090 via vLLM – optimierte Konfiguration
Warum es zählt
Die Kombination aus RedHatAI-INT4-Quant, FP8-KV-Cache und MTP-Spekulativdekodierung liefert auf Consumer-Ampere-Hardware (2× 3090 / 48 GB) Throughput, den viele auf gleicher Hardware nicht erreichen. Die vLLM-Konfiguration ist direkt kopierbar und für Agent-Workloads mit Tool-Calling ausgelegt.
— Lumeric Redaktion
vLLM Decode Throughput (Qwen3.8-27B INT4, 2× RTX 3090) · Spitzenwert
70%
Single-Stream Decode
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.