Qwen3.8-27B mit 12 GB VRAM und 8 GB RAM auf ~18 tok/s
Warum es zählt
Durch die Hybrid-Architektur von Qwen3.8 (nur 16 von 64 Layern benötigen KV-Cache) und GSQ-RCO-Quantisierung passt ein 27B-Modell in Consumer-Hardware. Das vollständige Reproduzier-Rezept mit Skripten ist öffentlich verfügbar.
— Lumeric Redaktion
~18 tok/s
Decode-Speed bei 64k Kontext auf 12 GB VRAM
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-27B mit 12 GB VRAM und 8 GB RAM auf ~18 tok/s
Warum es zählt
Durch die Hybrid-Architektur von Qwen3.8 (nur 16 von 64 Layern benötigen KV-Cache) und GSQ-RCO-Quantisierung passt ein 27B-Modell in Consumer-Hardware. Das vollständige Reproduzier-Rezept mit Skripten ist öffentlich verfügbar.
— Lumeric Redaktion
~18 tok/s
Decode-Speed bei 64k Kontext auf 12 GB VRAM
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.