Qwen3.6 35B A3B mit 131K Kontext und Vision auf 6 GB VRAM
CompaniesDeepSeek
Warum es zählt
Durch CPU-Offloading der MoE-Expert-Layer (--n-cpu-moe 39) und des Vision-Projektors passt ein 35B-Modell in 6 GB VRAM. Die detaillierte Launch-Konfiguration ist direkt für eigene lokale Deployments auf Consumer-Hardware nutzbar.
— Lumeric Redaktion
~600 tok/s Prefill / 23 tok/s Decode
auf RTX 2060 6 GB, leerer KV-Cache
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.6 35B A3B mit 131K Kontext und Vision auf 6 GB VRAM
CompaniesDeepSeek
Warum es zählt
Durch CPU-Offloading der MoE-Expert-Layer (--n-cpu-moe 39) und des Vision-Projektors passt ein 35B-Modell in 6 GB VRAM. Die detaillierte Launch-Konfiguration ist direkt für eigene lokale Deployments auf Consumer-Hardware nutzbar.
— Lumeric Redaktion
~600 tok/s Prefill / 23 tok/s Decode
auf RTX 2060 6 GB, leerer KV-Cache
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.