EXL3-Quants: 30B-Modell mit 3 bpw auf 12 GB VRAM bei 100K Kontext
ToolsQwen
Warum es zählt
EXL3-Quants ermöglichen es, dichte 30B-Modelle auf VRAM-limitierten Consumer-GPUs (12 GB) mit langen Kontextfenstern praxistauglich zu betreiben. Für Coding-Tasks bleibt Unsloth UD_Q4_K_XL laut Erfahrungsbericht die bevorzugte Alternative.
— Lumeric Redaktion
~30 tok/s
auf 12 GB VRAM, 30B-Modell, 100K Kontext
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
EXL3-Quants: 30B-Modell mit 3 bpw auf 12 GB VRAM bei 100K Kontext
ToolsQwen
Warum es zählt
EXL3-Quants ermöglichen es, dichte 30B-Modelle auf VRAM-limitierten Consumer-GPUs (12 GB) mit langen Kontextfenstern praxistauglich zu betreiben. Für Coding-Tasks bleibt Unsloth UD_Q4_K_XL laut Erfahrungsbericht die bevorzugte Alternative.
— Lumeric Redaktion
~30 tok/s
auf 12 GB VRAM, 30B-Modell, 100K Kontext
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.