GSQ-RCO GGUFs für Qwen3.8-Flash-Next: 50% Expert-Pruning auf ~1,89 bpw
CompaniesHugging Face
Warum es zählt
Der Coder-Build reduziert den aktiven Arbeitsspeicher eines 176,9B-Modells auf 29,6 GB – Single-GPU-fähig auf 32 GB. Bei LiveCodeBench v6 werden dabei 98,7% der BF16-Leistung beibehalten, was Expert-Pruning als praktikable Deployment-Strategie für große MoE-Modelle etabliert.
— Lumeric Redaktion
SWE-bench Verified · Spitzenwert
75.6%
Coder (1.89 bpw, 50% pruned)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
GSQ-RCO GGUFs für Qwen3.8-Flash-Next: 50% Expert-Pruning auf ~1,89 bpw
CompaniesHugging Face
Warum es zählt
Der Coder-Build reduziert den aktiven Arbeitsspeicher eines 176,9B-Modells auf 29,6 GB – Single-GPU-fähig auf 32 GB. Bei LiveCodeBench v6 werden dabei 98,7% der BF16-Leistung beibehalten, was Expert-Pruning als praktikable Deployment-Strategie für große MoE-Modelle etabliert.
— Lumeric Redaktion
SWE-bench Verified · Spitzenwert
75.6%
Coder (1.89 bpw, 50% pruned)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.