ISTA-DASLab veröffentlicht SOTA-GGUFs für Qwen3.8-27B mit GSQ+RCO
ISTA-DASLab (ISTA Deep Algorithms and Systems Lab) kombiniert bei dieser Veröffentlichung zwei eigene Methoden zu einem neuartigen Quantisierungs-Pipeline: GSQ (Gumbel-Softmax Quantization) lernt Gitter-Zuweisungen und Skalierungsfaktoren gemeinsam während des Post-Training-Schritts und schließt damit den Qualitätsgap zwischen skalarer und vektorieller Quantisierung bei 2–3 bpw erheblich. RCO (Riemannian Constrained Optimization) weist jedem Tensor des Modells unter einem strikten Größenbudget per Gradientenabstieg direkt auf dem Task-Loss einen eigenen Quantisierungstyp zu — ohne manuelles Tuning pro Constraint. Im Unterschied zu uniformen Quants, die jedem Tensor dieselbe Präzision geben, findet RCO gezielt jene Schichten, die besonders präzise repräsentiert werden müssen. Beim direkten Größenvergleich auf rund 8,4 GB schlägt das GSQ+RCO-Modell die Unsloth-Dynamic-Variante UD-IQ2_S um +10,0 Punkte auf AIME25, +8,6 auf GPQA-Diamond und +4,6 auf LiveCodeBench v6. Die 3,00-bpw-Variante (10,1 GB) erzielt auf AIME25 sogar 100,00 Punkte und liegt bei GPQA-Diamond (88,89) sowie LiveCodeBench v6 (84,57) jeweils nur knapp unter dem BF16-Original. Alle drei GGUFs inklusive Vision-Projektor laufen ohne Anpassungen in llama.cpp, Ollama und LM Studio. ISTA-DASLab kündigt an, diese Reihe als erstes einer Serie auf weitere Modellfamilien auszudehnen.
- GSQ-Paper: arxiv.org/abs/2604.18556; RCO-Paper: arxiv.org/abs/2605.00649 — beide mit öffentlichem Code auf GitHub unter IST-DASLab.
- Drei GGUF-Varianten: 2,50 bpw (8,4 GB), 2,75 bpw (9,3 GB), 3,00 bpw (10,1 GB) — jeweils inklusive Vision-Projektor für multimodale Nutzung.
- RCO arbeitet per Gradientenabstieg direkt auf dem Task-Loss, nicht per heuristischen Per-Constraint-Regeln — das unterscheidet es von klassischen Mixed-Precision-Schemata.
- Beim Vergleich mit Unsloth UD-IQ2_S bei ~8,4 GB: +10,0 AIME25-Punkte, +8,6 GPQA-Diamond-Punkte, +4,6 LiveCodeBench-v6-Punkte zugunsten GSQ+RCO.
- ISTA-DASLab nimmt explizit Anfragen für weitere Modell-Quantisierungen entgegen und bezeichnet diese Veröffentlichung als erste einer geplanten Laborserie.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
ISTA-DASLab veröffentlicht SOTA-GGUFs für Qwen3.8-27B mit GSQ+RCO
ISTA-DASLab (ISTA Deep Algorithms and Systems Lab) kombiniert bei dieser Veröffentlichung zwei eigene Methoden zu einem neuartigen Quantisierungs-Pipeline: GSQ (Gumbel-Softmax Quantization) lernt Gitter-Zuweisungen und Skalierungsfaktoren gemeinsam während des Post-Training-Schritts und schließt damit den Qualitätsgap zwischen skalarer und vektorieller Quantisierung bei 2–3 bpw erheblich. RCO (Riemannian Constrained Optimization) weist jedem Tensor des Modells unter einem strikten Größenbudget per Gradientenabstieg direkt auf dem Task-Loss einen eigenen Quantisierungstyp zu — ohne manuelles Tuning pro Constraint. Im Unterschied zu uniformen Quants, die jedem Tensor dieselbe Präzision geben, findet RCO gezielt jene Schichten, die besonders präzise repräsentiert werden müssen. Beim direkten Größenvergleich auf rund 8,4 GB schlägt das GSQ+RCO-Modell die Unsloth-Dynamic-Variante UD-IQ2_S um +10,0 Punkte auf AIME25, +8,6 auf GPQA-Diamond und +4,6 auf LiveCodeBench v6. Die 3,00-bpw-Variante (10,1 GB) erzielt auf AIME25 sogar 100,00 Punkte und liegt bei GPQA-Diamond (88,89) sowie LiveCodeBench v6 (84,57) jeweils nur knapp unter dem BF16-Original. Alle drei GGUFs inklusive Vision-Projektor laufen ohne Anpassungen in llama.cpp, Ollama und LM Studio. ISTA-DASLab kündigt an, diese Reihe als erstes einer Serie auf weitere Modellfamilien auszudehnen.
- GSQ-Paper: arxiv.org/abs/2604.18556; RCO-Paper: arxiv.org/abs/2605.00649 — beide mit öffentlichem Code auf GitHub unter IST-DASLab.
- Drei GGUF-Varianten: 2,50 bpw (8,4 GB), 2,75 bpw (9,3 GB), 3,00 bpw (10,1 GB) — jeweils inklusive Vision-Projektor für multimodale Nutzung.
- RCO arbeitet per Gradientenabstieg direkt auf dem Task-Loss, nicht per heuristischen Per-Constraint-Regeln — das unterscheidet es von klassischen Mixed-Precision-Schemata.
- Beim Vergleich mit Unsloth UD-IQ2_S bei ~8,4 GB: +10,0 AIME25-Punkte, +8,6 GPQA-Diamond-Punkte, +4,6 LiveCodeBench-v6-Punkte zugunsten GSQ+RCO.
- ISTA-DASLab nimmt explizit Anfragen für weitere Modell-Quantisierungen entgegen und bezeichnet diese Veröffentlichung als erste einer geplanten Laborserie.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.