Qwen 3.5 4B IQ2_XS: +16,67 % Reasoning durch Tensor-Level-Quantisierung
Der Reddit-Nutzer /u/devildip hat unter dem Projektnamen QLAB eine Methode namens CADA (Category-Based Damage Assessment/Allocation) entwickelt, die Quantisierungs-Präzision auf Tensor-Ebene gezielt umverteilt – ohne jegliches Nachtraining, LoRA oder Gewichtsupdates. Der vorliegende Post dokumentiert die erste erfolgreiche Anwendung außerhalb der Gemma-Modellreihe: Qwen 3.5 4B, quantisiert auf IQ2_XS. Der Workflow besteht daraus, zunächst eine imatrix aus einem kategorienbasierten Korpus zu erstellen, dann den Präzisionsschaden pro Tensor zu messen und anschließend das verbleibende Byte-Budget gezielt auf kritische Tensoren umzuverteilen. Von elf ausgewerteten Testsuiten verbesserten sich acht; Rückgänge gab es in den Kategorien Knowledge-QA, Structured Output und Coherence. Bislang hat QLAB positive Ergebnisse über dense, MoE, QAT- und Non-QAT-Architekturen sowie über Gemma- und nun Qwen-Modelle hinweg erzielt. Als nächste Schritte plant der Autor Versuche mit Qwen 1.5 A2 7B sowie perspektivisch mit dem deutlich größeren Qwen 3.8 27B – Letzteres zu geschätzten 140 US-Dollar pro Lauf auf gemieteter GPU-Hardware bei Digital Ocean. Das Fernziel von QLAB ist eine vollautomatische Pipeline, die ausgehend von einem Full-Precision-GGUF die Präzision gezielt auf gewünschte Fähigkeiten konzentriert.
- Benchmark-Basis: BF16-Reasoning des Qwen 3.5 4B liegt bei 78,125 – der CADA-Quant erreicht 54,688, der Stock-IQ2_XS nur 46,875.
- Dateigrößen: Stock-Quant 1.630.594.336 Bytes vs. QLAB-Quant 1.637.318.816 Bytes – Differenz exakt +6.724.480 Bytes (+0,412 %).
- 8 von 11 evaluierten Test-Suiten verbesserten sich; Rückgänge wurden in Knowledge-QA, Structured Output und Coherence beobachtet.
- Der Autor schätzt einen Lauf für Qwen 3.8 27B auf ~140 USD auf einem gemieteten Digital-Ocean-GPU-Droplet, mit möglicherweise mehreren Versuchen.
- Das Modell ist auf Hugging Face verfügbar: ByteOtter/Qwen3.5-4B-CADA-IQ2_XS.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen 3.5 4B IQ2_XS: +16,67 % Reasoning durch Tensor-Level-Quantisierung
Der Reddit-Nutzer /u/devildip hat unter dem Projektnamen QLAB eine Methode namens CADA (Category-Based Damage Assessment/Allocation) entwickelt, die Quantisierungs-Präzision auf Tensor-Ebene gezielt umverteilt – ohne jegliches Nachtraining, LoRA oder Gewichtsupdates. Der vorliegende Post dokumentiert die erste erfolgreiche Anwendung außerhalb der Gemma-Modellreihe: Qwen 3.5 4B, quantisiert auf IQ2_XS. Der Workflow besteht daraus, zunächst eine imatrix aus einem kategorienbasierten Korpus zu erstellen, dann den Präzisionsschaden pro Tensor zu messen und anschließend das verbleibende Byte-Budget gezielt auf kritische Tensoren umzuverteilen. Von elf ausgewerteten Testsuiten verbesserten sich acht; Rückgänge gab es in den Kategorien Knowledge-QA, Structured Output und Coherence. Bislang hat QLAB positive Ergebnisse über dense, MoE, QAT- und Non-QAT-Architekturen sowie über Gemma- und nun Qwen-Modelle hinweg erzielt. Als nächste Schritte plant der Autor Versuche mit Qwen 1.5 A2 7B sowie perspektivisch mit dem deutlich größeren Qwen 3.8 27B – Letzteres zu geschätzten 140 US-Dollar pro Lauf auf gemieteter GPU-Hardware bei Digital Ocean. Das Fernziel von QLAB ist eine vollautomatische Pipeline, die ausgehend von einem Full-Precision-GGUF die Präzision gezielt auf gewünschte Fähigkeiten konzentriert.
- Benchmark-Basis: BF16-Reasoning des Qwen 3.5 4B liegt bei 78,125 – der CADA-Quant erreicht 54,688, der Stock-IQ2_XS nur 46,875.
- Dateigrößen: Stock-Quant 1.630.594.336 Bytes vs. QLAB-Quant 1.637.318.816 Bytes – Differenz exakt +6.724.480 Bytes (+0,412 %).
- 8 von 11 evaluierten Test-Suiten verbesserten sich; Rückgänge wurden in Knowledge-QA, Structured Output und Coherence beobachtet.
- Der Autor schätzt einen Lauf für Qwen 3.8 27B auf ~140 USD auf einem gemieteten Digital-Ocean-GPU-Droplet, mit möglicherweise mehreren Versuchen.
- Das Modell ist auf Hugging Face verfügbar: ByteOtter/Qwen3.5-4B-CADA-IQ2_XS.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.