WinterMix38: 3-Bit MLX-Quant von Qwen3.5-122B schlägt Unsloth GGUF bei Long Context
WinterMix38 ist das Ergebnis von insgesamt 17 Tagen Einzelprojekt-Arbeit und stellt den bisher aufwendigsten Schritt in der Entwicklung der WinterMix-Quantisierungsmethode dar. Der Ansatz kombiniert eine sensitivitätsgesteuerte Mixed-Precision-Zuweisung mit harten Pins auf routing-kritische Tensoren – konkret werden Gate- und Up-Projektionen der MoE-Experten auf 3 Bit quantisiert, die Down-Projektionen auf 4 Bit, während das Backbone auf 8 Bit verbleibt. Neu auf der 38er-Tier-Stufe ist ein abschließender Annealing-Schritt, der die Reasoning-Chains des Modells anhand seiner eigenen laufenden Token-Stream-Statistiken nachschärft – ein Verfahren, das bei früheren WinterMix-Releases noch nicht eingesetzt wurde. Auf agentic Session-Daten erzielt WinterMix38 die beste Perplexität aller bislang veröffentlichten WinterMix-Varianten (2,7385 gegenüber 2,7627 des Flaggschiffs). Dass ein natives MLX-Format dabei ohne imatrix-Gewichtung und ohne Custom-Kernels auskommt, ist entscheidend: Das Modell lädt als Drop-in in LM Studio oder mlx-vlm, ohne geforkten Runtime oder besondere Flags. Der Autor gibt auf seinem M5 Max ~9× schnelleres Prefill gegenüber llama.cpp an sowie rund 20 % höhere Tokengenerierungsgeschwindigkeit – ein Vorteil, der sich bei langen Sessions mit vielen Turns deutlich akkumuliert. Laut Post ist WinterMix38 das erste MLX-Quant überhaupt, das sein Unsloth-Gegenstück in der Perplexität schlägt.
- Architektur-Detail: 3-Bit Gate/Up + 4-Bit Down für den Expert-Core, 8-Bit Backbone — ergibt gemessene 4,12 bpw bei 59 GiB Gesamtgröße.
- Sieben-Varianten-Kontrollprogramm: WinterMix38 holte bei 98K Kontext das beste Einzel-Ergebnis aller sieben getesteten Varianten, laut Autor 'by a wide margin'.
- Multilingual-Eval über 8 Schriftsysteme: WinterMix38 landet auf dem besten Platz seiner Größenklasse (tied-best of its tier).
- Kalibrierungsmix: GPTQ-Family-Rounding auf einem diversifizierten Long-Context-Datensatz, der auf vollständige Expert-Coverage ausgelegt ist.
- Vision Tower bleibt vollständig funktionsfähig und kohärent — kein Qualitätsverlust durch die Quantisierung des multimodalen Anteils.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
WinterMix38: 3-Bit MLX-Quant von Qwen3.5-122B schlägt Unsloth GGUF bei Long Context
WinterMix38 ist das Ergebnis von insgesamt 17 Tagen Einzelprojekt-Arbeit und stellt den bisher aufwendigsten Schritt in der Entwicklung der WinterMix-Quantisierungsmethode dar. Der Ansatz kombiniert eine sensitivitätsgesteuerte Mixed-Precision-Zuweisung mit harten Pins auf routing-kritische Tensoren – konkret werden Gate- und Up-Projektionen der MoE-Experten auf 3 Bit quantisiert, die Down-Projektionen auf 4 Bit, während das Backbone auf 8 Bit verbleibt. Neu auf der 38er-Tier-Stufe ist ein abschließender Annealing-Schritt, der die Reasoning-Chains des Modells anhand seiner eigenen laufenden Token-Stream-Statistiken nachschärft – ein Verfahren, das bei früheren WinterMix-Releases noch nicht eingesetzt wurde. Auf agentic Session-Daten erzielt WinterMix38 die beste Perplexität aller bislang veröffentlichten WinterMix-Varianten (2,7385 gegenüber 2,7627 des Flaggschiffs). Dass ein natives MLX-Format dabei ohne imatrix-Gewichtung und ohne Custom-Kernels auskommt, ist entscheidend: Das Modell lädt als Drop-in in LM Studio oder mlx-vlm, ohne geforkten Runtime oder besondere Flags. Der Autor gibt auf seinem M5 Max ~9× schnelleres Prefill gegenüber llama.cpp an sowie rund 20 % höhere Tokengenerierungsgeschwindigkeit – ein Vorteil, der sich bei langen Sessions mit vielen Turns deutlich akkumuliert. Laut Post ist WinterMix38 das erste MLX-Quant überhaupt, das sein Unsloth-Gegenstück in der Perplexität schlägt.
- Architektur-Detail: 3-Bit Gate/Up + 4-Bit Down für den Expert-Core, 8-Bit Backbone — ergibt gemessene 4,12 bpw bei 59 GiB Gesamtgröße.
- Sieben-Varianten-Kontrollprogramm: WinterMix38 holte bei 98K Kontext das beste Einzel-Ergebnis aller sieben getesteten Varianten, laut Autor 'by a wide margin'.
- Multilingual-Eval über 8 Schriftsysteme: WinterMix38 landet auf dem besten Platz seiner Größenklasse (tied-best of its tier).
- Kalibrierungsmix: GPTQ-Family-Rounding auf einem diversifizierten Long-Context-Datensatz, der auf vollständige Expert-Coverage ausgelegt ist.
- Vision Tower bleibt vollständig funktionsfähig und kohärent — kein Qualitätsverlust durch die Quantisierung des multimodalen Anteils.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.