Qwen 3.5 122B Heretic als ROCm-FP4-iMatrix-Quant für Strix Halo
Der Reddit-Nutzer /u/RedParaglider hat einen Community-Quantisierungs-Release von Qwen 3.5 122B veröffentlicht, der speziell für AMD-Hardware mit ROCm-Stack optimiert ist. Das Quant verwendet FP4-Präzision kombiniert mit iMatrix-Kalibrierung – eine Methode, bei der eine Wichtungsmatrix aus repräsentativen Eingabedaten berechnet wird, um den Qualitätsverlust durch die niedrige Bit-Tiefe zu minimieren. Zielplattform ist AMD Strix Halo, also APUs der Ryzen-AI-Max-Serie mit ihrem großen unified VRAM-Pool, der das Laden des 60,70 GiB großen Modells in den Speicher überhaupt erst ermöglicht. Qwen 3.5 122B ist ein Mixture-of-Experts-Modell mit 122 Milliarden Gesamtparametern, von denen pro Token lediglich rund 10 Milliarden aktiv sind, was den Rechen- und Speicherbedarf trotz enormer Modellgröße handhabbar hält. Der veröffentlichte KLD-Wert (Kullback-Leibler-Divergenz) von 0,1007 dient als Qualitätsmaß gegenüber dem BF16-Referenzmodell und gilt in der Community als akzeptabler Kompromiss für ein FP4-Quant dieser Größe. Der Ersteller weist darauf hin, dass es sein erster Release dieser Art ist und er das Quant primär für den eigenen Bedarf gebaut hat; eine Variante ohne „Heretic"-Anpassungen soll bei verfügbarer Rechenkapazität folgen. Für NVIDIA-unabhängige Nutzer, die ROCm-basierte Hardware betreiben, schließt dieser Release eine praktische Lücke, da vergleichbare Quants bislang überwiegend für CUDA-Plattformen optimiert erschienen.
- FP4-iMatrix-Quant: Dateigröße 60,70 GiB, ausgelegt für den großen unified VRAM-Pool von AMD-Strix-Halo-APUs (z. B. Ryzen AI Max).
- Decode-Geschwindigkeit: 28,45 tok/s; Prefill-Geschwindigkeit: 353,3 t/s – gemessen auf Strix-Halo-Hardware unter ROCm.
- Qualitätsmessung per Kullback-Leibler-Divergenz (KLD): 0,100716 gegenüber dem BF16-Referenzmodell.
- Ersteller /u/RedParaglider bezeichnet es als seinen ersten Quant-Release; eine Version ohne Heretic-Modifikationen ist in Planung, abhängig von verfügbarer Rechenzeit.
- Qwen 3.5 122B ist ein MoE-Modell: 122B Gesamtparameter, ~10B aktive Parameter pro Token-Inferenz.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen 3.5 122B Heretic als ROCm-FP4-iMatrix-Quant für Strix Halo
Der Reddit-Nutzer /u/RedParaglider hat einen Community-Quantisierungs-Release von Qwen 3.5 122B veröffentlicht, der speziell für AMD-Hardware mit ROCm-Stack optimiert ist. Das Quant verwendet FP4-Präzision kombiniert mit iMatrix-Kalibrierung – eine Methode, bei der eine Wichtungsmatrix aus repräsentativen Eingabedaten berechnet wird, um den Qualitätsverlust durch die niedrige Bit-Tiefe zu minimieren. Zielplattform ist AMD Strix Halo, also APUs der Ryzen-AI-Max-Serie mit ihrem großen unified VRAM-Pool, der das Laden des 60,70 GiB großen Modells in den Speicher überhaupt erst ermöglicht. Qwen 3.5 122B ist ein Mixture-of-Experts-Modell mit 122 Milliarden Gesamtparametern, von denen pro Token lediglich rund 10 Milliarden aktiv sind, was den Rechen- und Speicherbedarf trotz enormer Modellgröße handhabbar hält. Der veröffentlichte KLD-Wert (Kullback-Leibler-Divergenz) von 0,1007 dient als Qualitätsmaß gegenüber dem BF16-Referenzmodell und gilt in der Community als akzeptabler Kompromiss für ein FP4-Quant dieser Größe. Der Ersteller weist darauf hin, dass es sein erster Release dieser Art ist und er das Quant primär für den eigenen Bedarf gebaut hat; eine Variante ohne „Heretic"-Anpassungen soll bei verfügbarer Rechenkapazität folgen. Für NVIDIA-unabhängige Nutzer, die ROCm-basierte Hardware betreiben, schließt dieser Release eine praktische Lücke, da vergleichbare Quants bislang überwiegend für CUDA-Plattformen optimiert erschienen.
- FP4-iMatrix-Quant: Dateigröße 60,70 GiB, ausgelegt für den großen unified VRAM-Pool von AMD-Strix-Halo-APUs (z. B. Ryzen AI Max).
- Decode-Geschwindigkeit: 28,45 tok/s; Prefill-Geschwindigkeit: 353,3 t/s – gemessen auf Strix-Halo-Hardware unter ROCm.
- Qualitätsmessung per Kullback-Leibler-Divergenz (KLD): 0,100716 gegenüber dem BF16-Referenzmodell.
- Ersteller /u/RedParaglider bezeichnet es als seinen ersten Quant-Release; eine Version ohne Heretic-Modifikationen ist in Planung, abhängig von verfügbarer Rechenzeit.
- Qwen 3.5 122B ist ein MoE-Modell: 122B Gesamtparameter, ~10B aktive Parameter pro Token-Inferenz.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.