QUASAR QAD: Vollständig quantisiertes NVFP4 Qwen3.8-27B mit nahezu BF16-Performance
CompaniesNVIDIA
Warum es zählt
Das Modell schrumpft von 55,6 GB (BF16) auf 19,7 GB bei kaum messbarem Qualitätsverlust – relevant für Deployments auf NVIDIA-Blackwell-GPUs mit vLLM. QAD erlaubt erstmals die vollständige Quantisierung inkl. Attention- und GDN-Schichten ohne die sonst typischen Qualitätseinbußen.
— Lumeric Redaktion
GPQA-Diamond · Spitzenwert
0.9141%
Qwen3.8-27B BF16 (Original)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
QUASAR QAD: Vollständig quantisiertes NVFP4 Qwen3.8-27B mit nahezu BF16-Performance
CompaniesNVIDIA
Warum es zählt
Das Modell schrumpft von 55,6 GB (BF16) auf 19,7 GB bei kaum messbarem Qualitätsverlust – relevant für Deployments auf NVIDIA-Blackwell-GPUs mit vLLM. QAD erlaubt erstmals die vollständige Quantisierung inkl. Attention- und GDN-Schichten ohne die sonst typischen Qualitätseinbußen.
— Lumeric Redaktion
GPQA-Diamond · Spitzenwert
0.9141%
Qwen3.8-27B BF16 (Original)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.