Analyse: Qwen 3.8 Next Engram-Modul – 76 % der 51B Parameter ungenutzt
CompaniesDeepSeek
Warum es zählt
Einfaches Frequency-Pruning auf 50 % Sparsity stört den Engram-Output nur um ~4 % statt ~21 % bei zufälligen Masken – Low-Rank-Kompression und Head-Pruning funktionieren dagegen nicht. Wer das Modell effizient betreiben will, kann den Engram-Speicher mit frequenzbasiertem Pruning massiv reduzieren, solange die Kalibrierdaten der Zieldomain ähneln.
— Lumeric Redaktion
76 % ungenutzt
Engram-Zeilen nie angesprochen (50k Traces)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Analyse: Qwen 3.8 Next Engram-Modul – 76 % der 51B Parameter ungenutzt
CompaniesDeepSeek
Warum es zählt
Einfaches Frequency-Pruning auf 50 % Sparsity stört den Engram-Output nur um ~4 % statt ~21 % bei zufälligen Masken – Low-Rank-Kompression und Head-Pruning funktionieren dagegen nicht. Wer das Modell effizient betreiben will, kann den Engram-Speicher mit frequenzbasiertem Pruning massiv reduzieren, solange die Kalibrierdaten der Zieldomain ähneln.
— Lumeric Redaktion
76 % ungenutzt
Engram-Zeilen nie angesprochen (50k Traces)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.