Dense-zu-MoE-Konvertierung: Hobby-Experiment mit Qwen2.5 und SmolLM2
ToolsQwen
Warum es zählt
Die Konvertierung reduziert MLP-Compute um ~56–60 %, kostet aber bei Mean-Accuracy rund 10 Prozentpunkte (z.B. Qwen2.5-0.5B: 0.467 → 0.408). Für lokale Experimente mit kleinen Budgets zeigt der Ansatz Grenzen bei Tiny-Modellen; bei größeren Modellen könnte das Verhältnis günstiger sein.
— Lumeric Redaktion
Mean Acc Norm (HellaSwag/ARC/WinoGrande/OBQA) · Spitzenwert
0.467%
Qwen2.5-0.5B Dense
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGreddit.com1w
ToMoE v2: Dense-Modelle verlustfrei in MoE-Architektur konvertieren
- FORSCHUNGarxiv.org2w
L0-MoE: 2,5× Inferenzbeschleunigung für dichte LLMs ohne Leistungsverlust
- FORSCHUNGarxiv.org3d
SLBF: Datenfreie MoE-Komprimierung via geteilter Low-rank-Basis
- MEINUNGreddit.com1w
Qwen3.6 & 3.8 27B mergen für bessere Effizienz bei weniger Token
Dense-zu-MoE-Konvertierung: Hobby-Experiment mit Qwen2.5 und SmolLM2
ToolsQwen
Warum es zählt
Die Konvertierung reduziert MLP-Compute um ~56–60 %, kostet aber bei Mean-Accuracy rund 10 Prozentpunkte (z.B. Qwen2.5-0.5B: 0.467 → 0.408). Für lokale Experimente mit kleinen Budgets zeigt der Ansatz Grenzen bei Tiny-Modellen; bei größeren Modellen könnte das Verhältnis günstiger sein.
— Lumeric Redaktion
Mean Acc Norm (HellaSwag/ARC/WinoGrande/OBQA) · Spitzenwert
0.467%
Qwen2.5-0.5B Dense
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGreddit.com1w
ToMoE v2: Dense-Modelle verlustfrei in MoE-Architektur konvertieren
- FORSCHUNGarxiv.org2w
L0-MoE: 2,5× Inferenzbeschleunigung für dichte LLMs ohne Leistungsverlust
- FORSCHUNGarxiv.org3d
SLBF: Datenfreie MoE-Komprimierung via geteilter Low-rank-Basis
- MEINUNGreddit.com1w
Qwen3.6 & 3.8 27B mergen für bessere Effizienz bei weniger Token