Training-freier Hack reduziert MoE-Reasoning-Token um 8,5 % bei Qwen 35B
CompaniesDeepSeek
Warum es zählt
8,5 % weniger Reasoning-Token und 10,9 % geringere Latenz bei unveränderter Accuracy (84,5 % vs. 84,0 %) bedeuten direkt mehr Durchsatz auf gleicher Hardware – relevant für alle, die MoE-Modelle selbst hosten oder in Produktion betreiben.
— Lumeric Redaktion
8.5% weniger Reasoning-Token
auf MMLU-Pro, Qwen3.6-35B, kein Retraining
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Training-freier Hack reduziert MoE-Reasoning-Token um 8,5 % bei Qwen 35B
CompaniesDeepSeek
Warum es zählt
8,5 % weniger Reasoning-Token und 10,9 % geringere Latenz bei unveränderter Accuracy (84,5 % vs. 84,0 %) bedeuten direkt mehr Durchsatz auf gleicher Hardware – relevant für alle, die MoE-Modelle selbst hosten oder in Produktion betreiben.
— Lumeric Redaktion
8.5% weniger Reasoning-Token
auf MMLU-Pro, Qwen3.6-35B, kein Retraining
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.