llama.cpp: E-Cores schneller als P-Cores bei MoE-Modell mit GPU+CPU-Offloading
Warum es zählt
Bei speicherbandbreitengebundenen MoE-Inferenz-Setups mit CPU-Offloading kann das Pinning auf E-Cores statt P-Cores die Performance steigern – entgegen der verbreiteten Annahme, dass P-Cores immer vorzuziehen sind.
— Lumeric Redaktion
llama.cpp Token Generation (t/s) · Spitzenwert
22.7%
12 E-Cores only (12-23)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
llama.cpp: E-Cores schneller als P-Cores bei MoE-Modell mit GPU+CPU-Offloading
Warum es zählt
Bei speicherbandbreitengebundenen MoE-Inferenz-Setups mit CPU-Offloading kann das Pinning auf E-Cores statt P-Cores die Performance steigern – entgegen der verbreiteten Annahme, dass P-Cores immer vorzuziehen sind.
— Lumeric Redaktion
llama.cpp Token Generation (t/s) · Spitzenwert
22.7%
12 E-Cores only (12-23)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.