NPU-Engine reverse-engineered: GGUF direkt auf Axera AX8850 – 1,5× schneller als Vendor-Runtime
Warum es zählt
Der Ansatz – GGUF-Gewichte zur Ladezeit in vorkompilierte Vendor-Engines zu patchen – eliminiert den Vendor-Compiler-Schritt und übertrifft die geschlossene Vendor-Runtime um 1,5×. Für Edge-AI-Builder auf LPDDR4x-NPUs liefert die Analyse außerdem ein klares Modell: Decode-Speed = Bytes pro Token × Token pro Weight-Pass, womit Optimierungen (int4, Vocab-Trim) vorhersagbar werden.
— Lumeric Redaktion
24,5 t/s Decode / 716 t/s Prefill
Qwen3-0.6B auf Axera AX8850 + Pi 5
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
NPU-Engine reverse-engineered: GGUF direkt auf Axera AX8850 – 1,5× schneller als Vendor-Runtime
Warum es zählt
Der Ansatz – GGUF-Gewichte zur Ladezeit in vorkompilierte Vendor-Engines zu patchen – eliminiert den Vendor-Compiler-Schritt und übertrifft die geschlossene Vendor-Runtime um 1,5×. Für Edge-AI-Builder auf LPDDR4x-NPUs liefert die Analyse außerdem ein klares Modell: Decode-Speed = Bytes pro Token × Token pro Weight-Pass, womit Optimierungen (int4, Vocab-Trim) vorhersagbar werden.
— Lumeric Redaktion
24,5 t/s Decode / 716 t/s Prefill
Qwen3-0.6B auf Axera AX8850 + Pi 5
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.