llama.cpp Metal-Optimierung beschleunigt MoE-Decode auf Apple Silicon
ToolsLlama
Warum es zählt
Für lokale Inferenz großer MoE-Modelle auf Apple Silicon bedeutet die Optimierung ~13 % mehr Decode-Durchsatz ohne Hardwarewechsel. Ein Follow-up-PR soll zusätzlich die Prefill-Performance verbessern.
— Lumeric Redaktion
73.9 tok/s
Decode-Speed Tiel Coder 35B A3B (Metal)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
llama.cpp Metal-Optimierung beschleunigt MoE-Decode auf Apple Silicon
ToolsLlama
Warum es zählt
Für lokale Inferenz großer MoE-Modelle auf Apple Silicon bedeutet die Optimierung ~13 % mehr Decode-Durchsatz ohne Hardwarewechsel. Ein Follow-up-PR soll zusätzlich die Prefill-Performance verbessern.
— Lumeric Redaktion
73.9 tok/s
Decode-Speed Tiel Coder 35B A3B (Metal)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.