Apple M5 INT8-Aktivierungen ungenutzt: Community zeigt 1,4× Prefill-Speedup
Der Apple M5 verfügt hardwareseitig über Unterstützung für INT8-Aktivierungen und das Gewichtsformat w4a8, doch die gängigen Inference-Backends MLX und Llama.cpp nutzen diese Fähigkeiten bislang nicht – beide arbeiten durchgehend mit 16-Bit-Aktivierungen. Der Reddit-Nutzer /u/maddie-lovelace hat eigenständig w8a8-Kernel entwickelt und damit auf einem M5 MacBook Air einen Prefill-Durchsatz von 3.029 Tokens pro Sekunde für Gemma4 erreicht, gegenüber 2.193 tps im Auslieferungszustand – ein Speedup von rund 1,4×. Die Eingabelänge beim Test betrug 130.173 Tokens, was den E2B-Kontext (End-to-Beginning) des Modells abdeckt. Bei kürzeren Kontextlängen fällt der Gewinn noch deutlicher aus: Der Durchsatz nähert sich laut dem Post bis zu 10.000 tps an. Das w8a8-Format quantisiert sowohl Gewichte als auch Aktivierungen auf INT8, während w4a8 Gewichte auf 4 Bit reduziert und Aktivierungen auf INT8 hält – letzteres ist laut dem Post ebenfalls als unterstützter dtype auf M5-Hardware vorhanden, wurde aber noch nicht getestet. Die Arbeit ist ein Community-Proof-of-Concept und noch nicht in MLX oder Llama.cpp integriert; eine offizielle Übernahme könnte den Prefill-Durchsatz für alle Mac-Nutzer ohne Hardwarewechsel spürbar steigern.
- w4a8-dtype ist auf M5-Hardware laut Post hardwareseitig verfügbar, wurde aber vom Community-Entwickler noch nicht ausgereizt.
- Der Speedup von 1,4× gilt speziell für Prefill-Tasks; Decode-Geschwindigkeit (Token-Generierung) wird im Post nicht gesondert erwähnt.
- Bei kurzen Kontextlängen nähert sich der Durchsatz mit den w8a8-Kerneln laut /u/maddie-lovelace fast 10.000 tps.
- MLX und Llama.cpp verwenden aktuell 16-Bit-Aktivierungen (fp16/bf16) auf allen Apple-Silicon-Generationen, auch dort wo INT8 unterstützt würde.
- Der Post entstand in r/LocalLLaMA und wurde am 2026-07-23 veröffentlicht – eine offizielle Integration in die Backends steht noch aus.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com1w
llama.cpp überholt MLX bei Prefill-Performance auf Apple M5
- MEINUNGreddit.com1d
Community-Diskussion: Modellwahl und Geschwindigkeit auf Apple M5 Pro 64 GB
- MEINUNGreddit.com2d
MLX vs. GGUF auf Mac: Vergleich von Inferenz-Formaten und Engines
- FORSCHUNGreddit.com1w
llama.cpp Metal-Optimierung beschleunigt MoE-Decode auf Apple Silicon
Apple M5 INT8-Aktivierungen ungenutzt: Community zeigt 1,4× Prefill-Speedup
Der Apple M5 verfügt hardwareseitig über Unterstützung für INT8-Aktivierungen und das Gewichtsformat w4a8, doch die gängigen Inference-Backends MLX und Llama.cpp nutzen diese Fähigkeiten bislang nicht – beide arbeiten durchgehend mit 16-Bit-Aktivierungen. Der Reddit-Nutzer /u/maddie-lovelace hat eigenständig w8a8-Kernel entwickelt und damit auf einem M5 MacBook Air einen Prefill-Durchsatz von 3.029 Tokens pro Sekunde für Gemma4 erreicht, gegenüber 2.193 tps im Auslieferungszustand – ein Speedup von rund 1,4×. Die Eingabelänge beim Test betrug 130.173 Tokens, was den E2B-Kontext (End-to-Beginning) des Modells abdeckt. Bei kürzeren Kontextlängen fällt der Gewinn noch deutlicher aus: Der Durchsatz nähert sich laut dem Post bis zu 10.000 tps an. Das w8a8-Format quantisiert sowohl Gewichte als auch Aktivierungen auf INT8, während w4a8 Gewichte auf 4 Bit reduziert und Aktivierungen auf INT8 hält – letzteres ist laut dem Post ebenfalls als unterstützter dtype auf M5-Hardware vorhanden, wurde aber noch nicht getestet. Die Arbeit ist ein Community-Proof-of-Concept und noch nicht in MLX oder Llama.cpp integriert; eine offizielle Übernahme könnte den Prefill-Durchsatz für alle Mac-Nutzer ohne Hardwarewechsel spürbar steigern.
- w4a8-dtype ist auf M5-Hardware laut Post hardwareseitig verfügbar, wurde aber vom Community-Entwickler noch nicht ausgereizt.
- Der Speedup von 1,4× gilt speziell für Prefill-Tasks; Decode-Geschwindigkeit (Token-Generierung) wird im Post nicht gesondert erwähnt.
- Bei kurzen Kontextlängen nähert sich der Durchsatz mit den w8a8-Kerneln laut /u/maddie-lovelace fast 10.000 tps.
- MLX und Llama.cpp verwenden aktuell 16-Bit-Aktivierungen (fp16/bf16) auf allen Apple-Silicon-Generationen, auch dort wo INT8 unterstützt würde.
- Der Post entstand in r/LocalLLaMA und wurde am 2026-07-23 veröffentlicht – eine offizielle Integration in die Backends steht noch aus.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com1w
llama.cpp überholt MLX bei Prefill-Performance auf Apple M5
- MEINUNGreddit.com1d
Community-Diskussion: Modellwahl und Geschwindigkeit auf Apple M5 Pro 64 GB
- MEINUNGreddit.com2d
MLX vs. GGUF auf Mac: Vergleich von Inferenz-Formaten und Engines
- FORSCHUNGreddit.com1w
llama.cpp Metal-Optimierung beschleunigt MoE-Decode auf Apple Silicon