llama.cpp überholt MLX bei Prefill-Performance auf Apple M5
Warum es zählt
Wer lokale LLMs auf Apple-Silicon betreibt, kann nun GGUF-Modelle mit MTP via llama.cpp für sowohl Generation (~19 t/s) als auch Prefill nutzen, ohne zwischen Frameworks wechseln zu müssen. MLX verliert damit seinen letzten praktischen Vorteil auf M5-Hardware.
— Lumeric Redaktion
300–350 t/s
Prefill-Speed auf M5 Pro mit Qwen3-27B Q8
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
llama.cpp überholt MLX bei Prefill-Performance auf Apple M5
Warum es zählt
Wer lokale LLMs auf Apple-Silicon betreibt, kann nun GGUF-Modelle mit MTP via llama.cpp für sowohl Generation (~19 t/s) als auch Prefill nutzen, ohne zwischen Frameworks wechseln zu müssen. MLX verliert damit seinen letzten praktischen Vorteil auf M5-Hardware.
— Lumeric Redaktion
300–350 t/s
Prefill-Speed auf M5 Pro mit Qwen3-27B Q8
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.