M5 Ultra: Prefill-Step auf 8192 verdoppelt LLM-Durchsatz
ToolsQwen
Warum es zählt
M5-Ultra-Nutzer können durch simples Setzen von --prefill-step-size 8192 in mlx-vlm/omlx erhebliche Inferenz-Gewinne erzielen – besonders bei langen Kontexten. mlx-vlm benötigt dafür einen kleinen Patch für dflash-Kompatibilität.
— Lumeric Redaktion
Prompt Tokens/s – GLM-flash-4bit on M5 Ultra (32k context) · Spitzenwert
1056.033%
prefill-step 8192
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com3d
Mimo2.6-Flash auf Apple M5 Ultra: erste Inferenz-Benchmarks mit mlx-vlm
- MEINUNGreddit.com3w
vLLM schlägt llama.cpp bei Prefill-Geschwindigkeit deutlich – Community sucht Erklärung
- BENCHMARKreddit.com1d
Apple M5 Ultra 96 GB: Qwen 3.8 FN mit 3.200 tok/s Prefill bei 4-facher Parallelität
M5 Ultra: Prefill-Step auf 8192 verdoppelt LLM-Durchsatz
ToolsQwen
Warum es zählt
M5-Ultra-Nutzer können durch simples Setzen von --prefill-step-size 8192 in mlx-vlm/omlx erhebliche Inferenz-Gewinne erzielen – besonders bei langen Kontexten. mlx-vlm benötigt dafür einen kleinen Patch für dflash-Kompatibilität.
— Lumeric Redaktion
Prompt Tokens/s – GLM-flash-4bit on M5 Ultra (32k context) · Spitzenwert
1056.033%
prefill-step 8192
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com3d
Mimo2.6-Flash auf Apple M5 Ultra: erste Inferenz-Benchmarks mit mlx-vlm
- MEINUNGreddit.com3w
vLLM schlägt llama.cpp bei Prefill-Geschwindigkeit deutlich – Community sucht Erklärung
- BENCHMARKreddit.com1d
Apple M5 Ultra 96 GB: Qwen 3.8 FN mit 3.200 tok/s Prefill bei 4-facher Parallelität