M5 Ultra Shootout: Qwen3.8-Flash-Next schlägt Laguna-S-2.1 bei Prefill-Speed
Warum es zählt
Bei 200K Kontext prefilled Qwen in 47s vs. 455s für Laguna – ein 9,7-facher Vorteil durch MTP und lineares Attention-Verhalten. Decode-seitig liefert Qwen 59–74 tok/s stabil, Laguna bricht auf 34 tok/s ein. Qualität war gleichauf (4/4), weshalb Qwen für Long-Context-Inferenz auf Apple Silicon klar zu bevorzugen ist.
— Lumeric Redaktion
Prefill-Zeit bei 200K Kontext (Mac Studio M5 Ultra) · Spitzenwert
47.1%
Qwen3.8-Flash-Next
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
M5 Ultra Shootout: Qwen3.8-Flash-Next schlägt Laguna-S-2.1 bei Prefill-Speed
Warum es zählt
Bei 200K Kontext prefilled Qwen in 47s vs. 455s für Laguna – ein 9,7-facher Vorteil durch MTP und lineares Attention-Verhalten. Decode-seitig liefert Qwen 59–74 tok/s stabil, Laguna bricht auf 34 tok/s ein. Qualität war gleichauf (4/4), weshalb Qwen für Long-Context-Inferenz auf Apple Silicon klar zu bevorzugen ist.
— Lumeric Redaktion
Prefill-Zeit bei 200K Kontext (Mac Studio M5 Ultra) · Spitzenwert
47.1%
Qwen3.8-Flash-Next
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.