Qwen3.8-Next läuft mit 150 tps Prefill auf M5 Air – schneller als 27B-Dense
ToolsQwen
Warum es zählt
Das quantisierte MoE-Modell (3-bit) übertrifft auf Consumer-Hardware das doppelt so große Dense-Modell in der Prefill-Geschwindigkeit. Für lokale Inferenz auf Apple-Silicon ist Qwen3.8-Next damit eine attraktive Option bei begrenztem RAM.
— Lumeric Redaktion
Prefill / Decode Speed (tps, 2k Token Prompt, M5 Air 32GB) · Spitzenwert
150%
Qwen3.8-Next 3-bit (MoE)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-Next läuft mit 150 tps Prefill auf M5 Air – schneller als 27B-Dense
ToolsQwen
Warum es zählt
Das quantisierte MoE-Modell (3-bit) übertrifft auf Consumer-Hardware das doppelt so große Dense-Modell in der Prefill-Geschwindigkeit. Für lokale Inferenz auf Apple-Silicon ist Qwen3.8-Next damit eine attraktive Option bei begrenztem RAM.
— Lumeric Redaktion
Prefill / Decode Speed (tps, 2k Token Prompt, M5 Air 32GB) · Spitzenwert
150%
Qwen3.8-Next 3-bit (MoE)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.