Qwen3.8-Flash-Next (95,5 GiB) auf 64-GB-Mac mit ~27 tok/s via Expert Streaming
Warum es zählt
Der Ansatz erlaubt, MoE-Modelle deutlich größer als der verfügbare RAM zu betreiben – relevant für lokale Setups auf Apple Silicon. Zusätzliche Optimierungen (Sparse Attention, Metal MoE Fusion, direkte File-Reads statt mmap) steigern Prefill und Decode erheblich; der Fork und das Checkpoint-Setup sind öffentlich verfügbar.
— Lumeric Redaktion
27,6 tok/s
Generierung auf 64-GB-Mac (M5 Pro) mit Draft Head
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-Flash-Next (95,5 GiB) auf 64-GB-Mac mit ~27 tok/s via Expert Streaming
Warum es zählt
Der Ansatz erlaubt, MoE-Modelle deutlich größer als der verfügbare RAM zu betreiben – relevant für lokale Setups auf Apple Silicon. Zusätzliche Optimierungen (Sparse Attention, Metal MoE Fusion, direkte File-Reads statt mmap) steigern Prefill und Decode erheblich; der Fork und das Checkpoint-Setup sind öffentlich verfügbar.
— Lumeric Redaktion
27,6 tok/s
Generierung auf 64-GB-Mac (M5 Pro) mit Draft Head
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.