Qwen3.8-Flash-Next: GPU-LRU-Expert-Cache steigert Decode auf 2×RTX 3090
Warum es zählt
Für MoE-Modelle im Consumer-GPU-Setup mit RAM-Offloading lohnt sich der LRU-Expert-Cache-PR deutlich: Decode-Speed steigt um ~50–70 %, ohne spezielle Hardware. Schlüsseltuning: ubatch auf 512 senken, um VRAM für mehr Cache-Slots freizumachen; PCIe-3.0-Sättigung bei mehr als 2 Cache-Uploads pro Schritt vermeiden.
— Lumeric Redaktion
Decode-Throughput (t/s), Qwen3.8-Flash-Next auf 2×RTX 3090 · Spitzenwert
17%
Ohne LRU-Cache (kurzer Kontext)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-Flash-Next: GPU-LRU-Expert-Cache steigert Decode auf 2×RTX 3090
Warum es zählt
Für MoE-Modelle im Consumer-GPU-Setup mit RAM-Offloading lohnt sich der LRU-Expert-Cache-PR deutlich: Decode-Speed steigt um ~50–70 %, ohne spezielle Hardware. Schlüsseltuning: ubatch auf 512 senken, um VRAM für mehr Cache-Slots freizumachen; PCIe-3.0-Sättigung bei mehr als 2 Cache-Uploads pro Schritt vermeiden.
— Lumeric Redaktion
Decode-Throughput (t/s), Qwen3.8-Flash-Next auf 2×RTX 3090 · Spitzenwert
17%
Ohne LRU-Cache (kurzer Kontext)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.