Qwen3-27B Q4_K_M auf RTX 5080 16GB: 13,2 tok/s bei 61K Kontext
Warum es zählt
Selektives FFN-Offloading (2,76 GiB auf CPU) verdoppelt den Durchsatz gegenüber ganzem Layer-Offload (6,6 tok/s) und ermöglicht echte Q4-Qualität bei 65K Kontext auf einer 16-GB-GPU. MTP verschlechterte die Performance deutlich wegen RAM-Bandbreitenkonflikten mit den ausgelagerten FFN-Tensoren.
— Lumeric Redaktion
Inferenzdurchsatz (tok/s) @ 50–61K Kontext, RTX 5080 16GB · Spitzenwert
13.26%
Selektives FFN-Offload (kein MTP)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Qwen3-27B Q4_K_M auf RTX 5080 16GB: 13,2 tok/s bei 61K Kontext
Warum es zählt
Selektives FFN-Offloading (2,76 GiB auf CPU) verdoppelt den Durchsatz gegenüber ganzem Layer-Offload (6,6 tok/s) und ermöglicht echte Q4-Qualität bei 65K Kontext auf einer 16-GB-GPU. MTP verschlechterte die Performance deutlich wegen RAM-Bandbreitenkonflikten mit den ausgelagerten FFN-Tensoren.
— Lumeric Redaktion
Inferenzdurchsatz (tok/s) @ 50–61K Kontext, RTX 5080 16GB · Spitzenwert
13.26%
Selektives FFN-Offload (kein MTP)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.