Qwen3.8-Flash-Next MTP in ik_llama.cpp: 45 → 90 tok/s auf RTX 5090
Warum es zählt
Nutzer von ik_llama.cpp können MTP-Spekulatives Decoding ohne Fork oder Patch aktivieren – entweder als integrierter Head oder als separate -md-Datei. Akzeptanzraten von 93–99 % bei Code bedeuten nahezu doppelten Durchsatz; bei Prosa (60–65 %) ist der Gewinn geringer und kann je nach Hardware sogar negativ ausfallen.
— Lumeric Redaktion
Decode tok/s (kein MTP vs. MTP, Code-Traffic) · Spitzenwert
45%
RTX 5090 + 128GB DDR5 (kein MTP)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-Flash-Next MTP in ik_llama.cpp: 45 → 90 tok/s auf RTX 5090
Warum es zählt
Nutzer von ik_llama.cpp können MTP-Spekulatives Decoding ohne Fork oder Patch aktivieren – entweder als integrierter Head oder als separate -md-Datei. Akzeptanzraten von 93–99 % bei Code bedeuten nahezu doppelten Durchsatz; bei Prosa (60–65 %) ist der Gewinn geringer und kann je nach Hardware sogar negativ ausfallen.
— Lumeric Redaktion
Decode tok/s (kein MTP vs. MTP, Code-Traffic) · Spitzenwert
45%
RTX 5090 + 128GB DDR5 (kein MTP)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.