Qwen3.5 MTP in llama.cpp: 35,8% Akzeptanzrate auf CUDA, ~92% auf Vulkan/Radeon
CompaniesNVIDIA
Warum es zählt
Wer llama.cpp mit MTP/Speculative Decoding auf NVIDIA-Hardware einsetzt, sollte b10290 auf Akzeptanzraten prüfen – der Bug könnte einen signifikanten Durchsatzverlust verursachen. Reproduktionstests auf Ampere, Ada oder weiteren Blackwell-Karten fehlen noch.
— Lumeric Redaktion
MTP Draft Acceptance Rate (llama.cpp b10290, Qwen3.5-9B Q4_K_M) · Spitzenwert
35.8%
RTX PRO 4000 (CUDA)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.5 MTP in llama.cpp: 35,8% Akzeptanzrate auf CUDA, ~92% auf Vulkan/Radeon
CompaniesNVIDIA
Warum es zählt
Wer llama.cpp mit MTP/Speculative Decoding auf NVIDIA-Hardware einsetzt, sollte b10290 auf Akzeptanzraten prüfen – der Bug könnte einen signifikanten Durchsatzverlust verursachen. Reproduktionstests auf Ampere, Ada oder weiteren Blackwell-Karten fehlen noch.
— Lumeric Redaktion
MTP Draft Acceptance Rate (llama.cpp b10290, Qwen3.5-9B Q4_K_M) · Spitzenwert
35.8%
RTX PRO 4000 (CUDA)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.