llama.cpp PR: bis zu 169% schnellerer KV-Decode auf Intel Battlemage via SYCL-Kernel-Wechsel
Warum es zählt
Nutzer von Intel-Arc-GPUs (B580, B70) mit großen Kontextfenstern könnten durch einen simplen Kernel-Switch massive Geschwindigkeitsgewinne erzielen – ohne Modell- oder Quantisierungsänderung. Der PR ist noch nicht gemergt und bisher nur auf einer Battlemage-Hardware bestätigt.
— Lumeric Redaktion
llama.cpp SYCL Decode t/s @ 118K ctx (Battlemage) · Spitzenwert
12.99%
Qwen3.6-35B q4_0 (VEC, vorher)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
llama.cpp PR: bis zu 169% schnellerer KV-Decode auf Intel Battlemage via SYCL-Kernel-Wechsel
Warum es zählt
Nutzer von Intel-Arc-GPUs (B580, B70) mit großen Kontextfenstern könnten durch einen simplen Kernel-Switch massive Geschwindigkeitsgewinne erzielen – ohne Modell- oder Quantisierungsänderung. Der PR ist noch nicht gemergt und bisher nur auf einer Battlemage-Hardware bestätigt.
— Lumeric Redaktion
llama.cpp SYCL Decode t/s @ 118K ctx (Battlemage) · Spitzenwert
12.99%
Qwen3.6-35B q4_0 (VEC, vorher)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.