Qwen3.5 0.8B auf CPU: Custom C++ Engine mit 2,9× Prefill-Speedup
CompaniesPerplexity
Warum es zählt
Für lokale CPU-Inferenz (z.B. Diktat-Cleanup neben GPU-Workloads) zeigt die Engine konkrete Throughput-Gewinne gegenüber llama.cpp und ik_llama.cpp. Das Repo ist öffentlich, damit direkt als Ausgangspunkt für CPU-optimierte Small-Model-Deployments nutzbar.
— Lumeric Redaktion
Decode B16 Throughput (Ryzen 9 9955HX3D, 8 V-Cache Cores) · Spitzenwert
642%
qwen35-cpu H128/Q4-G32-DOT4
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.5 0.8B auf CPU: Custom C++ Engine mit 2,9× Prefill-Speedup
CompaniesPerplexity
Warum es zählt
Für lokale CPU-Inferenz (z.B. Diktat-Cleanup neben GPU-Workloads) zeigt die Engine konkrete Throughput-Gewinne gegenüber llama.cpp und ik_llama.cpp. Das Repo ist öffentlich, damit direkt als Ausgangspunkt für CPU-optimierte Small-Model-Deployments nutzbar.
— Lumeric Redaktion
Decode B16 Throughput (Ryzen 9 9955HX3D, 8 V-Cache Cores) · Spitzenwert
642%
qwen35-cpu H128/Q4-G32-DOT4
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.