Qwen3.8-27B auf RTX 3090: Custom CUDA-Megakernel erreicht 140 tok/s
CompaniesOpenAI
Warum es zählt
Der Megakernel fasst einen ganzen Speculative-Decoding-Zyklus in einen einzigen Kernel-Launch zusammen, sodass 4–5 Draft-Tokens kaum mehr kosten als einer. Das Projekt ist OpenAI-kompatibel und damit ein Drop-in-Ersatz für den llama.cpp-Server – allerdings vorerst nur für unsloth Q4_K_M auf 3090-Hardware.
— Lumeric Redaktion
Inference Throughput (RTX 3090, Qwen3.8-27B) · Spitzenwert
140%
Megakernel – Code
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-27B auf RTX 3090: Custom CUDA-Megakernel erreicht 140 tok/s
CompaniesOpenAI
Warum es zählt
Der Megakernel fasst einen ganzen Speculative-Decoding-Zyklus in einen einzigen Kernel-Launch zusammen, sodass 4–5 Draft-Tokens kaum mehr kosten als einer. Das Projekt ist OpenAI-kompatibel und damit ein Drop-in-Ersatz für den llama.cpp-Server – allerdings vorerst nur für unsloth Q4_K_M auf 3090-Hardware.
— Lumeric Redaktion
Inference Throughput (RTX 3090, Qwen3.8-27B) · Spitzenwert
140%
Megakernel – Code
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.