llama.cpp: CUDA-SSD-Matmul und Metal-FWHT-Kernel beschleunigen Inferenz
Warum es zählt
Wer Mamba-2-Modelle lokal betreibt, profitiert bei längeren Kontexten (ab 256 Tokens) von bis zu 22% mehr Durchsatz. Apple-Silicon-Nutzer erhalten mit dem FWHT-Kernel bis zu 3,5% schnellere Inferenz für quantisierte Modelle ohne Konfigurationsaufwand.
— Lumeric Redaktion
Mamba-2 Prefill Speedup (Nemotron-Nano-9B-v2, RTX 6000 Pro MaxQ) · Spitzenwert
5404%
ub128 (scan, Baseline)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
llama.cpp: CUDA-SSD-Matmul und Metal-FWHT-Kernel beschleunigen Inferenz
Warum es zählt
Wer Mamba-2-Modelle lokal betreibt, profitiert bei längeren Kontexten (ab 256 Tokens) von bis zu 22% mehr Durchsatz. Apple-Silicon-Nutzer erhalten mit dem FWHT-Kernel bis zu 3,5% schnellere Inferenz für quantisierte Modelle ohne Konfigurationsaufwand.
— Lumeric Redaktion
Mamba-2 Prefill Speedup (Nemotron-Nano-9B-v2, RTX 6000 Pro MaxQ) · Spitzenwert
5404%
ub128 (scan, Baseline)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.