llama.cpp: Offener PR für --n-cpu-ffn Option bei Dense-Modellen
Warum es zählt
Die Option erlaubt es, Dense-Modelle wie Qwen 3.8 27B auf GPUs mit ≤16 GB VRAM mit Q4_K_M und 130k Kontext bei ~20 t/s zu betreiben, indem FFN-Schichten gezielt auf die CPU ausgelagert werden. Bis zur Zusammenführung ist der PR noch offen.
— Lumeric Redaktion
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
llama.cpp: Offener PR für --n-cpu-ffn Option bei Dense-Modellen
Warum es zählt
Die Option erlaubt es, Dense-Modelle wie Qwen 3.8 27B auf GPUs mit ≤16 GB VRAM mit Q4_K_M und 130k Kontext bei ~20 t/s zu betreiben, indem FFN-Schichten gezielt auf die CPU ausgelagert werden. Bis zur Zusammenführung ist der PR noch offen.
— Lumeric Redaktion
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.