llama.cpp MoE GPU-Cache: Community-Tests mit 8GB VRAM zeigen gemischte Ergebnisse
Warum es zählt
Die Benchmarks zeigen, dass ohne -cmoe (also mit fit-Modus) bis zu 24 t/s bei der Generierung erreicht werden, während -cmoe mit verschiedenen Cache-Größen teils deutlich schlechtere Werte liefert. AI-Builder mit begrenztem VRAM sollten den fit-Modus mit --moe-cache-mib 2048 als Ausgangspunkt testen.
— Lumeric Redaktion
llama.cpp MoE Cache – Eval t/s (Qwen3-35B-A3B IQ4_XS, RTX 4060 8GB) · Spitzenwert
24.2%
fit + moe-cache-mib 2048
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
llama.cpp MoE GPU-Cache: Community-Tests mit 8GB VRAM zeigen gemischte Ergebnisse
Warum es zählt
Die Benchmarks zeigen, dass ohne -cmoe (also mit fit-Modus) bis zu 24 t/s bei der Generierung erreicht werden, während -cmoe mit verschiedenen Cache-Größen teils deutlich schlechtere Werte liefert. AI-Builder mit begrenztem VRAM sollten den fit-Modus mit --moe-cache-mib 2048 als Ausgangspunkt testen.
— Lumeric Redaktion
llama.cpp MoE Cache – Eval t/s (Qwen3-35B-A3B IQ4_XS, RTX 4060 8GB) · Spitzenwert
24.2%
fit + moe-cache-mib 2048
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.