AgrillaMoE: llama.cpp-Fork für Qwen3.6-35B auf 16-GB-GPU mit 57–60 tok/s
Warum es zählt
Entwickler können ein 35B-MoE-Modell auf einer gemieteten V100-16GB mit ~57–60 tok/s betreiben und es via OpenAI- und Anthropic-kompatibler API direkt in Tools wie Claude Code einbinden — bei messbarem Qualitätsgewinn durch das Experten-Expansion-Patch.
— Lumeric Redaktion
GPQA-Diamond · Spitzenwert
84.34%
AgrillaMoE (top-20 Experten, Q8_0)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com1d
Qwen3.6-35B-A3B-Q6 erreicht 3095 tok/s Prefill auf Strix Halo
- LAUNCHreddit.com2d
llama.cpp: CUDA-Kernel fusioniert Shared Experts in MMVQ für MoE-Speedup
- MEINUNGreddit.com1w
Qwen3.8 Flash + ExLlamaV3 + Hermes Agent: 80–120 t/s auf 6× RTX 3090
- MEINUNGreddit.com0mo
Qwen3.8 27B auf 3090: Community-Debatte über lokale Agentic-Coding-Setups
AgrillaMoE: llama.cpp-Fork für Qwen3.6-35B auf 16-GB-GPU mit 57–60 tok/s
Warum es zählt
Entwickler können ein 35B-MoE-Modell auf einer gemieteten V100-16GB mit ~57–60 tok/s betreiben und es via OpenAI- und Anthropic-kompatibler API direkt in Tools wie Claude Code einbinden — bei messbarem Qualitätsgewinn durch das Experten-Expansion-Patch.
— Lumeric Redaktion
GPQA-Diamond · Spitzenwert
84.34%
AgrillaMoE (top-20 Experten, Q8_0)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com1d
Qwen3.6-35B-A3B-Q6 erreicht 3095 tok/s Prefill auf Strix Halo
- LAUNCHreddit.com2d
llama.cpp: CUDA-Kernel fusioniert Shared Experts in MMVQ für MoE-Speedup
- MEINUNGreddit.com1w
Qwen3.8 Flash + ExLlamaV3 + Hermes Agent: 80–120 t/s auf 6× RTX 3090
- MEINUNGreddit.com0mo
Qwen3.8 27B auf 3090: Community-Debatte über lokale Agentic-Coding-Setups