2× RTX 4090 mit llama.cpp: Praxis-Limit bei 5 parallelen Agents (64k Kontext)
CompaniesMeta AI
Warum es zählt
Wer lokale Agent-Stacks auf Consumer-GPUs betreibt, profitiert konkret: Ab 5 gleichzeitigen Agents stagniert der Durchsatz, und die Sekunden-pro-Tool-Call (3,40 s bei 27B vs. 11,91 s bei 122B MoE) sind die entscheidende Metrik — nicht tok/s. Q4_K_M, Q6_K_XL und Q8_K_XL zeigen bis 251k Token keine messbaren Genauigkeitsunterschiede.
— Lumeric Redaktion
Sekunden pro Agent-Tool-Call (2× RTX 4090, llama.cpp) · Spitzenwert
2.1%
Qwen3.6-35B-A3B (MoE)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
2× RTX 4090 mit llama.cpp: Praxis-Limit bei 5 parallelen Agents (64k Kontext)
CompaniesMeta AI
Warum es zählt
Wer lokale Agent-Stacks auf Consumer-GPUs betreibt, profitiert konkret: Ab 5 gleichzeitigen Agents stagniert der Durchsatz, und die Sekunden-pro-Tool-Call (3,40 s bei 27B vs. 11,91 s bei 122B MoE) sind die entscheidende Metrik — nicht tok/s. Q4_K_M, Q6_K_XL und Q8_K_XL zeigen bis 251k Token keine messbaren Genauigkeitsunterschiede.
— Lumeric Redaktion
Sekunden pro Agent-Tool-Call (2× RTX 4090, llama.cpp) · Spitzenwert
2.1%
Qwen3.6-35B-A3B (MoE)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.