GLM-5.2 lokal: ubatch-Größe verdoppelt Prefill-Durchsatz bei langen Prompts
CompaniesNVIDIA
Warum es zählt
Für lokale MoE-Inferenz (256 Experten, top-8) lohnt sich das Erhöhen der ubatch-Größe besonders bei langen Kontexten, da mehr Tokens pro Expert-GEMM die GPU-Auslastung verbessern. Layer-Split schlägt TP ohne NVLink deutlich (pp2048: 1145 vs. 503 t/s).
— Lumeric Redaktion
GLM-5.2 Prefill-Durchsatz pp2048 (tokens/s) · Spitzenwert
763.1%
llama.cpp
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com1w
MoE-Offloading: AVX-512 (AMD) vs. AVX2 (Intel) für lokale LLM-Inferenz
- BENCHMARKreddit.com1w
Qwen3-27B Q4_K_M auf RTX 5080 16GB: 13,2 tok/s bei 61K Kontext
- MEINUNGreddit.com5d
Qwen3 27B lokal mit 5 t/s auf iGPU: Nutzbar oder zu langsam?
- MEINUNGreddit.com2w
M5 Ultra 96GB vs M5 Max 128GB: Abwägung für lokale LLM-Inference
GLM-5.2 lokal: ubatch-Größe verdoppelt Prefill-Durchsatz bei langen Prompts
CompaniesNVIDIA
Warum es zählt
Für lokale MoE-Inferenz (256 Experten, top-8) lohnt sich das Erhöhen der ubatch-Größe besonders bei langen Kontexten, da mehr Tokens pro Expert-GEMM die GPU-Auslastung verbessern. Layer-Split schlägt TP ohne NVLink deutlich (pp2048: 1145 vs. 503 t/s).
— Lumeric Redaktion
GLM-5.2 Prefill-Durchsatz pp2048 (tokens/s) · Spitzenwert
763.1%
llama.cpp
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com1w
MoE-Offloading: AVX-512 (AMD) vs. AVX2 (Intel) für lokale LLM-Inferenz
- BENCHMARKreddit.com1w
Qwen3-27B Q4_K_M auf RTX 5080 16GB: 13,2 tok/s bei 61K Kontext
- MEINUNGreddit.com5d
Qwen3 27B lokal mit 5 t/s auf iGPU: Nutzbar oder zu langsam?
- MEINUNGreddit.com2w
M5 Ultra 96GB vs M5 Max 128GB: Abwägung für lokale LLM-Inference