GLM-5.3-Flash auf 2× CMP 170HX: 384K Kontext bei ~90 tok/s mit EXL3
ToolsQwen
Warum es zählt
Zeigt, dass Consumer-nahe Mining-GPUs mit großem HBM für lange Kontexte bei großen MoE-Modellen praktisch nutzbar sind, ohne Experten-Streaming aus System-RAM. EXL3 3.05bpw erreicht laut publizierten Fidelity-Tests (~93% Top-1, KLD ~0.05) eine ähnliche Qualität wie UD-Q4_K_XL bei geringerem Speicherbedarf.
— Lumeric Redaktion
GLM-5.3-Flash Quantisierungs-Fidelity (Top-1 Agreement vs. BF16) · Spitzenwert
81.63%
UD-IQ3_XXS
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com5d
Qwen3.8-Flash-Next mit ExLlamaV3 auf einzelner RX 9700: 863 t/s Prefill, 35 t/s Decode bei 230k Kontext
- MEINUNGreddit.com3w
Nvidia CMP 170HX: 64 GB VRAM mit 1,49 TB/s Bandbreite für lokale LLMs
- BENCHMARKreddit.com3d
GLM-4.7-Flash: MXFP4 vs Q4_K_M vs Q4_K_XL auf AMD Radeon 680M iGPU verglichen
GLM-5.3-Flash auf 2× CMP 170HX: 384K Kontext bei ~90 tok/s mit EXL3
ToolsQwen
Warum es zählt
Zeigt, dass Consumer-nahe Mining-GPUs mit großem HBM für lange Kontexte bei großen MoE-Modellen praktisch nutzbar sind, ohne Experten-Streaming aus System-RAM. EXL3 3.05bpw erreicht laut publizierten Fidelity-Tests (~93% Top-1, KLD ~0.05) eine ähnliche Qualität wie UD-Q4_K_XL bei geringerem Speicherbedarf.
— Lumeric Redaktion
GLM-5.3-Flash Quantisierungs-Fidelity (Top-1 Agreement vs. BF16) · Spitzenwert
81.63%
UD-IQ3_XXS
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com5d
Qwen3.8-Flash-Next mit ExLlamaV3 auf einzelner RX 9700: 863 t/s Prefill, 35 t/s Decode bei 230k Kontext
- MEINUNGreddit.com3w
Nvidia CMP 170HX: 64 GB VRAM mit 1,49 TB/s Bandbreite für lokale LLMs
- BENCHMARKreddit.com3d
GLM-4.7-Flash: MXFP4 vs Q4_K_M vs Q4_K_XL auf AMD Radeon 680M iGPU verglichen