Kimi K3 (2,8T Parameter) auf 8× B300: 92 tok/s für $190 pro Mio. Token
Warum es zählt
Selbst gehostete MoE-Modelle dieser Größe bleiben teuer: $190/Mio. Token auf Topline-Hardware vs. $620/Mio. auf A100 mit 1-Bit-Quantisierung. Die Zahlen zeigen konkret, dass Quantisierung bei extremer Modellgröße Durchsatz massiv frisst und die Token-Kosten trotz günstigerer Stundensätze steigen können.
— Lumeric Redaktion
Kimi K3 Inference – tok/s & Cost · Spitzenwert
92%
8× B300 (MXFP4, vLLM)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Kimi K3 (2,8T Parameter) auf 8× B300: 92 tok/s für $190 pro Mio. Token
Warum es zählt
Selbst gehostete MoE-Modelle dieser Größe bleiben teuer: $190/Mio. Token auf Topline-Hardware vs. $620/Mio. auf A100 mit 1-Bit-Quantisierung. Die Zahlen zeigen konkret, dass Quantisierung bei extremer Modellgröße Durchsatz massiv frisst und die Token-Kosten trotz günstigerer Stundensätze steigen können.
— Lumeric Redaktion
Kimi K3 Inference – tok/s & Cost · Spitzenwert
92%
8× B300 (MXFP4, vLLM)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.