VRAM-Disk-Cache-Strategie erreicht 340 pp/s für Kimi K2.7 auf DGX Spark
CompaniesHugging Face
Warum es zählt
Damit lassen sich 1T-MoE-Modelle (204 GB) auf einem einzelnen DGX Spark mit 340 pp/s und 9,6 tg/s betreiben. Die Technik ist direkt auf llama.cpp übertragbar und ermöglicht praxistaugliche Inferenz großer MoE-Modelle ohne Multi-Node-Setup.
— Lumeric Redaktion
llama-bench pp512/tg128 – Kimi K2.7 auf DGX Spark · Spitzenwert
340.02%
Config A (Unified Mem + Min-Batch + Pinning)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
VRAM-Disk-Cache-Strategie erreicht 340 pp/s für Kimi K2.7 auf DGX Spark
CompaniesHugging Face
Warum es zählt
Damit lassen sich 1T-MoE-Modelle (204 GB) auf einem einzelnen DGX Spark mit 340 pp/s und 9,6 tg/s betreiben. Die Technik ist direkt auf llama.cpp übertragbar und ermöglicht praxistaugliche Inferenz großer MoE-Modelle ohne Multi-Node-Setup.
— Lumeric Redaktion
llama-bench pp512/tg128 – Kimi K2.7 auf DGX Spark · Spitzenwert
340.02%
Config A (Unified Mem + Min-Batch + Pinning)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.