BC-250 Mining-Boards als lokaler LLM-Cluster: 70 tok/s mit 100k Kontext für ~500 USD
CompaniesAMD
Warum es zählt
Durch gezielte Optimierungen (Speculative Decoding mit MTP-Head, Vulkan Graph Replay, architekturspezifische Kernels) wurden Geschwindigkeit und Kontextlänge erheblich gesteigert. Das Setup zeigt, dass leistungsfähige lokale Inferenz mit sehr günstiger Ex-Mining-Hardware realisierbar ist.
— Lumeric Redaktion
~145 tok/s
2× Qwen 3.6 35B bei 256k Kontext auf 500 USD Hardware
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
BC-250 Mining-Boards als lokaler LLM-Cluster: 70 tok/s mit 100k Kontext für ~500 USD
CompaniesAMD
Warum es zählt
Durch gezielte Optimierungen (Speculative Decoding mit MTP-Head, Vulkan Graph Replay, architekturspezifische Kernels) wurden Geschwindigkeit und Kontextlänge erheblich gesteigert. Das Setup zeigt, dass leistungsfähige lokale Inferenz mit sehr günstiger Ex-Mining-Hardware realisierbar ist.
— Lumeric Redaktion
~145 tok/s
2× Qwen 3.6 35B bei 256k Kontext auf 500 USD Hardware
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.