CMP 170HX entsperrt: Tensor-Performance von 6,3 auf 193 TFLOPS gesteigert
Die NVIDIA CMP 170HX ist eine Mining-Karte auf Basis des A100-Siliziums (GA100-Chip), wurde aber werksseitig in zwei kritischen Bereichen künstlich eingeschränkt: 56 der 64 GB HBM2-Speicher sind per Firmware gesperrt, und die Tensor Cores erhalten auf jede MMA-Instruktion einen hardcodierten 256-Zyklus-Stall – eine Zahl, die durch ihre präzise Binärrundung auf manipulierten Registerwerten hinweist, nicht auf physikalische Grenzen. Reddit-Nutzer u/etaoin314 verbrachte einen Tag damit, das Verhalten auf Instruktionsebene zu vermessen: Mit 3.500 Samples maß er den Stall bei exakt 256,0 Zyklen – ohne jede Varianz, wie sie bei echten Hardware-Grenzen aufträte. Nach dem Entsperren fällt der Stall auf 24,0 Zyklen – sogar schneller als die 32,9 Zyklen einer gesunden RTX 3090. Der Autor hat zudem ein cycle-exaktes Prüfwerkzeug entwickelt, das in rund 10 Sekunden verifiziert, ob der eigene Unlock erfolgreich war; es ist safe, parallel zu laufenden Workloads ausgeführt zu werden, und unempfindlich gegenüber Power-Limits. Neben der Tensor-Freischaltung hat er auch die gesperrten 56 GB VRAM entsperrt, sodass die Karte auf ihre vollen 64 GB zugreift. Der Beitrag korrigiert außerdem explizit zwei weit verbreitete, aber inzwischen falsche Empfehlungen aus der Community zu dieser Karte.
- Der 256-Zyklus-Stall trifft jede einzelne MMA-Instruktion und wurde über 3.500 Messungen mit null Varianz nachgewiesen – ein klares Zeichen für einen gesetzten Registerwert.
- Nach dem Unlock messen die Tensor Cores 24,0 Zyklen pro MMA – schneller als eine RTX 3090 (32,9 Zyklen) und 95 % der vollen A100-Rate pro SM.
- Der llama.cpp pp512-Prefill-Durchsatz stieg von 599,6 auf 3.468 tok/s, ein Faktor von 5,8×.
- Beim Betrieb von Qwen3-27B-FP8 unter vLLM schlägt eine entsperrte 170HX (197 W) ein 2×RTX-3090-Tensor-Parallel-Setup (454 W) beim Prefill – bei weniger als halbem Stromverbrauch.
- Das bereitgestellte Verifikations-Tool ist cycle-exakt, läuft in ~10 Sekunden und kann sicher neben laufenden Produktiv-Workloads eingesetzt werden.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com2w
2× Speedup mit Strix Halo + R9700: Heterogenes GPU-Setup für Qwen3.5-122B
- LAUNCHreddit.com1w
Custom llama.cpp-Build für AMD 7900xtx: bis 1600 tk/s auf Qwen 27B Q8_0
- LAUNCHreddit.com3w
CMP170HX-Fork von Ninfer verdoppelt Qwen3.6-35B-Durchsatz auf Consumer-Hardware
- MEINUNGreddit.com17h
Nvidia CMP 170HX: 64 GB VRAM mit 1,49 TB/s Bandbreite für lokale LLMs
CMP 170HX entsperrt: Tensor-Performance von 6,3 auf 193 TFLOPS gesteigert
Die NVIDIA CMP 170HX ist eine Mining-Karte auf Basis des A100-Siliziums (GA100-Chip), wurde aber werksseitig in zwei kritischen Bereichen künstlich eingeschränkt: 56 der 64 GB HBM2-Speicher sind per Firmware gesperrt, und die Tensor Cores erhalten auf jede MMA-Instruktion einen hardcodierten 256-Zyklus-Stall – eine Zahl, die durch ihre präzise Binärrundung auf manipulierten Registerwerten hinweist, nicht auf physikalische Grenzen. Reddit-Nutzer u/etaoin314 verbrachte einen Tag damit, das Verhalten auf Instruktionsebene zu vermessen: Mit 3.500 Samples maß er den Stall bei exakt 256,0 Zyklen – ohne jede Varianz, wie sie bei echten Hardware-Grenzen aufträte. Nach dem Entsperren fällt der Stall auf 24,0 Zyklen – sogar schneller als die 32,9 Zyklen einer gesunden RTX 3090. Der Autor hat zudem ein cycle-exaktes Prüfwerkzeug entwickelt, das in rund 10 Sekunden verifiziert, ob der eigene Unlock erfolgreich war; es ist safe, parallel zu laufenden Workloads ausgeführt zu werden, und unempfindlich gegenüber Power-Limits. Neben der Tensor-Freischaltung hat er auch die gesperrten 56 GB VRAM entsperrt, sodass die Karte auf ihre vollen 64 GB zugreift. Der Beitrag korrigiert außerdem explizit zwei weit verbreitete, aber inzwischen falsche Empfehlungen aus der Community zu dieser Karte.
- Der 256-Zyklus-Stall trifft jede einzelne MMA-Instruktion und wurde über 3.500 Messungen mit null Varianz nachgewiesen – ein klares Zeichen für einen gesetzten Registerwert.
- Nach dem Unlock messen die Tensor Cores 24,0 Zyklen pro MMA – schneller als eine RTX 3090 (32,9 Zyklen) und 95 % der vollen A100-Rate pro SM.
- Der llama.cpp pp512-Prefill-Durchsatz stieg von 599,6 auf 3.468 tok/s, ein Faktor von 5,8×.
- Beim Betrieb von Qwen3-27B-FP8 unter vLLM schlägt eine entsperrte 170HX (197 W) ein 2×RTX-3090-Tensor-Parallel-Setup (454 W) beim Prefill – bei weniger als halbem Stromverbrauch.
- Das bereitgestellte Verifikations-Tool ist cycle-exakt, läuft in ~10 Sekunden und kann sicher neben laufenden Produktiv-Workloads eingesetzt werden.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com2w
2× Speedup mit Strix Halo + R9700: Heterogenes GPU-Setup für Qwen3.5-122B
- LAUNCHreddit.com1w
Custom llama.cpp-Build für AMD 7900xtx: bis 1600 tk/s auf Qwen 27B Q8_0
- LAUNCHreddit.com3w
CMP170HX-Fork von Ninfer verdoppelt Qwen3.6-35B-Durchsatz auf Consumer-Hardware
- MEINUNGreddit.com17h
Nvidia CMP 170HX: 64 GB VRAM mit 1,49 TB/s Bandbreite für lokale LLMs