550B Nemotron Ultra Q3_S auf alten P40- und MI50-GPUs via RPC
CompaniesNVIDIA
Warum es zählt
Zeigt, dass sich ein 550B-Modell mit alter Consumer- und Datacenter-Hardware (P40/MI50) über RPC sinnvoll betreiben lässt. Token-Generation sinkt bei 126k Context auf ~5,59 t/s — für Experimente mit großen MoE-Modellen ohne neue Hardware relevant.
— Lumeric Redaktion
llama.cpp tg128 (Token-Generierung, t/s) · Spitzenwert
6.19%
Context 0
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
550B Nemotron Ultra Q3_S auf alten P40- und MI50-GPUs via RPC
CompaniesNVIDIA
Warum es zählt
Zeigt, dass sich ein 550B-Modell mit alter Consumer- und Datacenter-Hardware (P40/MI50) über RPC sinnvoll betreiben lässt. Token-Generation sinkt bei 126k Context auf ~5,59 t/s — für Experimente mit großen MoE-Modellen ohne neue Hardware relevant.
— Lumeric Redaktion
llama.cpp tg128 (Token-Generierung, t/s) · Spitzenwert
6.19%
Context 0
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.