Ornith-397B auf einer RTX PRO 6000 Blackwell: 2.354 tok/s Prefill, ~20–24 tok/s Decode
ToolsNVIDIA Hardware
Warum es zählt
Sehr große MoE-Modelle lassen sich mit Krasis ohne Multi-GPU-Setup interaktiv betreiben – relevant für alle, die frontier-scale Inferenz auf einzelner Workstation-GPU ausprobieren wollen. Mit 256 GB DDR5-RAM und einer RTX 5090 sind sogar ~7,9 tok/s Decode möglich.
— Lumeric Redaktion
2.354,5 tok/s
Prefill bei 39.920 Tokens (Q4, 1× GPU)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Ornith-397B auf einer RTX PRO 6000 Blackwell: 2.354 tok/s Prefill, ~20–24 tok/s Decode
ToolsNVIDIA Hardware
Warum es zählt
Sehr große MoE-Modelle lassen sich mit Krasis ohne Multi-GPU-Setup interaktiv betreiben – relevant für alle, die frontier-scale Inferenz auf einzelner Workstation-GPU ausprobieren wollen. Mit 256 GB DDR5-RAM und einer RTX 5090 sind sogar ~7,9 tok/s Decode möglich.
— Lumeric Redaktion
2.354,5 tok/s
Prefill bei 39.920 Tokens (Q4, 1× GPU)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.