Ninfer: 700 Token/s mit Qwen3.6 35B auf RTX 5090 – Community-Report
CompaniesCerebras
Warum es zählt
Ninfer verspricht auf der RTX 5090 Single-Instance-Throughput auf Cerebras-Niveau, ohne Batching oder parallele Agenten. Für lokale Setups mit Qwen3.6-Modellen könnte das Inferenz-Engpässe deutlich reduzieren – allerdings derzeit primär Linux-seitig und nur für zwei Modelle.
— Lumeric Redaktion
700 Token/s
Single-Instance auf RTX 5090, Qwen3.6 35B
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com1w
NInfer: 543 tok/s mit Qwen3.6-35B-A3B auf einer RTX 5090
- BENCHMARKreddit.com3w
Lokale Inferenzgeschwindigkeiten im Vergleich: RTX 3090 vs. 5090 vs. Dual RTX 6000
- BENCHMARKreddit.com4d
Quad RTX 3080 20GB auf Vast AI: 69 tps mit Qwen3-27B bei 256k Kontext
- BENCHMARKreddit.com1w
Ternäres Qwen3.6 27B läuft mit 60 t/s auf einer RTX 3090
Ninfer: 700 Token/s mit Qwen3.6 35B auf RTX 5090 – Community-Report
CompaniesCerebras
Warum es zählt
Ninfer verspricht auf der RTX 5090 Single-Instance-Throughput auf Cerebras-Niveau, ohne Batching oder parallele Agenten. Für lokale Setups mit Qwen3.6-Modellen könnte das Inferenz-Engpässe deutlich reduzieren – allerdings derzeit primär Linux-seitig und nur für zwei Modelle.
— Lumeric Redaktion
700 Token/s
Single-Instance auf RTX 5090, Qwen3.6 35B
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com1w
NInfer: 543 tok/s mit Qwen3.6-35B-A3B auf einer RTX 5090
- BENCHMARKreddit.com3w
Lokale Inferenzgeschwindigkeiten im Vergleich: RTX 3090 vs. 5090 vs. Dual RTX 6000
- BENCHMARKreddit.com4d
Quad RTX 3080 20GB auf Vast AI: 69 tps mit Qwen3-27B bei 256k Kontext
- BENCHMARKreddit.com1w
Ternäres Qwen3.6 27B läuft mit 60 t/s auf einer RTX 3090