Ninfer-Backend: 130–180 t/s mit Qwen3-27B auf Blackwell MaxQ unter Windows
CompaniesNVIDIA
Warum es zählt
Ninfer scheint eine hochspezialisierte, schnelle Alternative zu llama-server und vLLM zu sein, besonders für agentische Workloads. Noch fehlen Features wie erweiterte Sampling-Parameter und breite Modell-Unterstützung, aber für bestimmte Use-Cases ist es bereits produktionsreif.
— Lumeric Redaktion
130–180 t/s
Token/s mit Qwen3-27B auf Blackwell MaxQ
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Ninfer-Backend: 130–180 t/s mit Qwen3-27B auf Blackwell MaxQ unter Windows
CompaniesNVIDIA
Warum es zählt
Ninfer scheint eine hochspezialisierte, schnelle Alternative zu llama-server und vLLM zu sein, besonders für agentische Workloads. Noch fehlen Features wie erweiterte Sampling-Parameter und breite Modell-Unterstützung, aber für bestimmte Use-Cases ist es bereits produktionsreif.
— Lumeric Redaktion
130–180 t/s
Token/s mit Qwen3-27B auf Blackwell MaxQ
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.