Ninfer auf RTX 5090: 220 Tokens/s mit Qwen3.8-27B-NVFP4
Der Reddit-Nutzer Rollingsound514 teilt seine Konfiguration für Ninfer, einen auf NVIDIA-Hardware optimierten Inferenz-Server, der als Alternative zu llama.cpp positioniert ist. Eingesetzt wird das Modell Qwen3.8-27B im NVFP4-Format – einem NVIDIA-proprietären 4-Bit-Quantisierungsformat, das speziell auf die Tensor-Cores der Ada/Blackwell-Generation zugeschnitten ist. Die RTX 5090 (Blackwell-Architektur) bietet mit 32 GB GDDR7-Speicher ausreichend Kapazität, um ein 27B-Modell vollständig im VRAM zu halten. Der entscheidende Geschwindigkeitsvorteil entsteht durch das Zusammenspiel mehrerer Techniken: Spekulative Dekodierung via Multi-Token-Prediction (MTP) mit 3 Draft-Tokens, ein FP8-KV-Cache sowie ein separater Host-seitiger KV-Cache-Speicher von 16 GB (--host-kv-mib 16384). Der maximale Kontext ist mit 240.000 Tokens außergewöhnlich groß konfiguriert, was auf Vision-Anwendungsfälle hindeutet – der Flag --vision ist gesetzt, ebenso ein Media-Puffer von 2 GB. Mit bis zu 2 gleichzeitigen Anfragen (--max-concurrency 2) erreicht das Setup Spitzenwerte von 220 Tokens/s bei einem Durchschnitt von rund 170 T/s – nach Aussage des Nutzers mehr als doppelt so schnell wie ein vergleichbares llama.cpp-Setup auf derselben Hardware.
- Konfigurierter Max-Kontext: 240.000 Tokens – ungewöhnlich groß, passend für Vision- und Long-Context-Aufgaben.
- KV-Cache läuft im FP8-Format (--kv-dtype fp8) mit zusätzlichem Host-RAM-Puffer von 16.384 MiB (16 GB).
- Spekulative Dekodierung via MTP mit 3 Draft-Tokens und aktiviertem LM-Head-Draft (--lm-head-draft) für schnellere Verifikation.
- Vision-Modus aktiviert (--vision) mit 2.048 MiB Media-Puffer für multimodalen Input.
- Max. Parallelität auf 2 simultane Anfragen begrenzt (--max-concurrency 2); Serveradresse auf 0.0.0.0 gebunden.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Ninfer auf RTX 5090: 220 Tokens/s mit Qwen3.8-27B-NVFP4
Der Reddit-Nutzer Rollingsound514 teilt seine Konfiguration für Ninfer, einen auf NVIDIA-Hardware optimierten Inferenz-Server, der als Alternative zu llama.cpp positioniert ist. Eingesetzt wird das Modell Qwen3.8-27B im NVFP4-Format – einem NVIDIA-proprietären 4-Bit-Quantisierungsformat, das speziell auf die Tensor-Cores der Ada/Blackwell-Generation zugeschnitten ist. Die RTX 5090 (Blackwell-Architektur) bietet mit 32 GB GDDR7-Speicher ausreichend Kapazität, um ein 27B-Modell vollständig im VRAM zu halten. Der entscheidende Geschwindigkeitsvorteil entsteht durch das Zusammenspiel mehrerer Techniken: Spekulative Dekodierung via Multi-Token-Prediction (MTP) mit 3 Draft-Tokens, ein FP8-KV-Cache sowie ein separater Host-seitiger KV-Cache-Speicher von 16 GB (--host-kv-mib 16384). Der maximale Kontext ist mit 240.000 Tokens außergewöhnlich groß konfiguriert, was auf Vision-Anwendungsfälle hindeutet – der Flag --vision ist gesetzt, ebenso ein Media-Puffer von 2 GB. Mit bis zu 2 gleichzeitigen Anfragen (--max-concurrency 2) erreicht das Setup Spitzenwerte von 220 Tokens/s bei einem Durchschnitt von rund 170 T/s – nach Aussage des Nutzers mehr als doppelt so schnell wie ein vergleichbares llama.cpp-Setup auf derselben Hardware.
- Konfigurierter Max-Kontext: 240.000 Tokens – ungewöhnlich groß, passend für Vision- und Long-Context-Aufgaben.
- KV-Cache läuft im FP8-Format (--kv-dtype fp8) mit zusätzlichem Host-RAM-Puffer von 16.384 MiB (16 GB).
- Spekulative Dekodierung via MTP mit 3 Draft-Tokens und aktiviertem LM-Head-Draft (--lm-head-draft) für schnellere Verifikation.
- Vision-Modus aktiviert (--vision) mit 2.048 MiB Media-Puffer für multimodalen Input.
- Max. Parallelität auf 2 simultane Anfragen begrenzt (--max-concurrency 2); Serveradresse auf 0.0.0.0 gebunden.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.