Ninfer: 700 Token/s mit Qwen3.6 35B auf RTX 5090 – Community-Report
Ninfer ist ein spezialisiertes Inferenz-Tool, das vom GitHub-Nutzer Neroued explizit für die RTX 5090 entwickelt wurde und ausschließlich zwei Modelle unterstützt: Qwen3.6 27B und Qwen3.6 35B. Der Reddit-Nutzer BringTea_666 berichtet, das Tool unter Windows zum Laufen gebracht zu haben – obwohl das offizielle Repository aktuell nur Linux unterstützt. Den Windows-Build hat er per KI-gestütztem Vibe-Coding mit Open Code und DeepSeek V4 Pro erstellt. Die gemessenen Geschwindigkeiten von 550–720 Token/s bei einer einzelnen Instanz sind bemerkenswert, weil vergleichbare Werte bisher nur durch Batching oder parallele Agenten-Setups erreichbar waren. Der Nutzer vergleicht die Performance direkt mit Cerebras, dem Cloud-Dienst, der bislang als Maßstab für schnelle LLM-Inferenz gilt. Besonders hervorgehoben wird die Kombination mit dem No-Thinking-Modus von Qwen3.6, der den Durchsatz weiter steigert. Der vollständige 250k-Token-Kontext bleibt dabei erhalten – ein Alleinstellungsmerkmal gegenüber vielen anderen lokalen Inferenz-Lösungen, die bei großen Kontextfenstern deutlich an Geschwindigkeit verlieren.
- Ninfer ist auf GitHub unter github.com/Neroued/ninfer verfügbar – offiziell nur für Linux, Windows-Build erfordert manuelles Kompilieren.
- Der Windows-Build wurde vom Poster via KI-Vibe-Coding (Open Code + DeepSeek V4 Pro) ohne klassisches Debugging erstellt.
- Unterstützte Modelle sind ausschließlich Qwen3.6 27B und Qwen3.6 35B – kein Support für andere Architekturen geplant oder dokumentiert.
- Die 550–720 t/s gelten für Single-Instance-Inferenz ohne Batching – die genaue Geschwindigkeit variiert je nach Aufgabe.
- Der No-Thinking-Modus von Qwen3.6 wird explizit als leistungssteigernder Faktor kombiniert mit Ninfer genannt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Ninfer: 700 Token/s mit Qwen3.6 35B auf RTX 5090 – Community-Report
Ninfer ist ein spezialisiertes Inferenz-Tool, das vom GitHub-Nutzer Neroued explizit für die RTX 5090 entwickelt wurde und ausschließlich zwei Modelle unterstützt: Qwen3.6 27B und Qwen3.6 35B. Der Reddit-Nutzer BringTea_666 berichtet, das Tool unter Windows zum Laufen gebracht zu haben – obwohl das offizielle Repository aktuell nur Linux unterstützt. Den Windows-Build hat er per KI-gestütztem Vibe-Coding mit Open Code und DeepSeek V4 Pro erstellt. Die gemessenen Geschwindigkeiten von 550–720 Token/s bei einer einzelnen Instanz sind bemerkenswert, weil vergleichbare Werte bisher nur durch Batching oder parallele Agenten-Setups erreichbar waren. Der Nutzer vergleicht die Performance direkt mit Cerebras, dem Cloud-Dienst, der bislang als Maßstab für schnelle LLM-Inferenz gilt. Besonders hervorgehoben wird die Kombination mit dem No-Thinking-Modus von Qwen3.6, der den Durchsatz weiter steigert. Der vollständige 250k-Token-Kontext bleibt dabei erhalten – ein Alleinstellungsmerkmal gegenüber vielen anderen lokalen Inferenz-Lösungen, die bei großen Kontextfenstern deutlich an Geschwindigkeit verlieren.
- Ninfer ist auf GitHub unter github.com/Neroued/ninfer verfügbar – offiziell nur für Linux, Windows-Build erfordert manuelles Kompilieren.
- Der Windows-Build wurde vom Poster via KI-Vibe-Coding (Open Code + DeepSeek V4 Pro) ohne klassisches Debugging erstellt.
- Unterstützte Modelle sind ausschließlich Qwen3.6 27B und Qwen3.6 35B – kein Support für andere Architekturen geplant oder dokumentiert.
- Die 550–720 t/s gelten für Single-Instance-Inferenz ohne Batching – die genaue Geschwindigkeit variiert je nach Aufgabe.
- Der No-Thinking-Modus von Qwen3.6 wird explizit als leistungssteigernder Faktor kombiniert mit Ninfer genannt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.