NInfer-Fork: 250–350K Token Kontextfenster auf einer RTX 4090 mit Qwen 3.8 27B
Der Reddit-Nutzer UDPSendToFailed hat einen eigenen Fork des Inferenz-Frameworks NInfer veröffentlicht, der speziell auf die RTX 4090 mit 24 GB VRAM zugeschnitten ist. Zentrales Feature ist eine neue KV-Cache-Quantisierungsoption namens rk2v4-e8, die den Speicherbedarf des Kontextpuffers drastisch reduziert und so Kontextfenster von 250.000 bis 350.000 Token ermöglicht – abhängig davon, ob Vision-Support und Multi-Token-Prediction (MTP) aktiviert sind. Der gesamte Kontext verbleibt dabei vollständig im GPU-VRAM, ohne in den langsameren System-RAM auszuweichen. Als Zielmodell dient Qwen 3.8 27B, eines der leistungsfähigsten quant-freundlichen Open-Weight-Modelle seiner Größenklasse. Für kürzere Kontextfenster wurden zusätzlich Geschwindigkeitsoptimierungen vorgenommen, die bei repetitiven Aufgaben wie Code-Generierung oder Mathematik 80 bis 160 Tokens pro Sekunde erreichen. Der Fork ist auf GitHub unter dem Handle UDPSendToFailed/ninfer-4090 öffentlich verfügbar. Der Autor weist explizit darauf hin, dass das Projekt unter realen, „chaotischen" Workloads getestet wurde – ein erster Hinweis auf Stabilität, wenngleich es sich um ein Community-Projekt ohne formellen Release-Prozess handelt.
- rk2v4-e8 ist eine neue KV-Cache-Quantisierungsoption, die speziell für diesen Fork entwickelt wurde und den Haupthebel für das große Kontextfenster darstellt.
- Die erreichbare Kontextgröße (250K–350K Token) variiert je nach aktivierten Features: Vision-Support und Multi-Token-Prediction (MTP) reduzieren den verfügbaren Puffer.
- Geschwindigkeitsgewinn von 80–160 Tokens/s gilt explizit für repetitive Workloads (Code, Mathematik) bei geringeren Kontextlängen – nicht für beliebige Prompts.
- Der Fork ist unter github.com/UDPSendToFailed/ninfer-4090 öffentlich zugänglich; es handelt sich um kein offizielles NInfer-Release.
- Der Autor berichtet, dass ein früherer Post im r/LocalLLaMA-Megathread verschwand – der neue Standalone-Post soll bessere Sichtbarkeit sichern.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
NInfer-Fork: 250–350K Token Kontextfenster auf einer RTX 4090 mit Qwen 3.8 27B
Der Reddit-Nutzer UDPSendToFailed hat einen eigenen Fork des Inferenz-Frameworks NInfer veröffentlicht, der speziell auf die RTX 4090 mit 24 GB VRAM zugeschnitten ist. Zentrales Feature ist eine neue KV-Cache-Quantisierungsoption namens rk2v4-e8, die den Speicherbedarf des Kontextpuffers drastisch reduziert und so Kontextfenster von 250.000 bis 350.000 Token ermöglicht – abhängig davon, ob Vision-Support und Multi-Token-Prediction (MTP) aktiviert sind. Der gesamte Kontext verbleibt dabei vollständig im GPU-VRAM, ohne in den langsameren System-RAM auszuweichen. Als Zielmodell dient Qwen 3.8 27B, eines der leistungsfähigsten quant-freundlichen Open-Weight-Modelle seiner Größenklasse. Für kürzere Kontextfenster wurden zusätzlich Geschwindigkeitsoptimierungen vorgenommen, die bei repetitiven Aufgaben wie Code-Generierung oder Mathematik 80 bis 160 Tokens pro Sekunde erreichen. Der Fork ist auf GitHub unter dem Handle UDPSendToFailed/ninfer-4090 öffentlich verfügbar. Der Autor weist explizit darauf hin, dass das Projekt unter realen, „chaotischen" Workloads getestet wurde – ein erster Hinweis auf Stabilität, wenngleich es sich um ein Community-Projekt ohne formellen Release-Prozess handelt.
- rk2v4-e8 ist eine neue KV-Cache-Quantisierungsoption, die speziell für diesen Fork entwickelt wurde und den Haupthebel für das große Kontextfenster darstellt.
- Die erreichbare Kontextgröße (250K–350K Token) variiert je nach aktivierten Features: Vision-Support und Multi-Token-Prediction (MTP) reduzieren den verfügbaren Puffer.
- Geschwindigkeitsgewinn von 80–160 Tokens/s gilt explizit für repetitive Workloads (Code, Mathematik) bei geringeren Kontextlängen – nicht für beliebige Prompts.
- Der Fork ist unter github.com/UDPSendToFailed/ninfer-4090 öffentlich zugänglich; es handelt sich um kein offizielles NInfer-Release.
- Der Autor berichtet, dass ein früherer Post im r/LocalLLaMA-Megathread verschwand – der neue Standalone-Post soll bessere Sichtbarkeit sichern.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.