NInfer-Fork: 555k Kontext mit FP4 KV-Cache auf RTX 5090
Der NInfer-Fork wurde von einem Einzelentwickler in einer Woche intensiver Praxistests mit drei simultanen Claude-Code-Sessions stabilisiert — entstanden, weil upstream Issues und Pull Requests zu langsam aufgegriffen wurden. Das Herzstück ist ein komplett neu geschriebener NVFP4-KV-Cache für QIn3.8-27B mit einem eigenen MMA-Kernel (mma_nvfp4_e4m3, m16n8k64), der Hardware-E4M3-Blockscales für das QK-Matmul nutzt. Technisch unterscheidet er sich vom zwischenzeitlich nachgezogenen Upstream-NVFP4-Pfad vor allem durch Hadamard-Rotation auf K und Q zur Ausreißerunterdrückung, während V zur PV-Berechnung per dediziertem Decode-Kernel zu BF16 dequantisiert wird. Der fused-append-Mechanismus quantisiert K/V direkt während der Generierung ohne separaten Pass, was den Overhead minimiert. Für das Kontext-Management ersetzt das HostKVSafetyNet die upstream LRU-Lösung durch ein gepinntes Host-Arena-System mit Scatter-Gather-Allokation, Arena-Kompaktierung und einem zweistufigen Prefix-Matching — zuerst per Execution-Frontier, dann per Rewrite-Checkpoint-Fallback. Bei denkenden Modellen sorgt ein Session-Key-Fallback dafür, dass weggelassene Reasoning-Tokens zwischen Turns die Caching-Kette nicht brechen. Gemessen über 260+ Requests mit drei parallelen Sessions zwischen 330k und 470k Token wurden keinerlei Re-Prefills auf gecachten Turns registriert.
- Speicherbedarf des FP4-KV-Cache: 144 Bytes/Token/KV-Head (zum Vergleich: 264 Bytes bei int8, 512 Bytes bei BF16).
- YaRN-Erweiterung dehnt den nativen 262k-Kontext auf 555k Token (c=3+vision) bzw. 600k Token (c=1) auf einer RTX 5090; 8M-Token-Kontext auf GPUs mit 96+ GB VRAM ist projiziert, aber ungetestet.
- Cold-Start-Prefill für 414k Token dauert ca. 260 Sekunden bei 1.600 Token/s; H2D-Restore eines evakuierten Turns kostet ~0,4 s, D2H-Spill läuft mit 67.000 Pages/s.
- Tool-Calling-Erweiterung --tolerant-tool-calls rettet unvollständige Qwen-Aufrufe bei malformed Wrapper-/Suffix-Tokens und nutzt Depth-Matching für verschachtelte Parameter-Marker.
- Das enthaltene Froggeric-v22-Template ist ein C++-Renderer mit No-Dangling-Intent-Regel, XML-Think-Tags und korrekten Funktions-Tag-Delimitern für Qwen-Denkmodelle.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
NInfer-Fork: 555k Kontext mit FP4 KV-Cache auf RTX 5090
Der NInfer-Fork wurde von einem Einzelentwickler in einer Woche intensiver Praxistests mit drei simultanen Claude-Code-Sessions stabilisiert — entstanden, weil upstream Issues und Pull Requests zu langsam aufgegriffen wurden. Das Herzstück ist ein komplett neu geschriebener NVFP4-KV-Cache für QIn3.8-27B mit einem eigenen MMA-Kernel (mma_nvfp4_e4m3, m16n8k64), der Hardware-E4M3-Blockscales für das QK-Matmul nutzt. Technisch unterscheidet er sich vom zwischenzeitlich nachgezogenen Upstream-NVFP4-Pfad vor allem durch Hadamard-Rotation auf K und Q zur Ausreißerunterdrückung, während V zur PV-Berechnung per dediziertem Decode-Kernel zu BF16 dequantisiert wird. Der fused-append-Mechanismus quantisiert K/V direkt während der Generierung ohne separaten Pass, was den Overhead minimiert. Für das Kontext-Management ersetzt das HostKVSafetyNet die upstream LRU-Lösung durch ein gepinntes Host-Arena-System mit Scatter-Gather-Allokation, Arena-Kompaktierung und einem zweistufigen Prefix-Matching — zuerst per Execution-Frontier, dann per Rewrite-Checkpoint-Fallback. Bei denkenden Modellen sorgt ein Session-Key-Fallback dafür, dass weggelassene Reasoning-Tokens zwischen Turns die Caching-Kette nicht brechen. Gemessen über 260+ Requests mit drei parallelen Sessions zwischen 330k und 470k Token wurden keinerlei Re-Prefills auf gecachten Turns registriert.
- Speicherbedarf des FP4-KV-Cache: 144 Bytes/Token/KV-Head (zum Vergleich: 264 Bytes bei int8, 512 Bytes bei BF16).
- YaRN-Erweiterung dehnt den nativen 262k-Kontext auf 555k Token (c=3+vision) bzw. 600k Token (c=1) auf einer RTX 5090; 8M-Token-Kontext auf GPUs mit 96+ GB VRAM ist projiziert, aber ungetestet.
- Cold-Start-Prefill für 414k Token dauert ca. 260 Sekunden bei 1.600 Token/s; H2D-Restore eines evakuierten Turns kostet ~0,4 s, D2H-Spill läuft mit 67.000 Pages/s.
- Tool-Calling-Erweiterung --tolerant-tool-calls rettet unvollständige Qwen-Aufrufe bei malformed Wrapper-/Suffix-Tokens und nutzt Depth-Matching für verschachtelte Parameter-Marker.
- Das enthaltene Froggeric-v22-Template ist ein C++-Renderer mit No-Dangling-Intent-Regel, XML-Think-Tags und korrekten Funktions-Tag-Delimitern für Qwen-Denkmodelle.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.