Qwen3.8-27B auf 24GB RTX PRO 4000 Blackwell: 128K Kontext, 62 tok/s Decode
Der Reddit-Post dokumentiert einen detaillierten Praxistest von NInfer mit dem Modell Qwen3.8-27B auf einer NVIDIA RTX PRO 4000 Blackwell mit 24 GB VRAM. Der Tester wählte bewusst den 5060-Ti-Fork statt des 4090-Forks, weil die PRO 4000 auf der Blackwell-Architektur basiert und die Zielarchitektur sm_120a unterstützt – der Fork berechnet zudem das kooperative Scheduling anhand der tatsächlichen SM-Anzahl der GPU, statt eine 5090 vorauszusetzen. Ein zentrales Hindernis war ein veralteter System-NVCC, der sm_120a nicht kannte; erst nach explizitem Umschalten auf CUDA 13.3 ließ sich NInfer korrekt kompilieren. Ohne spekulative Dekodierung erreichte das Setup lediglich ~31 tok/s Decode; mit MTP3 (--draft-tokens 3, --lm-head-draft) stieg dieser Wert auf ~60 tok/s, was einem Faktor von etwa 1,9× entspricht. Der MTP3-Modus erreichte dabei eine Draft-Token-Akzeptanzrate von 64–68 % und durchschnittlich ~3 akzeptierte Token pro spekulativer Runde bei null Fallback-Schritten. Durch den Wechsel auf INT8-KV-Cache mit Gruppe 64 sank der VRAM-Bedarf pro Kontextfenster erheblich: Bei 128K reserviertem Kontext belegt der KV-Cache 4,38 GiB, und es verbleiben nur noch 727 MB freier VRAM – was das praktische Maximum für dieses Setup darstellt. Der Autor weist ausdrücklich darauf hin, dass die Tests kurze Prompts (~69 Token) verwendeten und die ~62 tok/s-Rate nicht für tatsächlich 128K lange Eingaben gilt. Als nächsten Schritt nennt er den E8-4-bit-KV-Cache, der auf derselben Hardware potenziell 262K Kontext ermöglichen könnte.
- sm_120a-Unterstützung: Die RTX PRO 4000 Blackwell erfordert den 5060-Ti-Fork von NInfer und CUDA 13.3; der System-NVCC unter /usr/bin/nvcc scheiterte am Compile-Ziel.
- Prefill-Rate blieb über alle Kontextgrößen stabil bei ~413–420 tok/s, unabhängig von KV-Cache-Typ oder Kontextfenster-Größe.
- Modellgewichte belegen 15,92 GiB; mit 128K INT8-KV-Cache ergibt sich ein geplantes Device-Total von 21,61 GiB bei 24 GB VRAM.
- MTP3-Akzeptanzrate stieg von 63,91 % (8K BF16) auf 68,37 % (32K INT8), mit durchschnittlich ~3,05 akzeptierten Tokens pro Runde.
- E8-4-bit-KV-Cache ist noch nicht auf den Blackwell-Branch portiert, wird aber als möglicher Weg zu 262K Kontext auf 24 GB genannt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Qwen3.8-27B auf 24GB RTX PRO 4000 Blackwell: 128K Kontext, 62 tok/s Decode
Der Reddit-Post dokumentiert einen detaillierten Praxistest von NInfer mit dem Modell Qwen3.8-27B auf einer NVIDIA RTX PRO 4000 Blackwell mit 24 GB VRAM. Der Tester wählte bewusst den 5060-Ti-Fork statt des 4090-Forks, weil die PRO 4000 auf der Blackwell-Architektur basiert und die Zielarchitektur sm_120a unterstützt – der Fork berechnet zudem das kooperative Scheduling anhand der tatsächlichen SM-Anzahl der GPU, statt eine 5090 vorauszusetzen. Ein zentrales Hindernis war ein veralteter System-NVCC, der sm_120a nicht kannte; erst nach explizitem Umschalten auf CUDA 13.3 ließ sich NInfer korrekt kompilieren. Ohne spekulative Dekodierung erreichte das Setup lediglich ~31 tok/s Decode; mit MTP3 (--draft-tokens 3, --lm-head-draft) stieg dieser Wert auf ~60 tok/s, was einem Faktor von etwa 1,9× entspricht. Der MTP3-Modus erreichte dabei eine Draft-Token-Akzeptanzrate von 64–68 % und durchschnittlich ~3 akzeptierte Token pro spekulativer Runde bei null Fallback-Schritten. Durch den Wechsel auf INT8-KV-Cache mit Gruppe 64 sank der VRAM-Bedarf pro Kontextfenster erheblich: Bei 128K reserviertem Kontext belegt der KV-Cache 4,38 GiB, und es verbleiben nur noch 727 MB freier VRAM – was das praktische Maximum für dieses Setup darstellt. Der Autor weist ausdrücklich darauf hin, dass die Tests kurze Prompts (~69 Token) verwendeten und die ~62 tok/s-Rate nicht für tatsächlich 128K lange Eingaben gilt. Als nächsten Schritt nennt er den E8-4-bit-KV-Cache, der auf derselben Hardware potenziell 262K Kontext ermöglichen könnte.
- sm_120a-Unterstützung: Die RTX PRO 4000 Blackwell erfordert den 5060-Ti-Fork von NInfer und CUDA 13.3; der System-NVCC unter /usr/bin/nvcc scheiterte am Compile-Ziel.
- Prefill-Rate blieb über alle Kontextgrößen stabil bei ~413–420 tok/s, unabhängig von KV-Cache-Typ oder Kontextfenster-Größe.
- Modellgewichte belegen 15,92 GiB; mit 128K INT8-KV-Cache ergibt sich ein geplantes Device-Total von 21,61 GiB bei 24 GB VRAM.
- MTP3-Akzeptanzrate stieg von 63,91 % (8K BF16) auf 68,37 % (32K INT8), mit durchschnittlich ~3,05 akzeptierten Tokens pro Runde.
- E8-4-bit-KV-Cache ist noch nicht auf den Blackwell-Branch portiert, wird aber als möglicher Weg zu 262K Kontext auf 24 GB genannt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.