Triton-Backend für Falcon3-10B 1.58bit erreicht 97,5 tok/s auf RTX 5070
Warum es zählt
Das Backend kombiniert K-contiguous packed Ternary Weights, DP4A-Decode-Pfad, Triton-Kerneln und CUDA Graph Replay. Wer 1.58-Bit-Modelle lokal betreibt, kann damit erheblich höhere Decode-Raten erzielen – bisher aber nur auf einer GPU/Stack getestet, unabhängige Reproduktionen stehen aus.
— Lumeric Redaktion
Decode-Throughput (tok/s, Batch=1, RTX 5070) · Spitzenwert
97.51%
Triton Hybrid Packed Decode
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org1w
FastTPS beschleunigt LLM-Inferenz mit 6× Speed-up auf AMD NPU
- MEINUNGreddit.com1w
Community-Bericht: Ternary Bonsai 27B DFlash bringt keinen Speed-up unter ROCm
- BENCHMARKreddit.com1w
Ternäres Qwen3.6 27B läuft mit 60 t/s auf einer RTX 3090
- LAUNCHreddit.com6d
NInfer: 543 tok/s mit Qwen3.6-35B-A3B auf einer RTX 5090
Triton-Backend für Falcon3-10B 1.58bit erreicht 97,5 tok/s auf RTX 5070
Warum es zählt
Das Backend kombiniert K-contiguous packed Ternary Weights, DP4A-Decode-Pfad, Triton-Kerneln und CUDA Graph Replay. Wer 1.58-Bit-Modelle lokal betreibt, kann damit erheblich höhere Decode-Raten erzielen – bisher aber nur auf einer GPU/Stack getestet, unabhängige Reproduktionen stehen aus.
— Lumeric Redaktion
Decode-Throughput (tok/s, Batch=1, RTX 5070) · Spitzenwert
97.51%
Triton Hybrid Packed Decode
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org1w
FastTPS beschleunigt LLM-Inferenz mit 6× Speed-up auf AMD NPU
- MEINUNGreddit.com1w
Community-Bericht: Ternary Bonsai 27B DFlash bringt keinen Speed-up unter ROCm
- BENCHMARKreddit.com1w
Ternäres Qwen3.6 27B läuft mit 60 t/s auf einer RTX 3090
- LAUNCHreddit.com6d
NInfer: 543 tok/s mit Qwen3.6-35B-A3B auf einer RTX 5090