Qwen3.5 35B A3B Float8 läuft mit 55 tok/s auf RTX 5060 Ti
Warum es zählt
Consumer-Hardware (RTX 5060 Ti) kann damit ein 35B-MoE-Modell mit praxistauglicher Geschwindigkeit betreiben. MTP-Support ist noch nicht aktiv und könnte die Inferenz weiter beschleunigen.
— Lumeric Redaktion
55 tok/s
Qwen3.5 35B Float8 auf RTX 5060 Ti
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com1w
Qwen3 30B A3B mit 50 tok/s auf RTX 5060 Ti: Custom CUDA-Engine schlägt llama.cpp um 50%
- BENCHMARKreddit.com1w
Ternäres Qwen3.6 27B läuft mit 60 t/s auf einer RTX 3090
- MEINUNGreddit.com3d
Community-Thread: Hardware für 1000+ t/s Prefill mit Qwen3 35B Q4
- MEINUNGreddit.com1w
Qwen3.6 35B auf einer NVIDIA P40 mit 80 tok/s – Optimierungstipps aus der Community
Qwen3.5 35B A3B Float8 läuft mit 55 tok/s auf RTX 5060 Ti
Warum es zählt
Consumer-Hardware (RTX 5060 Ti) kann damit ein 35B-MoE-Modell mit praxistauglicher Geschwindigkeit betreiben. MTP-Support ist noch nicht aktiv und könnte die Inferenz weiter beschleunigen.
— Lumeric Redaktion
55 tok/s
Qwen3.5 35B Float8 auf RTX 5060 Ti
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com1w
Qwen3 30B A3B mit 50 tok/s auf RTX 5060 Ti: Custom CUDA-Engine schlägt llama.cpp um 50%
- BENCHMARKreddit.com1w
Ternäres Qwen3.6 27B läuft mit 60 t/s auf einer RTX 3090
- MEINUNGreddit.com3d
Community-Thread: Hardware für 1000+ t/s Prefill mit Qwen3 35B Q4
- MEINUNGreddit.com1w
Qwen3.6 35B auf einer NVIDIA P40 mit 80 tok/s – Optimierungstipps aus der Community