DeepSeek V4 Flash 0731: 27 t/s auf Strix Halo mit Vulkan und DSpark
Warum es zählt
Vulkan schlägt ROCm auf gfx1151 deutlich (22+ vs. 12,5 t/s Decode); q8_0 KV-Cache ist schneller als f16 bei langen Generierungen und verdoppelt den Kontext auf 131k. Konkrete Configs und Boot-Parameter machen den Aufbau reproduzierbar für Strix-Halo-Nutzer.
— Lumeric Redaktion
DeepSeek V4 Flash Decode (t/s) · Spitzenwert
15.7%
Strix Halo – ds4 upstream (kein DSpark)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com3w
DeepSeek V4 Flash auf M2 Ultra: 141 GiB lossless, 25,8 t/s
- BENCHMARKreddit.com0mo
DeepSeek V4 Flash 0731 auf Strix Halo: 1,39× Speed-up mit Speculative Decoding
- BENCHMARKreddit.com2w
Qwen3.8-27B mit DFlash2 auf RTX 4080: 86,7 tok/s bei 120k Kontext
- MEINUNGreddit.com3w
DeepSeek-V4-Flash-0731 lokal mit 23–24 Token/s auf Epyc + RTX 5090
DeepSeek V4 Flash 0731: 27 t/s auf Strix Halo mit Vulkan und DSpark
Warum es zählt
Vulkan schlägt ROCm auf gfx1151 deutlich (22+ vs. 12,5 t/s Decode); q8_0 KV-Cache ist schneller als f16 bei langen Generierungen und verdoppelt den Kontext auf 131k. Konkrete Configs und Boot-Parameter machen den Aufbau reproduzierbar für Strix-Halo-Nutzer.
— Lumeric Redaktion
DeepSeek V4 Flash Decode (t/s) · Spitzenwert
15.7%
Strix Halo – ds4 upstream (kein DSpark)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com3w
DeepSeek V4 Flash auf M2 Ultra: 141 GiB lossless, 25,8 t/s
- BENCHMARKreddit.com0mo
DeepSeek V4 Flash 0731 auf Strix Halo: 1,39× Speed-up mit Speculative Decoding
- BENCHMARKreddit.com2w
Qwen3.8-27B mit DFlash2 auf RTX 4080: 86,7 tok/s bei 120k Kontext
- MEINUNGreddit.com3w
DeepSeek-V4-Flash-0731 lokal mit 23–24 Token/s auf Epyc + RTX 5090