Qwen3.8 Flash Next erreicht 1,2k t/s Prefill auf Strix Halo via llama.cpp-Fork
Warum es zählt
Der optimierte Open-Source-Fork schließt die Lücke zur geschlossenen Halogen-Lösung bei lokaler Inferenz. PRs sollen in mainline llama.cpp einfließen und auch GLM 5.3 Flash mit ähnlicher Sparse-Attention-Architektur profitieren.
— Lumeric Redaktion
Prefill-Throughput (t/s) auf Strix Halo · Spitzenwert
1200%
Halogen (closed-source)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com5d
Strix-Halo-Forks im Vergleich: ~1.400 t/s Prefill real, 60 t/s Decode nicht
- BENCHMARKreddit.com2w
Qwen3.8-Flash-Next: Von 36 auf 400 t/s Prefill mit zwei RTX 3060
- LAUNCHreddit.com2w
Llama.cpp-Fork führt adaptive Spekulation für schnellere Inferenz ein
- BENCHMARKreddit.com4d
Qwen3.8-Flash-Next: 2,2–2,5× schnelleres Prefill auf 2×RTX 3090 per VRAM-Trick
Qwen3.8 Flash Next erreicht 1,2k t/s Prefill auf Strix Halo via llama.cpp-Fork
Warum es zählt
Der optimierte Open-Source-Fork schließt die Lücke zur geschlossenen Halogen-Lösung bei lokaler Inferenz. PRs sollen in mainline llama.cpp einfließen und auch GLM 5.3 Flash mit ähnlicher Sparse-Attention-Architektur profitieren.
— Lumeric Redaktion
Prefill-Throughput (t/s) auf Strix Halo · Spitzenwert
1200%
Halogen (closed-source)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com5d
Strix-Halo-Forks im Vergleich: ~1.400 t/s Prefill real, 60 t/s Decode nicht
- BENCHMARKreddit.com2w
Qwen3.8-Flash-Next: Von 36 auf 400 t/s Prefill mit zwei RTX 3060
- LAUNCHreddit.com2w
Llama.cpp-Fork führt adaptive Spekulation für schnellere Inferenz ein
- BENCHMARKreddit.com4d
Qwen3.8-Flash-Next: 2,2–2,5× schnelleres Prefill auf 2×RTX 3090 per VRAM-Trick