FlashAttention-4 mit MXFP8 erreicht 2,85 PF/s auf Blackwell-GPUs
Warum es zählt
MXFP8-FA4 liefert 2,85 PF/s vorwärts und 2 PF/s rückwärts auf LLM-Shapes – mit fusionierter Quantisierung und einem End-to-End-FP8-Modul, das Overhead in Produktions-Trainingsläufen minimiert. Relevant für Teams, die Blackwell-Hardware für Large-Scale-Training nutzen.
— Lumeric Redaktion
2,85 PF/s
MXFP8 FA4 Forward auf Blackwell (LLM-Shapes)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org1w
FP4 FlashAttention-4: 2,13× BF16-Durchsatz auf NVIDIA GB200
- BENCHMARKreddit.com2w
FlashMLA sm_120-Kernel für Consumer-Blackwell: bis zu 3,3× schneller als SDPA
- FORSCHUNGarxiv.org3w
FlashAttention-V bringt 22×–42× Speedup auf skalierbare Vektorarchitekturen
- FORSCHUNGarxiv.org1w
UE5M3 FP4 Block Scaling ermöglicht stabileres LLM-Pretraining
FlashAttention-4 mit MXFP8 erreicht 2,85 PF/s auf Blackwell-GPUs
Warum es zählt
MXFP8-FA4 liefert 2,85 PF/s vorwärts und 2 PF/s rückwärts auf LLM-Shapes – mit fusionierter Quantisierung und einem End-to-End-FP8-Modul, das Overhead in Produktions-Trainingsläufen minimiert. Relevant für Teams, die Blackwell-Hardware für Large-Scale-Training nutzen.
— Lumeric Redaktion
2,85 PF/s
MXFP8 FA4 Forward auf Blackwell (LLM-Shapes)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org1w
FP4 FlashAttention-4: 2,13× BF16-Durchsatz auf NVIDIA GB200
- BENCHMARKreddit.com2w
FlashMLA sm_120-Kernel für Consumer-Blackwell: bis zu 3,3× schneller als SDPA
- FORSCHUNGarxiv.org3w
FlashAttention-V bringt 22×–42× Speedup auf skalierbare Vektorarchitekturen
- FORSCHUNGarxiv.org1w
UE5M3 FP4 Block Scaling ermöglicht stabileres LLM-Pretraining