FlashMLA sm_120-Kernel für Consumer-Blackwell: bis zu 3,3× schneller als SDPA
FlashMLA ist der von DeepSeek entwickelte optimierte Attention-Kernel für Multi-Latent-Attention (MLA), der bislang ausschließlich für Nvidias Datacenter-Architekturen sm_100 (Blackwell B200/GB200) und sm_90 (Hopper H100) kompiliert wurde. Der Reddit-Nutzer /u/smashedshanky hat die Lücke für Consumer-Hardware geschlossen: Sein Open-Source-Repository portiert FlashMLA auf sm_120 – die GPU-Architektur der GeForce-RTX-5000-Serie – und unterstützt dabei sowohl Windows als auch Linux. Hintergrund ist ein eigenes LLM-Trainings-Framework, das flexibel verschiedene Attention-Varianten (GQA, MLA, Dense) unterstützt und für das der Entwickler eine schnelle MLA-Implementierung benötigte. Die Benchmarks wurden mit konkreten Attention-Shapes aus DeepSeeks Modellarchitektur (192/128, H=22) durchgeführt und decken sowohl Inference- als auch Training-Workloads ab. Wichtig ist die Einschränkung des Entwicklers selbst: Auf Modell-Ebene erreicht BF16-Cache-Decode nur Parität mit SDPA, sodass die Kernel-Speedups nicht direkt als End-to-End-Modellbeschleunigung interpretiert werden sollten. Der größte Nutzen liegt bei attention-intensiven Workloads wie Long-Context-Training und Sparse Prefill. Das Repository ist öffentlich auf GitHub verfügbar.
- Portierung läuft auf sm_120 (RTX-5000-Consumer-Blackwell) unter Windows und Linux – GitHub: IISuperluminaLII/FlashMLA_Windows_Linux_sm120.
- Benchmarks nutzen die tatsächliche DeepSeek-Attention-Shape 192/128 mit H=22 für Forward+Backward-Messungen.
- Dense-Training bei S=8192: FlashMLA 9,911 ms vs. SDPA 30,105 ms → 3,04× Speedup; bei S=1024 sogar 3,29×.
- Sparse FP8-Decode (b=128, s_q=2, topk=2048): 0,809 ms vs. 2,118 ms → 2,62×; Sparse Serving (b=4, s_q=1) erreicht ~5× Speedup.
- Entwickler warnt explizit: BF16-Cache-Decode auf Modellebene läuft auf Parität – Kernel-Zahlen sind kein automatischer 3×-End-to-End-Gewinn.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
FlashMLA sm_120-Kernel für Consumer-Blackwell: bis zu 3,3× schneller als SDPA
FlashMLA ist der von DeepSeek entwickelte optimierte Attention-Kernel für Multi-Latent-Attention (MLA), der bislang ausschließlich für Nvidias Datacenter-Architekturen sm_100 (Blackwell B200/GB200) und sm_90 (Hopper H100) kompiliert wurde. Der Reddit-Nutzer /u/smashedshanky hat die Lücke für Consumer-Hardware geschlossen: Sein Open-Source-Repository portiert FlashMLA auf sm_120 – die GPU-Architektur der GeForce-RTX-5000-Serie – und unterstützt dabei sowohl Windows als auch Linux. Hintergrund ist ein eigenes LLM-Trainings-Framework, das flexibel verschiedene Attention-Varianten (GQA, MLA, Dense) unterstützt und für das der Entwickler eine schnelle MLA-Implementierung benötigte. Die Benchmarks wurden mit konkreten Attention-Shapes aus DeepSeeks Modellarchitektur (192/128, H=22) durchgeführt und decken sowohl Inference- als auch Training-Workloads ab. Wichtig ist die Einschränkung des Entwicklers selbst: Auf Modell-Ebene erreicht BF16-Cache-Decode nur Parität mit SDPA, sodass die Kernel-Speedups nicht direkt als End-to-End-Modellbeschleunigung interpretiert werden sollten. Der größte Nutzen liegt bei attention-intensiven Workloads wie Long-Context-Training und Sparse Prefill. Das Repository ist öffentlich auf GitHub verfügbar.
- Portierung läuft auf sm_120 (RTX-5000-Consumer-Blackwell) unter Windows und Linux – GitHub: IISuperluminaLII/FlashMLA_Windows_Linux_sm120.
- Benchmarks nutzen die tatsächliche DeepSeek-Attention-Shape 192/128 mit H=22 für Forward+Backward-Messungen.
- Dense-Training bei S=8192: FlashMLA 9,911 ms vs. SDPA 30,105 ms → 3,04× Speedup; bei S=1024 sogar 3,29×.
- Sparse FP8-Decode (b=128, s_q=2, topk=2048): 0,809 ms vs. 2,118 ms → 2,62×; Sparse Serving (b=4, s_q=1) erreicht ~5× Speedup.
- Entwickler warnt explizit: BF16-Cache-Decode auf Modellebene läuft auf Parität – Kernel-Zahlen sind kein automatischer 3×-End-to-End-Gewinn.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.