
DeepSeek V4 Pro (1,6T-A49B) und Flash (284B-A13B) auf Huawei Ascend lauffähig
DeepSeek V4 erschien nach mehrmonatiger Verzögerung und intensiver Spekulation Ende April 2026 – der erste große Architektursprung seit DeepSeek-V3 (Dezember 2024) und DeepSeek-R1 (Januar 2025). Die Produktfamilie gliedert sich erstmals klar in zwei Tiers: V4 Pro mit 1,6 Billionen Gesamtparametern (49B aktiv) und V4 Flash mit 284B Gesamtparametern (13B aktiv), jeweils in Base- und Instruct-Variante unter MIT-Lizenz. Kernstück der technischen Weiterentwicklung ist ein neues Hybrid-Attention-System namens Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA), das den KV-Cache bei 1 Million Token-Kontext auf 9,62 GiB pro Sequenz reduziert – gegenüber 83,9 GiB bei DeepSeek-V3.2 eine Verkleinerung um den Faktor 8,7. Das Modell wurde auf 32–33 Billionen Tokens trainiert, was bei 1,6T Parametern etwa 20 Token pro Parameter ergibt; das Pretraining-Compute wird auf rund 1×10²⁵ FLOPs geschätzt. Checkpoints nutzen ein gemischtes Format: MoE-Expert-Gewichte in FP4, Attention-, Norm- und Router-Gewichte in FP8 – das Gesamtmodell soll auf einem einzelnen 8×B200-Knoten passen. Unabhängige Benchmarks ordnen V4 Pro auf Platz 2 der Open-Weights-Modelle ein, auf Augenhöhe mit Kimi K2.6 und GLM-5.1, jedoch noch hinter den führenden proprietären Frontier-Modellen. Der 58-seitige technische Bericht greift außerdem Erkenntnisse aus dem Manifold Constrained Hyper-Connections (mHC)-Paper auf und setzt Moonshots Muon-Optimierer fort.
- V4 Pro-Preise: 1,74 $/1M Input-Token bzw. 3,48 $/1M Output-Token; V4 Flash deutlich günstiger bei 0,14 $/0,28 $ pro 1M Token.
- Auf Blackwell-Ultra-Hardware liefert V4 Pro laut NVIDIA über 150 Token/Sekunde pro User – ausreichend für agentische Workflows.
- NVIDIA, SemiAnalysis und Together Compute veröffentlichten Day-0-Benchmarks auf H200, MI355, B200, B300 und GB200/300.
- DeepSeek-V4-Flash läuft laut @Prince_Canuma auf einem Mac mit 256 GB RAM; MLX-Quants wurden sofort veröffentlicht.
- Der technische Bericht umfasst 58 Seiten und wurde von mehreren Forschern als eines der am besten geschriebenen Modell-Paper des Jahres bezeichnet.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge

DeepSeek V4 Pro (1,6T-A49B) und Flash (284B-A13B) auf Huawei Ascend lauffähig
DeepSeek V4 erschien nach mehrmonatiger Verzögerung und intensiver Spekulation Ende April 2026 – der erste große Architektursprung seit DeepSeek-V3 (Dezember 2024) und DeepSeek-R1 (Januar 2025). Die Produktfamilie gliedert sich erstmals klar in zwei Tiers: V4 Pro mit 1,6 Billionen Gesamtparametern (49B aktiv) und V4 Flash mit 284B Gesamtparametern (13B aktiv), jeweils in Base- und Instruct-Variante unter MIT-Lizenz. Kernstück der technischen Weiterentwicklung ist ein neues Hybrid-Attention-System namens Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA), das den KV-Cache bei 1 Million Token-Kontext auf 9,62 GiB pro Sequenz reduziert – gegenüber 83,9 GiB bei DeepSeek-V3.2 eine Verkleinerung um den Faktor 8,7. Das Modell wurde auf 32–33 Billionen Tokens trainiert, was bei 1,6T Parametern etwa 20 Token pro Parameter ergibt; das Pretraining-Compute wird auf rund 1×10²⁵ FLOPs geschätzt. Checkpoints nutzen ein gemischtes Format: MoE-Expert-Gewichte in FP4, Attention-, Norm- und Router-Gewichte in FP8 – das Gesamtmodell soll auf einem einzelnen 8×B200-Knoten passen. Unabhängige Benchmarks ordnen V4 Pro auf Platz 2 der Open-Weights-Modelle ein, auf Augenhöhe mit Kimi K2.6 und GLM-5.1, jedoch noch hinter den führenden proprietären Frontier-Modellen. Der 58-seitige technische Bericht greift außerdem Erkenntnisse aus dem Manifold Constrained Hyper-Connections (mHC)-Paper auf und setzt Moonshots Muon-Optimierer fort.
- V4 Pro-Preise: 1,74 $/1M Input-Token bzw. 3,48 $/1M Output-Token; V4 Flash deutlich günstiger bei 0,14 $/0,28 $ pro 1M Token.
- Auf Blackwell-Ultra-Hardware liefert V4 Pro laut NVIDIA über 150 Token/Sekunde pro User – ausreichend für agentische Workflows.
- NVIDIA, SemiAnalysis und Together Compute veröffentlichten Day-0-Benchmarks auf H200, MI355, B200, B300 und GB200/300.
- DeepSeek-V4-Flash läuft laut @Prince_Canuma auf einem Mac mit 256 GB RAM; MLX-Quants wurden sofort veröffentlicht.
- Der technische Bericht umfasst 58 Seiten und wurde von mehreren Forschern als eines der am besten geschriebenen Modell-Paper des Jahres bezeichnet.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.