
DeepSeek V4: Frontier-nah bei einem Bruchteil der Kosten
DeepSeek hat mit V4-Pro und V4-Flash zwei Preview-Modelle veröffentlicht, die beide auf der Mixture-of-Experts-Architektur basieren und einen Kontextfenster von einer Million Token bieten. V4-Pro kommt auf 1,6 Billionen Gesamtparameter bei 49 Milliarden aktiven Parametern und ist damit laut Willison das derzeit größte Open-Weights-Modell – größer als Kimi K2.6 (1,1T) und GLM-5.1 (754B) sowie mehr als doppelt so groß wie das Vorgängermodell V3.2 mit 685 Milliarden Parametern. Die Gewichte belegen auf Hugging Face 865 GB (Pro) bzw. 160 GB (Flash). Möglich gemacht wird das niedrige Preismodell durch massive Effizienzgewinne: Laut dem begleitenden Paper benötigt V4-Pro im 1-Million-Token-Kontext nur 27 % der FLOPs und 10 % des KV-Cache-Speichers von V3.2; Flash kommt sogar auf nur 10 % der FLOPs und 7 % des KV-Cache. Preislich unterbietet V4-Flash mit 0,14 $/M Eingabe-Token sogar GPT-5.4 Nano (0,20 $), während V4-Pro bei 1,74 $/M Eingabe das günstigste der großen Frontier-Modelle ist – vor Gemini 3.1 Pro (2 $) und GPT-5.4 (2,50 $). Laut eigenen Benchmarks liegt V4-Pro-Max nahe an GPT-5.4 und Gemini-3.1-Pro, bleibt aber „marginal" dahinter – DeepSeek selbst beziffert den Rückstand gegenüber dem State-of-the-Art auf etwa drei bis sechs Monate. Willison testete beide Modelle über OpenRouter mit seinem llm-openrouter-Plugin und nutzte dabei den bekannten „Pelikan auf Fahrrad"-Prompt als informellen Qualitätsindikator.
- V4-Pro wiegt 865 GB auf Hugging Face; Willison hofft, ein leicht quantisiertes V4-Flash (160 GB) auf seinem 128-GB-M5-MacBook-Pro lokal betreiben zu können.
- Beide Modelle stehen unter der MIT-Lizenz – DeepSeek setzt damit seine Open-Weights-Strategie fort.
- Im 1M-Token-Kontext erreicht V4-Flash laut Paper nur 10 % der FLOPs und 7 % des KV-Cache-Verbrauchs von V3.2 – der entscheidende Hebel für die niedrigen API-Preise.
- Willison beobachtet huggingface.co/unsloth/models, da er erwartet, dass das Unsloth-Team zeitnah quantisierte Versionen beider Modelle veröffentlichen wird.
- Der Vorgänger V3.2 sowie V3.2 Speciale wurden laut Willison im Dezember 2025 veröffentlicht; V4 setzt die Nummerierungslinie direkt fort.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge

DeepSeek V4: Frontier-nah bei einem Bruchteil der Kosten
DeepSeek hat mit V4-Pro und V4-Flash zwei Preview-Modelle veröffentlicht, die beide auf der Mixture-of-Experts-Architektur basieren und einen Kontextfenster von einer Million Token bieten. V4-Pro kommt auf 1,6 Billionen Gesamtparameter bei 49 Milliarden aktiven Parametern und ist damit laut Willison das derzeit größte Open-Weights-Modell – größer als Kimi K2.6 (1,1T) und GLM-5.1 (754B) sowie mehr als doppelt so groß wie das Vorgängermodell V3.2 mit 685 Milliarden Parametern. Die Gewichte belegen auf Hugging Face 865 GB (Pro) bzw. 160 GB (Flash). Möglich gemacht wird das niedrige Preismodell durch massive Effizienzgewinne: Laut dem begleitenden Paper benötigt V4-Pro im 1-Million-Token-Kontext nur 27 % der FLOPs und 10 % des KV-Cache-Speichers von V3.2; Flash kommt sogar auf nur 10 % der FLOPs und 7 % des KV-Cache. Preislich unterbietet V4-Flash mit 0,14 $/M Eingabe-Token sogar GPT-5.4 Nano (0,20 $), während V4-Pro bei 1,74 $/M Eingabe das günstigste der großen Frontier-Modelle ist – vor Gemini 3.1 Pro (2 $) und GPT-5.4 (2,50 $). Laut eigenen Benchmarks liegt V4-Pro-Max nahe an GPT-5.4 und Gemini-3.1-Pro, bleibt aber „marginal" dahinter – DeepSeek selbst beziffert den Rückstand gegenüber dem State-of-the-Art auf etwa drei bis sechs Monate. Willison testete beide Modelle über OpenRouter mit seinem llm-openrouter-Plugin und nutzte dabei den bekannten „Pelikan auf Fahrrad"-Prompt als informellen Qualitätsindikator.
- V4-Pro wiegt 865 GB auf Hugging Face; Willison hofft, ein leicht quantisiertes V4-Flash (160 GB) auf seinem 128-GB-M5-MacBook-Pro lokal betreiben zu können.
- Beide Modelle stehen unter der MIT-Lizenz – DeepSeek setzt damit seine Open-Weights-Strategie fort.
- Im 1M-Token-Kontext erreicht V4-Flash laut Paper nur 10 % der FLOPs und 7 % des KV-Cache-Verbrauchs von V3.2 – der entscheidende Hebel für die niedrigen API-Preise.
- Willison beobachtet huggingface.co/unsloth/models, da er erwartet, dass das Unsloth-Team zeitnah quantisierte Versionen beider Modelle veröffentlichen wird.
- Der Vorgänger V3.2 sowie V3.2 Speciale wurden laut Willison im Dezember 2025 veröffentlicht; V4 setzt die Nummerierungslinie direkt fort.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.