DeepSeek — Juli 2026
80 Beiträge im Juli 2026.
- LAUNCH31. JuliDeepSeek v4 Flash GGUF mit DSpark MTP Head für DS4 DwarfStar EngineWer DeepSeek v4 Flash lokal betreibt, kann mit DS4 DwarfStar und diesem Quant die Decode-Geschwindigkeit gegenüber llama.cpp verdoppeln und erhält zusätzlich persistenten KV-Cache auf SSD sowie einen OpenAI-kompatiblen API-Endpunkt – relevant für agentic Workflows auf Consumer-Hardware.
- MEINUNG31. JuliSimon Willison im Oxide-Podcast: Open-Weight-Revolution und KI-SicherheitDer Podcast beleuchtet, warum Open-Weight-Modelle wie Kimi K3 nun mit proprietären Frontier-Modellen mithalten – relevant für AI-Builder, die Build-vs.-Buy-Entscheidungen treffen. Zusätzlich werden aktuelle Sicherheitsvorfälle (u. a. OpenAIs versehentlicher Cyberangriff auf Hugging Face) als Warnsignal für Infrastrukturrisiken thematisiert.
- LAUNCH31. JuliDeepSeek V4 Flash: günstiges Open-Weight-Modell für $0,09/$0,18 pro 1M TokenMit über 50× günstigerem Pricing als vergleichbare Top-Modelle senkt DeepSeek V4 Flash die Inferenzkosten drastisch – interessant für alle, die leistungsfähige Open-Weight-Modelle API-seitig einsetzen und Kosten optimieren wollen.
- LAUNCH31. JuliDeepSeek IQ3-Quantisierungen veröffentlicht: Q1, Q2 und Q3 verfügbarNeue IQ3-Quants (Q1/Q2/Q3) für DeepSeek erweitern die Möglichkeiten zur speichereffizienten lokalen Inferenz. Konkrete Qualitäts- oder Größenangaben sind dem Post nicht zu entnehmen; Mehrwert hängt von den tatsächlichen Benchmark-Ergebnissen ab.
- MEINUNG31. JuliDeepSeek V4 Flash zwingt Konkurrenz zu 80% PreissenkungDeepSeek V4 Flash mit 13B aktiven Parametern setzt offenbar neue Maßstäbe beim Preis-Leistungs-Verhältnis und zwingt kommerzielle Anbieter zu drastischen Preissenkungen — relevant für alle, die LLM-API-Kosten in Produkten kalkulieren.
- MEINUNG31. JuliReddit-Analyse: Modellgrößen-Trend deutet auf Consumer-Laptops mit Top-Modellen hinDeepSeek V4 Flash ist laut Post smart genug und klein genug für ein ~50.000-Dollar-Setup – kein Rechenzentrum nötig. Wenn der Miniaturisierungstrend anhält, könnten Top-Modelle bald auf regulären MacBooks lauffähig sein, was lokale Inferenz für Entwickler deutlich attraktiver macht.
- BENCHMARK31. JuliDeepSeek V4 Flash zeigt deutliche Stärken im UI/UX-DesignFür AI-Builder im Frontend-Bereich könnte DeepSeek V4 Flash ein relevantes Modell für Code- und Design-Generierung sein — der hohe Token-Verbrauch erhöht jedoch die Inferenzkosten. Konkreter Mehrwert ohne ausführlichen Testbericht schwer beurteilbar.
- BENCHMARK31. JuliDeepSeek-V4-Flash-0731 läuft verlustfrei auf einzelner A100 mit 17,7 tok/sMoE-Modell dieser Größe lässt sich verlustfrei auf einer einzigen Consumer-nahen GPU betreiben – mit Codex als agentic-Coding-Frontend bereits produktiv einsetzbar. Für lokale Inferenz-Setups mit A100 ist kein Multi-GPU-Setup nötig.
- MEINUNG31. JuliDeepSeek Flash 0731: Expressiver Reasoning-Trace sorgt für BelustigungDer Clip zeigt, wie Reasoning-Modelle zunehmend menschlich-expressive Denkspuren produzieren – was Fragen zur Kontrollierbarkeit und zum Training solcher Traces aufwirft.
- MEINUNG31. JuliDeepSeek-V4-Flash: Community-Review lobt Reasoning auf par mit Mimo2.5 ProDas Modell überzeugt laut Review bei langen Kontexten (200K) durch konsistentes Reasoning und zuverlässige Tool-Calls, was es für agentenbasierte Workflows interessant macht. Beim Code-Schreiben bleibt es laut Nutzer hinter größeren Modellen zurück.
- MEINUNG31. JuliLektion über Retries im DeepSeek-V4-Paper entdecktDas DeepSeek-V4-Paper enthält offenbar praxisrelevante Erkenntnisse zu Retry-Mechanismen, die für den Betrieb und die Robustheit von LLM-Systemen relevant sein könnten. Konkreter Mehrwert ohne Volltext nicht abschließend beurteilbar.
- BENCHMARK31. JuliDeepSeek V4 Flash auf SlopCodeBench: zwischen Claude Opus 4.8 und 5DeepSeek V4 Flash scheint eine wettbewerbsfähige Coding-Leistung zu bieten und könnte nach Erscheinen von Q2-Quants auch lokal auf Consumer-Hardware (MacBook) relevant werden.
- LAUNCH31. JuliDeepSeek-V4-Flash-0731 GGUF-Quantisierung verfügbarGGUF-Verfügbarkeit ermöglicht lokales Ausführen von DeepSeek-V4-Flash-0731 ohne Cloud-Abhängigkeit – relevant für Entwickler, die das Modell auf Consumer-Hardware betreiben wollen.
- GERÜCHT31. JuliCommunity fragt: Wann kommen DeepSeek-Gewichte?Ohne veröffentlichte Gewichte können Entwickler das neue DeepSeek-Modell nicht lokal betreiben oder fine-tunen. Konkreter Zeitplan ist bislang unbekannt.
- GERÜCHT31. JuliCommunity diskutiert mögliche DeepSeek V4 Distillationen für kleinere ModelleSollte DeepSeek V4 Distillate veröffentlichen, würden leistungsstarke Modelle für lokale Nutzung zugänglich – ähnlich wie die R1-Distillate. Aktuell ist dies reine Spekulation ohne bestätigte Pläne.
- BENCHMARK31. JuliDeepSeek V4-Flash erreicht 50 Punkte auf ArtificialAnalysis IndexDeepSeek V4-Flash positioniert sich nahe an GPT-5.6 Luna und GLM-5.2 auf dem ArtificialAnalysis Index – relevant für Entwickler, die leistungsstarke und potenziell günstigere Alternativen zu führenden Frontier-Modellen evaluieren.
- LAUNCH31. JuliDeepSeek V4 Flash auf Vercel AI Gateway mit neuen Weights und 82,7 auf Terminal-BenchFür AI-Builder bedeutet das sofortige Verbesserung agentischer Fähigkeiten ohne Migration oder Model-ID-Wechsel. Derzeit liefert nur DeepSeek die neuen Weights; weitere Provider mit Zero Data Retention folgen in der nächsten Woche.
- GERÜCHT31. JuliDeepSeek-V4-Flash-0731 soll GLM 5.2 übertreffen – bei gleichem PreisEin leistungsstärkeres Modell zum unveränderten Preis erhöht den Kostendruck auf andere Anbieter. Wer GLM 5.2 nutzt, sollte einen Wechsel auf DeepSeek-V4-Flash-0731 evaluieren.
- GERÜCHT31. JuliReddit-User prognostiziert DeepSeek V4 Flash 0731 Score bei ~57 PunktenFalls die Prognose zutrifft, läge DeepSeek V4 Flash 0731 qualitativ auf Augenhöhe mit Kimi K3 – bei mutmaßlich deutlich niedrigerem Preis. Konkrete offizielle Benchmark-Werte stehen jedoch noch aus; die Schätzung basiert auf Community-Analyse, nicht auf Herstellerdaten.
- BENCHMARK31. JuliDeepSeek V4 Flash 0731 übertrifft GPT-5.6 Terra auf Toolathlon um 17 PunkteDeepSeek V4 Flash 0731 schlägt GPT-5.6 Terra auf Tool-Use-Benchmarks (Toolathlon +17,2), schwächelt aber bei Agentic-Tasks (Agents' Last Exam −25,2). Für Builder relevant: Modellwahl hängt stark vom Task-Typ ab.
- LAUNCH31. JuliDeepSeek-V4-Flash aktualisiert, V4-Pro-Release angekündigtDeepSeek-V4-Pro steht kurz vor dem offiziellen Release – Entwickler, die auf DeepSeek-Modelle setzen, sollten die API-Changelog-Seite im Blick behalten und auf mögliche API-Änderungen vorbereitet sein.
- FORSCHUNG30. JuliDistillation von DeepSeek V4 überträgt keine Zensur auf GPT-OSS-ModelleEntwickler, die chinesische Lehrermodelle zur Destillation nutzen, können laut dieser Studie nicht davon ausgehen, dass Zensurverhalten mitübertragen wird – sofern Lehrer und Schüler unterschiedliche Gewichts-Initialisierungen haben. Das Open-Source-Framework LineageEval erlaubt künftig auditierbare Messungen dieses Effekts.
- BENCHMARK30. JuliAMD Lucebox schlägt Nvidia DGX Spark um 3,63× bei DeepSeek V4 Flash DecodeFür AI-Builder zeigt das Setup, dass heterogene Consumer-Hardware (GPU + APU mit großem Unified Memory) proprietäre Hochleistungssysteme bei Inferenz großer MoE-Modelle deutlich übertreffen kann. Aktuell noch experimentell (Q2, 16k Kontext); KVFlash für 64k–128k Kontext ist in Arbeit.
- MEINUNG30. JuliChinas Open-Weight-Strategie als klassische Soft-Power-PolitikWer auf chinesische Open-Weight-Modelle setzt, trägt zur Verbreitung chinesischer technischer Standards und Ökosysteme bei. Das ist keine Verschwörung, aber ein bewusster geopolitischer Mechanismus, den AI-Builder bei ihrer Modellwahl kennen sollten.
- MEINUNG30. JuliCommunity diskutiert beste lokale Modelle für NVIDIA GB10/DGX SparkFür lokale Inferenz auf GB10/DGX Spark gilt Qwen 3.6 27B laut Community weiterhin als zuverlässiger Allrounder. DeepSeek V4 Flash und Laguna S 2.1 sind mögliche Alternativen, aber noch mit Einschränkungen bei Geschwindigkeit bzw. Qualität.
- BENCHMARK29. JuliPoolside Laguna S 2.1: 118B-Modell übertrifft Trillion-Parameter-Systeme auf Coding-BenchmarksMit 13-fachem Parameterdefizit und trotzdem 4-facher Score-Überlegenheit auf DeepSWE stellt Laguna die Annahme „mehr Parameter = bessere Coding-Leistung" grundlegend in Frage. Poolside hat alle Evaluierungs-Trajektorien veröffentlicht, was die Nachvollziehbarkeit der Ergebnisse ermöglicht.
- LAUNCH28. JuliLoRA-Training von DeepSeek-V4-Flash (284B) in 90 GB VRAM ohne CPU-OffloadingFine-Tuning sehr großer MoE-Modelle wird damit ohne CPU-Offloading auf Consumer-/Prosumer-Hardware realisierbar. Die GGUF-Integration in PyTorch öffnet zudem den Weg für modellchirurgische Eingriffe wie Abliteration ohne vollständige Modellkonvertierung.
- BENCHMARK28. JuliSWE-rebench Multilingual: GLM-5.2 führt mit 62,9% Pass@1 vor DeepSeek-V4 ProFür Coding-Agent-Entwickler liefert das neue mehrsprachige Benchmark reale Vergleichswerte über 5 Sprachen. GLM-5.2 und MiMo V2.5 Pro zeigen starke Alternativen zu DeepSeek-V4 Pro (40,2%), das deutlich zurückfällt.
- BENCHMARK28. JuliDeepSeek V4 Flash erreicht 32 tok/s auf AMD Ryzen AI MAX+ 395Mit dem eigens entwickelten ROCmFPX-Mixed-Precision-Format (2,88 bit/Parameter, 102,3 GB) lässt sich ein 284B-Modell auf Consumer-Hardware mit 128 GB Unified Memory betreiben. Das zeigt einen konkreten Weg für On-Device-Inference großer MoE-Modelle auf AMD-Systemen ohne dedizierte GPU.
- LAUNCH28. Julillama.cpp: CUDA-SSD-Matmul und Metal-FWHT-Kernel beschleunigen InferenzWer Mamba-2-Modelle lokal betreibt, profitiert bei längeren Kontexten (ab 256 Tokens) von bis zu 22% mehr Durchsatz. Apple-Silicon-Nutzer erhalten mit dem FWHT-Kernel bis zu 3,5% schnellere Inferenz für quantisierte Modelle ohne Konfigurationsaufwand.
- LAUNCH28. JuliDSpark Speculative Decoding landet in llama.cpp via Pull RequestNutzer von llama.cpp können DSpark-kompatible Modelle (z.B. DeepSeek-V4-Pro-DSpark) einsetzen, um durch spekulatives Dekodieren höhere pp/tg-Durchsatzraten zu erzielen. Der PR ist frisch gemergt – konkrete Speedup-Zahlen aus der Community stehen noch aus.
- LAUNCH28. Julillama.cpp: Chat-Template für DeepSeek-V4 manuell aktualisierenWer DeepSeek-V4 lokal als Coding-Agent betreibt, muss das Chat-Template manuell überschreiben – ohne Fix verhält sich das Modell in Agentenaufgaben deutlich schlechter.
- MEINUNG27. JuliCommunity-Check: AMD AI PRO R9700 Performance für lokale LLMsNutzer mit 4× R9700 könnten laut Post in den Bereich von DeepSeek-4-Flash-Inferenz vordringen – konkrete PP/TG-Zahlen aus der Community helfen, das reale Preis-Leistungs-Verhältnis dieser Budget-Karten für lokale Inferenz einzuschätzen.
- BENCHMARK26. JuliHarness-Vergleich: Claude Code vs. OpenCode vs. Pi mit DeepSeek V4 FlashDie Wahl des Coding-Harnesses beeinflusst bei gleichem Modell nicht die Codequalität, aber massiv Latenz und Ressourcenverbrauch. Claude Code exploriert Codebasen intensiv, Pi reasont eigenständig, OpenCode delegiert – relevant für Effizienzoptimierung in lokalen Setups.
- LAUNCH26. JuliTTS-Studio: Desktop-GUI für lokale TTS-Modelle mit Kokoro und ChatterboxDas Tool ermöglicht den einfachen Wechsel zwischen lokalen TTS-Engines ohne Overhead. Voice Cloning via Referenz-Audio und automatisches Text-Chunking lösen typische Schwächen kleiner TTS-Modelle bei längeren Texten praktisch ab.
- LAUNCH26. JuliSechs bemerkenswerte Open-Weight-Modelle: Von 1B bis 314B im ÜberblickLaguna S 2.1 läuft mit unter 80 GB RAM auf einem DGX Spark und könnte als Qwen3-35B-Ersatz im Alltag taugen. BTL-3 zeigt, dass LoRA-Adapter (Rank 32) für Coding-Agents weiterhin wettbewerbsfähige Benchmark-Ergebnisse liefern.
- MEINUNG25. JuliCommunity debattiert: DeepSeek V4 Flash, Hy3 oder Qwen3 27B für Coding-Agenten?Für lokale AI-Builder relevant: Die Community bezweifelt Laguna-Benchmarks und sucht praxiserprobte Alternativen für Coding-Agenten. Qwen3 27B gilt weiterhin als solider Baseline, während V4 Flash und Hy3 noch unbewiesen scheinen.
- MEINUNG25. JuliCommunity-Diskussion: Mittlere MoE-Modelle bis 60B Parameter im VergleichFür Nutzer mit begrenztem VRAM zeigt die Diskussion, welche MoE-Modelle im mittleren Parameterbereich praktisch einsetzbar sind. Qwen 3.5 35B wird als Leistungsführer in diesem Segment eingeschätzt.
- MEINUNG25. JuliCommunity-Diskussion: Günstigste zuverlässige API-Anbieter für Open-Source-ModelleFür AI-Builder, die kostengünstig Trainingsdaten synthetisch erzeugen wollen, liefert der Thread praxisnahe Community-Empfehlungen zu Preis-Leistungs-Verhältnis verschiedener Inference-Anbieter für Open-Source-Modelle.
- MEINUNG24. JuliPraxisbericht: Laguna S2.1 glänzt bei komplexem Debugging, nicht als PlanerLaguna S2.1 kann lokal eine Nische füllen als spezialisiertes Debug-Modell für Fälle, in denen kleinere Generalisten wie Qwen 3.6 27B oder Claude-Modelle oberflächliche Fixes liefern. Für Planungs- und Bulk-Agentic-Tasks bleibt DeepSeek/Qwen die bessere Wahl.
- MEINUNG24. JuliCommunity-Diskussion: Spezialisierte Kleinmodelle statt MoE-ArchitekturenDie Frage berührt einen realen Trade-off: Spezialisierte Modelle existieren bereits (z.B. Codestral, DeepSeek-Coder), doch generalisierte MoEs bieten Flexibilität bei ähnlicher Inferenzeffizienz. Für AI-Builder relevant bei der Modellauswahl für enge Anwendungsfälle.
- LAUNCH23. JuliDeepSeek V4 Flash mit ~105 t/s auf zwei Nvidia 4090d 48G via vLLMDie Triton-Reimplementierung ermöglicht vLLM-Betrieb von DeepSeek V4 Flash auf Ada-Lovelace-Hardware (SM89) ohne Blackwell-Pflicht — 2–3× höherer Durchsatz gegenüber llama.cpp bei parallelen Agentic-Workflows und 262k Kontext.
- MEINUNG23. JuliDeepSeek V4 Flash DSpark überzeugt auf Dual DGX Spark als Coding-AssistentFür AI-Builder zeigt dies, dass lokale DeepSeek-V4-Flash-Deployments auf Consumer-naher Dual-GB10-Hardware produktionstaugliche Coding-Assistenz liefern können – ohne Cloud-Abhängigkeit und mit hoher Inferenzgeschwindigkeit.
- FORSCHUNG23. JuliSilia-v2: 0,5M-Parameter-Modell auf HellaSwag, PIQA und LAMBADA benchmarktSilia-v2 kombiniert DeepSeek MLA, Qwen HydraHead und Apples Attention Free Transformer, um den 2–2,5-fachen Compute-Overhead der Vorgängerversion zu beseitigen. Die Architektur zeigt, wie Tiny-Scale-Modelle mit modernen Effizienz-Techniken optimiert werden können.
- FUNDING23. JuliAI-Chip-Startup Etched erreicht 10,3-Mrd.-Dollar-Bewertung nach Series-C-RundeEtched hat bereits 1 Mrd. Dollar an Bestellungen gebucht und testet erste Rack-Systeme mit großen AI-Unternehmen. Die proprietären Prefill- und Decode-Chips versprechen schnellere und günstigere Inferenz – relevant für alle, die LLM-Inferenzkosten optimieren wollen.
- LAUNCH23. JuliNota AI komprimiert 250B-Modell auf 32B via REAP-PruningEin auf 32B geprungtes Modell, das laut Hersteller ein deutlich größeres Frontier-Modell schlägt, ist für lokale Deployments relevant – falls die Benchmarks halten, wäre das ein attraktives Verhältnis von Leistung zu Ressourcenbedarf.
- MEINUNG23. JuliCommunity-Diskussion: Minimax 2.7, DeepSeek V4 Flash und Laguna S 2.1 im VergleichFür Entwickler mit High-End-Hardware (192 GB VRAM) sind Modellwahl und Kosten-Qualitäts-Verhältnis bei langen Agentic-Coding-Workflows entscheidend. Die Community-Antworten können praktische Erfahrungswerte zu diesen drei Modellen liefern.
- MEINUNG23. JuliLittle Tech Association: 200 Startups gegen Verbot chinesischer Open-Weight-KIEin Verbot chinesischer Open-Weight-Modelle wie DeepSeek würde die Wahlmöglichkeiten für Entwickler und Startups beim lokalen Betrieb von LLMs erheblich einschränken. Das Lobbying signalisiert, dass ein solches Verbot politisch ernsthaft diskutiert wird.
- MEINUNG23. JuliKimi K3: Experten zweifeln an Distillations-These gegen MoonshotReinforcement Learning verdrängt laut Forschern zunehmend einfaches SFT-Distillation als Quelle von Modellfähigkeiten – chinesische Frontier-Labs entwickeln demnach echte technische Kompetenz. Gleichzeitig rückt illegaler Chip-Schmuggel und fehlende KYC-Pflichten für Rechenzentren als Kernproblem in den Vordergrund.
- MEINUNG23. JuliArcee AI spricht sich gegen US-Verbot chinesischer Open-Source-Modelle ausDie Debatte um ein Verbot chinesischer Open-Source-Modelle (z.B. DeepSeek) betrifft direkt die Verfügbarkeit von Basismodellen für lokale und kommerzielle Deployments in den USA. Westliche Anbieter wie Arcee, Cohere und Mistral könnten regulatorisch unter ähnlichen Sicherheitsargumenten unter Druck geraten.
- MEINUNG23. JuliDeepSeek-Gründer: AGI-Fokus vor Kommerzialisierung und NutzerwachstumDeepSeek wird keine eigenen Consumer- oder Enterprise-Produkte priorisieren und bleibt vollständig Open Source – die veröffentlichten Modelle sind identisch mit den intern genutzten. Für AI-Builder bedeutet das weiterhin Zugang zu State-of-the-Art-Modellen ohne geschlossene Konkurrenzversion.
- MEINUNG23. JuliMoE-Modelle mit ~2B aktiven Parametern: eine übersehene MittelklasseFür AI-Builder mit CPU-only-Setup oder GPUs im 4–12 GB-Bereich könnten A2B-MoE-Modelle eine effiziente Alternative zu dichten 4–9B-Modellen sein, da sie bei ähnlichem Ressourcenbedarf potenziell höhere Kapazität bieten.
- LAUNCH22. JuliArcee AI und US-Energieministerium entwickeln 1-Billion-Parameter Open-Weight-Modell für WissenschaftGS1 bietet Institutionen wie Laboren, Krankenhäusern und Universitäten ein quelloffen gehaltenes, US-amerikanisches Trillion-Parameter-Modell, das lokal betrieben und langfristig stabil gehalten werden kann – ohne Abhängigkeit von Cloud-APIs oder ausländischen Trainingsinfrastrukturen.
- LAUNCH22. JuliCactus Hybrid: Gemma 4 E2B erkennt eigene Fehler via Probe-LayerEntwickler können hybride On-Device/Cloud-Pipelines bauen, die nur bei niedrigem Confidence-Score an ein Frontier-Modell eskalieren – die Probe erreicht 0.814 AUROC vs. 0.549 für Token-Entropy und funktioniert ohne Audio-Training-Daten auch auf Audio-Benchmarks.
- FORSCHUNG22. JuliStudie: Kein Hinweis auf Benchmark-Overfitting beim Pelikan-SVG-TestPelikane landen trotz Benchmark-Prominenz auf Platz 6 von 8 Tieren, Fahrräder auf dem vorletzten Platz – kein Muster, das auf gezieltes Overfitting hindeutet. Für Eval-Design zeigt die Studie aber, wie ein einfacher Generalisierungstest (gleiche Prompt-Struktur, variierte Entitäten) Benchmark-Gaming sichtbar machen kann.
- MEINUNG22. JuliOpen-Model-Recap: Kimi K3, Qwen, Distillation und die Lücke zu Closed-Frontier-ModellenDie Lücke zwischen Open- und Closed-Frontier-Modellen ist benchmark-abhängig und politisch aufgeladen – wer die Lücke misst, bestimmt das Narrativ. Kimi K3 und kommende chinesische Open-Weight-Modelle könnten durch gezieltes Post-Training für spezifische Aufgaben schnell aufschließen, erfordern aber enorme Hardware (ein Node B300s nur zum Laden der Gewichte).
- BENCHMARK22. JuliEncode Bench: Base64-Generierung korreliert 0.91 mit AI Intelligence IndexBase64-Ausgabe als indirekter Kompetenztest: Modelle müssen Problem lösen, Ergebnis exakt erhalten und korrekt enkodieren – ein Fehler bricht das Ergebnis. GPT-5.6 Sol erreicht 97.2%, Gemma 4 26B nur 23.6%. Für Evals-Praktiker interessant, aber Stichprobengröße (9 Modelle, 24 Tasks) verlangt Vorsicht.
- BENCHMARK22. JuliUpstage Solar Open 2 erscheint: MoE-Modell auf Augenhöhe mit DeepSeek V4 FlashSolar Open 2 bietet bei nur 15B aktiven Parametern MMLU-Pro 86.2, SWE-Bench Verified 70.4 und AIME2026 95.7 — lokal lauffähige MoE-Architektur auf Top-Tier-Niveau, relevant für kostengünstige Inferenz-Deployments.
- MEINUNG21. JuliDeepSeek-V4-Flash auf B300: Nur 770 tok/s bei Batch-Inferenz in vLLMDer schnelle MoE-Kernel (deep_gemm_mega_moe) erfordert Expert Parallelism und läuft nicht auf Single-GPU. Wer DeepSeek-V4-Flash auf einer einzelnen B300 betreibt, muss auf langsamere Backends (flashinfer_trtllm) ausweichen und verliert möglicherweise CUDA-Graph-Optimierungen für MLA – das ist relevant für Deployment-Planung.
- LAUNCH21. JuliLaguna S 2.1 erscheint: 118B-A8B-Modell schlägt DeepSeek V4 Pro auf SWE-BenchMit 70,2 % auf Terminal-Bench 2.1 und 78,5 % auf SWE-bench Verified bei niedrigeren Kosten als DeepSeek V4 Flash könnte Laguna S 2.1 eine attraktive lokale Option für Coding-Agenten auf High-End-Hardware sein.
- LAUNCH21. JuliLast Week in AI #251: Claude Sonnet 5, Etched, LongCat 2.0 und mehrClaude Sonnet 5 mit vergünstigtem Einstiegspreis und verbesserter Agentic-Coding-Performance ist direkt für AI-Builder relevant. Dazu liefert die Episode Überblicke zu Etched-Inferenz-Hardware, LongCat 2.0 sowie neuen Agent-Benchmarks wie OSWorld 2.0 und SWE-Together.
- FORSCHUNG21. JuliReasoning-Destillation: Warum einfaches Trace-Imitation bei kleinen Modellen funktioniertKleine Modelle können durch reine Next-Token-Prediction auf hochwertigen Reasoning-Traces deutlich stärkere Reasoning-Fähigkeiten entwickeln, als ihre Größe erwarten lässt. Das reduziert den Aufwand für RL-basierte Ansätze erheblich und macht leistungsstarke Reasoning-Modelle mit Standard-SFT-Pipelines erreichbar.
- MEINUNG21. JuliKimi K3 und chinesische Open-Weight-Modelle gefährden US-KI-FührungEnterprise-Kunden wechseln zu token-effizienteren chinesischen Open-Weight-Modellen, was den Preisdruck auf US-Anbieter wie OpenAI und Anthropic massiv erhöht. Routing-Infrastruktur (z. B. Databricks) gewinnt an Bedeutung, während Frontier-Modell-Verbote durch die Trump-Administration neue Compliance-Risiken für AI-Builder schaffen.
- LAUNCH21. JuliLoRA-Training von Qwen3.6-35B-A3B mit 16 GB VRAM via GGUFEntwickler können große MoE-Modelle mit Consumer-GPUs (z. B. RDNA3) feintunen, ohne teure High-VRAM-Hardware. GGUF als Trainingsformat könnte bitsandbytes als Standard für Low-VRAM-LoRA ablösen; torch-ggml-ops liefert dafür PyTorch-Bindings.
- LAUNCH21. JuliMotif 3 Beta: Südkoreanisches MoE-Modell mit 314B-A13B veröffentlichtMotif 3 Beta ist deutlich kompakter als Konkurrenten wie DeepSeek V4 Pro (1,6T-A49B) und MiniMax-M3 (428B-A23B), was lokalen Betrieb mit weniger Hardware ermöglicht. Für Teams, die Open-Weight-MoE-Modelle lokal deployen, ist es ein potenziell ressourcenschonendere Alternative aus dem koreanischen Ökosystem.
- MEINUNG20. JuliCommunity sucht Paper zu Kimi K3-Technologien: Stable LatentMoE und Gated MLAStable LatentMoE (sparseres MoE via Quantile Balancing) und Gated MLA (KV-Cache-Kompression) sind laut Community noch nicht vollständig dokumentiert — wer Kimi K3-Architekturen nachvollziehen oder reproduzieren will, findet bisher keine vollständigen Paper-Referenzen.
- MEINUNG20. JuliZweiter KI-Beauftragter unter Trump tritt nach drei Monaten zurückCAISI, die zentrale US-Behörde für KI-Standards und Modelltests, verliert erneut ihre Führung – inmitten aktiver Debatten um chinesische Open-Weight-Modelle und Exportkontrollen. Die fehlende Kontinuität gefährdet den Aufbau verlässlicher Evaluierungsprozesse für Frontier-Modelle.
- MEINUNG20. JuliKimi K3 und Qwen 3.8 bedrohen Anthropics MarktpositionFable 5 kostet laut Analyse ca. 3× mehr pro abgeschlossener Aufgabe als Konkurrenzmodelle. Da Anthropic weder Rechenzentren noch Stromversorgung besitzt, hängt sein Überleben allein an der Modellnachfrage – ein Risiko, das durch günstige Open-Weights-Alternativen wächst.
- BENCHMARK20. JuliSVG-Animationsvergleich: 11 aktuelle LLMs beim Flamingo-Moonwalk-TestSVG-Generierung ist ein praxisnaher Qualitätstest für Code- und Raumvorstellungsfähigkeiten von LLMs. Der Vergleich zeigt den aktuellen Stand von GPT 5.6, Gemini 3.1 Pro, Deepseek V4, Grok 4.5, Kimi K3, Qwen 3.8 Max u.a. bei kreativem Rendering – nützlich für Entwickler, die Modelle für generative UI-Aufgaben evaluieren.
- LAUNCH20. JuliUnsloth unterstützt jetzt AMD-Hardware für Training und InferenzAMD-Nutzer können Unsloth nun nativ für Fine-Tuning, RL und Inferenz einsetzen – inkl. automatisch installierter ROCm/Triton/bitsandbytes-Builds. Besonders relevant für Strix-Halo/Ryzen-AI-Max-Systeme ohne dedizierte GPU.
- GERÜCHT20. JuliDeepSeek V4 Release-Version auf API aktiviert – Open Weights stehen bevorWenn die Open Weights von DeepSeek V4 Flash erscheinen, könnte das Modell laut Community-Einschätzung trotz halber aktiver Parameter mit top-aktuellen Modellen mithalten – relevant für lokale Deployments auf Consumer-Hardware wie dem DGX Spark.
- GERÜCHT20. JuliTrump-Regierung prüft De-facto-Verbote für ausländische Open-Source-KI-ModelleSollten solche Regelungen umgesetzt werden, könnten Entwickler in den USA chinesische Open-Source-Modelle wie DeepSeek nicht mehr legal nutzen oder deployen – mit direkten Auswirkungen auf lokale LLM-Deployments und Open-Source-Workflows.
- MEINUNG20. JuliGemma 4 31B zeigt Schwächen bei agentischen AufgabenFür Entwickler von Agentic-Workflows ist Gemma 4 31B laut diesem Erfahrungsbericht unzuverlässig: Das Modell stoppt selbstständig und wartet auf Nutzer-Input, was automatisierte Multi-Turn-Pipelines unterbricht. Qwen 3.6 27B und DeepSeek V4 Flash werden als funktionale Alternativen genannt.
- LAUNCH20. JuliGhost: macOS-App bringt 60+ Tools und lokales RAG für Ollama und LM StudioLokale Modelle erhalten dieselbe Werkzeuginfrastruktur wie Cloud-Modelle – inklusive Dateioperationen, Dokumentenerstellung, Kalender und Screen-OCR – ohne dass Daten das Gerät verlassen. Die automatische Probing-Logik löst das häufige Problem inkompatibler Tool-Calling-Formate bei verschiedenen Modellen.
- MEINUNG19. JuliThinking Machines Tinker: Qwen3-235B schlug Inkling als Fine-Tuning-BasisWer Tinker für Domain-Fine-Tuning evaluiert, sollte Basis-Modell und Framework trennen: Die 84,7%-Genauigkeit bei Bridgewater-Aufgaben mit 13,8× Kostenvorteil gilt für Qwen3-235B als Base, nicht für Inkling. Für MoE-Fine-Tuning bleibt Qwen oder Kimi besser dokumentiert.
- MEINUNG19. Juli192-GB-RAM-Nutzer diskutieren Großmodelle auf M2 Ultra Mac ProFür Entwickler mit High-Memory-Apple-Silicon zeigt der Post, welche Modelle im 200–430B-Bereich lokal laufen – darunter GLM 4.7 357B, DeepSeek V4 Flash 284B und Minimax M3 428B. Zudem werden konkrete llama.cpp-Bugfixes für KV-Cache-Probleme bei hybriden Recurrent-Modellen beschrieben.
- GERÜCHT18. JuliDeepSeek V4 steht kurz vor dem ReleaseKonkrete Benchmarks oder offizielle Ankündigungen fehlen – der Post basiert auf Gerüchten und inoffiziellen Videos. AI-Builder sollten offizielle Quellen abwarten, bevor sie Planungen anpassen.
- MEINUNG18. JuliMoonshot AI veröffentlicht Kimi K3 – neue Debatte um chinesisches Open-Source-AIKimi K3 zeigt, dass kompetitive Open-Source-Frontier-Modelle aus China weiter erscheinen – mit möglichen regulatorischen Konsequenzen für US-Unternehmen, die solche Modelle einsetzen. Stimmen aus dem Trump-Umfeld deuten auf kommende Soft-Law-Maßnahmen gegen chinesische Open-Weight-Modelle hin.
- GERÜCHT18. JuliBetrugsvorwurf: Basalt Labs erfindet 99,44 % auf HLE-BenchmarkGefälschte State-of-the-Art-Claims untergraben das Vertrauen in Benchmark-Ergebnisse. Für AI-Builder bedeutet das: Behauptungen kleiner Labs ohne reproduzierbare Eval-Details kritisch prüfen, bevor Entscheidungen darauf basieren.
- MEINUNG18. JuliRaschka erklärt: Wie LLMs mehrere Reasoning-Effort-Modi erlernenWer Reasoning-Modelle entwickelt oder einsetzt, versteht nach diesem Artikel das Zusammenspiel von RLVR-Training, Inference-Scaling und mehreren Effort-Modi – und kann gezielt zwischen Kosten und Qualität abwägen.