Open Models Juni 2026: Überblick über Finetunes, Quantisierungen und Releases
Der monatliche Community-Thread auf r/LocalLLaMA fasst die Open-Model-Aktivitäten des Juni 2026 zusammen und stellt dabei fest, dass der Umfang gegenüber dem „überwältigenden April" merklich geringer ausfiel. Besonders auffällig ist die koordinierte Quantisierungsoffensive der drei großen Chip-Hersteller: NVIDIA liefert NVFP4-Versionen für gleich sechs Modelle, darunter das besonders große NVIDIA-Nemotron-3-Ultra-550B-A55B sowie Qwen3.5-397B-A17B und MiniMax-M3. AMD zieht mit MXFP4-Quants für vier Modelle nach, wobei sich die Auswahl mit NVIDIAs Liste bei GLM-5.2, Qwen3.5-397B-A17B und MiniMax-M3 überschneidet — ein Hinweis darauf, welche Modelle die Community als besonders relevant einstuft. Intel setzt mit AutoRound auf vier weitere Modelle, darunter DeepSeek-V4-Pro und beide Größenklassen von Gemma-4-it. Auf der Finetune-Seite stechen MusaCoder-27B als spezialisiertes Coding-Modell und VibeThinker-3B als kleines Reasoning-Modell hervor; Nex-N2, Ornith-1.0, Agents-A1 und Holo3.1 runden das Feld ab. In der Rubrik „Misc" taucht mit Nemotron-Labs-TwoTower-30B-A3B-Base ein diffusionsbasiertes Sprachmodell von NVIDIA auf, das einen ungewöhnlichen Architekturansatz verfolgt. DeepSeek veröffentlichte unter dem Namen DeepSpec ein Paket aus drei Komponenten — Eagle3, DFlash und DSpark —, das vermutlich Inferenz-Beschleunigungstechniken bündelt. Gemma-4-QAT rundet den Monat mit einem weiteren quantisierungsoptimierten Ableger der Gemma-4-Familie ab.
- NVIDIA-Nemotron-3-Ultra-550B-A55B ist mit 550B Gesamtparametern (55B aktiv) das größte im Thread gelistete Modell und erhält eine NVFP4-Quantisierung.
- MXFP4 (AMD) und NVFP4 (NVIDIA) überschneiden sich bei drei Modellen: GLM-5.2, Qwen3.5-397B-A17B und MiniMax-M3 — beide Anbieter priorisieren dieselben Flaggschiff-Weights.
- DeepSpec von DeepSeek bündelt drei Komponenten: Eagle3, DFlash und DSpark, vermutlich als Inferenz- und Aufmerksamkeits-Optimierungspaket.
- Nemotron-Labs-TwoTower-30B-A3B-Base wird explizit als Diffusion-Sprachmodell geführt — ein von klassischen Autoregressive-Ansätzen abweichender Architekturansatz.
- Intel AutoRound deckt mit DiffusionGemma-26B-A4B auch ein Bildgenerierungsmodell ab, nicht nur reine Text-LLMs.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Open Models Juni 2026: Überblick über Finetunes, Quantisierungen und Releases
Der monatliche Community-Thread auf r/LocalLLaMA fasst die Open-Model-Aktivitäten des Juni 2026 zusammen und stellt dabei fest, dass der Umfang gegenüber dem „überwältigenden April" merklich geringer ausfiel. Besonders auffällig ist die koordinierte Quantisierungsoffensive der drei großen Chip-Hersteller: NVIDIA liefert NVFP4-Versionen für gleich sechs Modelle, darunter das besonders große NVIDIA-Nemotron-3-Ultra-550B-A55B sowie Qwen3.5-397B-A17B und MiniMax-M3. AMD zieht mit MXFP4-Quants für vier Modelle nach, wobei sich die Auswahl mit NVIDIAs Liste bei GLM-5.2, Qwen3.5-397B-A17B und MiniMax-M3 überschneidet — ein Hinweis darauf, welche Modelle die Community als besonders relevant einstuft. Intel setzt mit AutoRound auf vier weitere Modelle, darunter DeepSeek-V4-Pro und beide Größenklassen von Gemma-4-it. Auf der Finetune-Seite stechen MusaCoder-27B als spezialisiertes Coding-Modell und VibeThinker-3B als kleines Reasoning-Modell hervor; Nex-N2, Ornith-1.0, Agents-A1 und Holo3.1 runden das Feld ab. In der Rubrik „Misc" taucht mit Nemotron-Labs-TwoTower-30B-A3B-Base ein diffusionsbasiertes Sprachmodell von NVIDIA auf, das einen ungewöhnlichen Architekturansatz verfolgt. DeepSeek veröffentlichte unter dem Namen DeepSpec ein Paket aus drei Komponenten — Eagle3, DFlash und DSpark —, das vermutlich Inferenz-Beschleunigungstechniken bündelt. Gemma-4-QAT rundet den Monat mit einem weiteren quantisierungsoptimierten Ableger der Gemma-4-Familie ab.
- NVIDIA-Nemotron-3-Ultra-550B-A55B ist mit 550B Gesamtparametern (55B aktiv) das größte im Thread gelistete Modell und erhält eine NVFP4-Quantisierung.
- MXFP4 (AMD) und NVFP4 (NVIDIA) überschneiden sich bei drei Modellen: GLM-5.2, Qwen3.5-397B-A17B und MiniMax-M3 — beide Anbieter priorisieren dieselben Flaggschiff-Weights.
- DeepSpec von DeepSeek bündelt drei Komponenten: Eagle3, DFlash und DSpark, vermutlich als Inferenz- und Aufmerksamkeits-Optimierungspaket.
- Nemotron-Labs-TwoTower-30B-A3B-Base wird explizit als Diffusion-Sprachmodell geführt — ein von klassischen Autoregressive-Ansätzen abweichender Architekturansatz.
- Intel AutoRound deckt mit DiffusionGemma-26B-A4B auch ein Bildgenerierungsmodell ab, nicht nur reine Text-LLMs.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.