NVIDIA veröffentlicht Nemotron-Labs-3-Puzzle-75B: komprimiertes Hybrid-MoE-Modell
Nemotron-Labs-3-Puzzle-75B-A9B ist das direkte Nachfolgeprodukt von NVIDIAs Nemotron-3-Super-120B-A12B und wurde mithilfe eines eigens entwickelten Post-Training-Kompressionsverfahrens namens „Iterative Puzzle Framework" destilliert. Dieses Framework reduziert die Gesamtparameterzahl von 120,7B auf 75,3B und die aktiven Parameter von 12,8B auf 9,3B – ohne die Stärke bei Reasoning, Coding, Mehrsprachigkeit und langen Kontexten wesentlich einzubüßen. Die Hybrid-MoE-Architektur kombiniert drei verschiedene Layer-Typen: Mamba-Layer (State-Space-Modell), klassische Attention-Layer und Mixture-of-Experts-Layer, die abwechselnd verschachtelt sind. Zusätzlich unterstützt das Modell Multi-Token Prediction (MTP), eine Technik, die bereits im Elternmodell Nemotron-3-Super genutzt wird und die Textgenerierung durch paralleles Vorhersagen mehrerer Token pro Schritt beschleunigt. Die Kombination dieser Architekturentscheidungen ist laut NVIDIA gezielt auf interaktive und Inferenz-intensive Deployments ausgerichtet. Das Modell unterstützt sieben Sprachen nativ: Englisch, Französisch, Deutsch, Italienisch, Japanisch, Spanisch und Chinesisch. Eine ausführliche technische Beschreibung der Trainings- und Kompressionsmethodik ist im zugehörigen Tech Report „Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs" dokumentiert.
- Parameterreduktion: Von 120,7B gesamt / 12,8B aktiv (Super-120B) auf 75,3B gesamt / 9,3B aktiv (Puzzle-75B).
- Architektur: Hybride Verschachtelung aus Mamba-, MoE- und Attention-Layern – dasselbe Grundprinzip wie beim Elternmodell Nemotron-3-Super.
- Multi-Token Prediction (MTP): Übernommen aus Nemotron-3-Super, ermöglicht paralleles Vorhersagen mehrerer Token pro Inferenzschritt.
- 7 unterstützte Sprachen: Englisch, Französisch, Deutsch, Italienisch, Japanisch, Spanisch und Chinesisch.
- Lizenz: Für kommerzielle Nutzung freigegeben; Gewichte sind auf Hugging Face verfügbar.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
NVIDIA veröffentlicht Nemotron-Labs-3-Puzzle-75B: komprimiertes Hybrid-MoE-Modell
Nemotron-Labs-3-Puzzle-75B-A9B ist das direkte Nachfolgeprodukt von NVIDIAs Nemotron-3-Super-120B-A12B und wurde mithilfe eines eigens entwickelten Post-Training-Kompressionsverfahrens namens „Iterative Puzzle Framework" destilliert. Dieses Framework reduziert die Gesamtparameterzahl von 120,7B auf 75,3B und die aktiven Parameter von 12,8B auf 9,3B – ohne die Stärke bei Reasoning, Coding, Mehrsprachigkeit und langen Kontexten wesentlich einzubüßen. Die Hybrid-MoE-Architektur kombiniert drei verschiedene Layer-Typen: Mamba-Layer (State-Space-Modell), klassische Attention-Layer und Mixture-of-Experts-Layer, die abwechselnd verschachtelt sind. Zusätzlich unterstützt das Modell Multi-Token Prediction (MTP), eine Technik, die bereits im Elternmodell Nemotron-3-Super genutzt wird und die Textgenerierung durch paralleles Vorhersagen mehrerer Token pro Schritt beschleunigt. Die Kombination dieser Architekturentscheidungen ist laut NVIDIA gezielt auf interaktive und Inferenz-intensive Deployments ausgerichtet. Das Modell unterstützt sieben Sprachen nativ: Englisch, Französisch, Deutsch, Italienisch, Japanisch, Spanisch und Chinesisch. Eine ausführliche technische Beschreibung der Trainings- und Kompressionsmethodik ist im zugehörigen Tech Report „Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs" dokumentiert.
- Parameterreduktion: Von 120,7B gesamt / 12,8B aktiv (Super-120B) auf 75,3B gesamt / 9,3B aktiv (Puzzle-75B).
- Architektur: Hybride Verschachtelung aus Mamba-, MoE- und Attention-Layern – dasselbe Grundprinzip wie beim Elternmodell Nemotron-3-Super.
- Multi-Token Prediction (MTP): Übernommen aus Nemotron-3-Super, ermöglicht paralleles Vorhersagen mehrerer Token pro Inferenzschritt.
- 7 unterstützte Sprachen: Englisch, Französisch, Deutsch, Italienisch, Japanisch, Spanisch und Chinesisch.
- Lizenz: Für kommerzielle Nutzung freigegeben; Gewichte sind auf Hugging Face verfügbar.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.