GigaChat-3.5-Reasoning: 432B MoE mit 37 % kürzeren Reasoning-Traces
GigaChat-3.5-Reasoning stammt von Sber bzw. dem zugehörigen KI-Forschungslabor AI-Sage und erweitert die GigaChat-Modellfamilie um ein dezidiertes Reasoning-Modell. Die Architektur setzt auf einen Mixture-of-Experts-Ansatz mit 432 Milliarden Gesamtparametern, von denen 28 Milliarden pro Forward-Pass aktiv sind (432B-A28B). Als zentrales Differenzierungsmerkmal nutzt das Modell Gated DeltaNet, eine Variante linearer Attention, die speziell auf Effizienz bei langen Kontexten ausgelegt ist. Das Training folgte einem zweistufigen Prozess: Zunächst wurden spezialisierte Experten-Modelle für die Domänen Code, Mathematik und Allgemeinwissen mit der CISPO-Methode trainiert; anschließend wurden diese via On-Policy-Distillation in ein einziges gemeinsames Modell zusammengeführt. Die eigenen Evaluierungen des Teams zeigen eine Leistung nahe DeepSeek V4 Flash Preview — einem starken öffentlichen Referenzmodell — bei gleichzeitig 37 % kürzeren Reasoning-Traces. Kürzere Traces bedeuten direkt weniger Token pro Anfrage, was Inferenzkosten und Latenz in produktiven Setups spürbar senkt. Die Gewichte stehen unter der permissiven MIT-Lizenz auf Hugging Face zur freien Nutzung bereit; ein interaktiver Test ist über giga.chat im dortigen Reasoning-Tab möglich.
- Architektur: 432B-A28B MoE mit Gated DeltaNet für effiziente Long-Context-Verarbeitung.
- Trainingsablauf zweistufig: domänenspezifische Experten via CISPO, dann On-Policy-Distillation in ein Unified Model.
- Benchmark-Referenz laut eigener Eval: Leistung nahe DeepSeek V4 Flash Preview bei 37 % weniger Reasoning-Tokens.
- Veröffentlicht auf Hugging Face unter MIT-Lizenz (Collection: ai-sage/gigachat-35-reasoning); öffentliche Demo unter giga.chat (Reasoning-Tab).
- Reddit-Post eingereicht von /u/netikas, vermutlich AI-Sage-Teammitglied.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
GigaChat-3.5-Reasoning: 432B MoE mit 37 % kürzeren Reasoning-Traces
GigaChat-3.5-Reasoning stammt von Sber bzw. dem zugehörigen KI-Forschungslabor AI-Sage und erweitert die GigaChat-Modellfamilie um ein dezidiertes Reasoning-Modell. Die Architektur setzt auf einen Mixture-of-Experts-Ansatz mit 432 Milliarden Gesamtparametern, von denen 28 Milliarden pro Forward-Pass aktiv sind (432B-A28B). Als zentrales Differenzierungsmerkmal nutzt das Modell Gated DeltaNet, eine Variante linearer Attention, die speziell auf Effizienz bei langen Kontexten ausgelegt ist. Das Training folgte einem zweistufigen Prozess: Zunächst wurden spezialisierte Experten-Modelle für die Domänen Code, Mathematik und Allgemeinwissen mit der CISPO-Methode trainiert; anschließend wurden diese via On-Policy-Distillation in ein einziges gemeinsames Modell zusammengeführt. Die eigenen Evaluierungen des Teams zeigen eine Leistung nahe DeepSeek V4 Flash Preview — einem starken öffentlichen Referenzmodell — bei gleichzeitig 37 % kürzeren Reasoning-Traces. Kürzere Traces bedeuten direkt weniger Token pro Anfrage, was Inferenzkosten und Latenz in produktiven Setups spürbar senkt. Die Gewichte stehen unter der permissiven MIT-Lizenz auf Hugging Face zur freien Nutzung bereit; ein interaktiver Test ist über giga.chat im dortigen Reasoning-Tab möglich.
- Architektur: 432B-A28B MoE mit Gated DeltaNet für effiziente Long-Context-Verarbeitung.
- Trainingsablauf zweistufig: domänenspezifische Experten via CISPO, dann On-Policy-Distillation in ein Unified Model.
- Benchmark-Referenz laut eigener Eval: Leistung nahe DeepSeek V4 Flash Preview bei 37 % weniger Reasoning-Tokens.
- Veröffentlicht auf Hugging Face unter MIT-Lizenz (Collection: ai-sage/gigachat-35-reasoning); öffentliche Demo unter giga.chat (Reasoning-Tab).
- Reddit-Post eingereicht von /u/netikas, vermutlich AI-Sage-Teammitglied.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.