AMD veröffentlicht Instella-MoE-16B-A3B als Open-Source-Modell
AMD hat unter dem Namen Instella-MoE-16B-A3B ein eigenes Sprachmodell auf Basis der Mixture-of-Experts-Architektur (MoE) auf Hugging Face veröffentlicht. Das Modell verfügt über 16 Milliarden Gesamtparameter, von denen bei der Inferenz jeweils nur rund 3 Milliarden aktiv sind – ein charakteristisches Merkmal von MoE-Modellen, das den Rechenaufwand gegenüber dichten Modellen gleicher Gesamtgröße deutlich reduziert. Neben der Basisversion hat AMD auch eine „Think"-Variante veröffentlicht, die auf längeres, schrittweises Schlussfolgern (Chain-of-Thought) ausgelegt ist. Der Reddit-Nutzer Look_0ver_There stieß beim Stöbern auf Hugging Face auf das Modell, das zum Zeitpunkt des Posts erst rund einen Tag online war. AMD positioniert sich damit erstmals als Anbieter eigener Open-Source-Foundation-Models und folgt damit einem Trend, den unter anderem Meta (Llama), Mistral und Google (Gemma) etabliert haben. Für die Local-LLM-Community ist die geringe aktive Parameterzahl von 3B besonders relevant, da sie auf Consumer-Hardware mit vertretbarem VRAM-Bedarf lauffähig sein dürfte. Ob das Modell intern auf AMD-Hardware (z. B. Instinct-GPUs) trainiert wurde und welche Benchmarks AMD veröffentlicht hat, geht aus dem Reddit-Post nicht hervor.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org1w
Instella-MoE: Vollständig offenes MoE-Modell mit 16B Parametern auf AMD-GPUs trainiert
- LAUNCHreddit.com1w
IFM veröffentlicht K2-Horizon-MoVA-36B-A4B: MoE-Modell mit 512K Kontext
- LAUNCHreddit.com1w
Community-Branch: Expert Expansion für MoE-Modelle in llama.cpp
- LAUNCHreddit.com3w
Liquid AI veröffentlicht LFM 2.5 QAD mit 2,6B Parametern
AMD veröffentlicht Instella-MoE-16B-A3B als Open-Source-Modell
AMD hat unter dem Namen Instella-MoE-16B-A3B ein eigenes Sprachmodell auf Basis der Mixture-of-Experts-Architektur (MoE) auf Hugging Face veröffentlicht. Das Modell verfügt über 16 Milliarden Gesamtparameter, von denen bei der Inferenz jeweils nur rund 3 Milliarden aktiv sind – ein charakteristisches Merkmal von MoE-Modellen, das den Rechenaufwand gegenüber dichten Modellen gleicher Gesamtgröße deutlich reduziert. Neben der Basisversion hat AMD auch eine „Think"-Variante veröffentlicht, die auf längeres, schrittweises Schlussfolgern (Chain-of-Thought) ausgelegt ist. Der Reddit-Nutzer Look_0ver_There stieß beim Stöbern auf Hugging Face auf das Modell, das zum Zeitpunkt des Posts erst rund einen Tag online war. AMD positioniert sich damit erstmals als Anbieter eigener Open-Source-Foundation-Models und folgt damit einem Trend, den unter anderem Meta (Llama), Mistral und Google (Gemma) etabliert haben. Für die Local-LLM-Community ist die geringe aktive Parameterzahl von 3B besonders relevant, da sie auf Consumer-Hardware mit vertretbarem VRAM-Bedarf lauffähig sein dürfte. Ob das Modell intern auf AMD-Hardware (z. B. Instinct-GPUs) trainiert wurde und welche Benchmarks AMD veröffentlicht hat, geht aus dem Reddit-Post nicht hervor.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org1w
Instella-MoE: Vollständig offenes MoE-Modell mit 16B Parametern auf AMD-GPUs trainiert
- LAUNCHreddit.com1w
IFM veröffentlicht K2-Horizon-MoVA-36B-A4B: MoE-Modell mit 512K Kontext
- LAUNCHreddit.com1w
Community-Branch: Expert Expansion für MoE-Modelle in llama.cpp
- LAUNCHreddit.com3w
Liquid AI veröffentlicht LFM 2.5 QAD mit 2,6B Parametern