Meta veröffentlicht MobileMoE: MoE-Sprachmodelle unter 3 GB für mobile Geräte
MobileMoE-L-Base ist das größte Modell der drei Größenstufen (S/M/L) der MobileMoE-Familie und bringt 922 Millionen aktive bei insgesamt 5,3 Milliarden Parametern mit. Die Architektur setzt auf 32 Transformer-Schichten mit einer Modellbreite von 1.280 Dimensionen, 20 Attention-Heads und Grouped Query Attention (GQA) mit nur 4 KV-Heads – ein klarer Hinweis auf Speichereffizienz als zentrales Designziel. Das MoE-Routing ist feingranular aufgebaut: 60 geroutete Experten mit je 640 FFN-Hidden-Dimensionen stehen einem immer aktiven Shared Expert mit 2.560 Hidden-Dimensionen gegenüber; pro Token wählt Top-k-Sigmoid-Routing 4 Experten aus. Das Modell verwendet RoPE mit θ = 500.000, QK-Normalisierung sowie gekoppelte Input/Output-Embeddings bei einem Vokabular von 128.256 Tokens. MobileMoE wird unter der FAIR Non-Commercial License veröffentlicht und ist damit für kommerzielle Anwendungen nicht frei verwendbar. Der Kontext umfasst 8.192 Tokens bei BF16-Präzision; INT4-Quantisierung bringt das Gewichtsvolumen aller drei Größen unter 3 GB, was dem verfügbaren DRAM gängiger Smartphones entspricht. Neben der Base-Variante (Pre-training + Mid-training) existieren je eine SFT- und eine QAT-Variante, wobei letztere Quantisierungsfehler bereits im Training kompensiert.
- MobileMoE-L-Base: 32 Schichten, Modell-Dimension 1280, Head-Dimension 64, 20 Attention-Heads, 4 KV-Heads via GQA.
- Routing-Mechanismus: Top-k-Sigmoid mit Normalisierung — 4 von 60 gerouteten Experten aktiv pro Token; 1 Shared Expert immer aktiv.
- Kontextfenster: 8.192 Tokens; RoPE-Frequenzbasis θ = 500.000; Trainingspräzision BF16.
- Lizenz: FAIR NC (Non-Commercial) — kommerzielle Nutzung ist ausgeschlossen.
- Drei Varianten pro Größe: Base (Pre-training + Mid-training), SFT (Supervised Fine-Tuning), QAT (Quantization-Aware Training).
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org4d
MoEMB: Universelle multimodale Embeddings via Mixture-of-Experts skalieren
- FORSCHUNGarxiv.org1w
Instella-MoE: Vollständig offenes MoE-Modell mit 16B Parametern auf AMD-GPUs trainiert
- FORSCHUNGyoutube.com1w
320-Milliarden-Parameter-Modell aktiviert nur einen Bruchteil seiner Kapazität
Meta veröffentlicht MobileMoE: MoE-Sprachmodelle unter 3 GB für mobile Geräte
MobileMoE-L-Base ist das größte Modell der drei Größenstufen (S/M/L) der MobileMoE-Familie und bringt 922 Millionen aktive bei insgesamt 5,3 Milliarden Parametern mit. Die Architektur setzt auf 32 Transformer-Schichten mit einer Modellbreite von 1.280 Dimensionen, 20 Attention-Heads und Grouped Query Attention (GQA) mit nur 4 KV-Heads – ein klarer Hinweis auf Speichereffizienz als zentrales Designziel. Das MoE-Routing ist feingranular aufgebaut: 60 geroutete Experten mit je 640 FFN-Hidden-Dimensionen stehen einem immer aktiven Shared Expert mit 2.560 Hidden-Dimensionen gegenüber; pro Token wählt Top-k-Sigmoid-Routing 4 Experten aus. Das Modell verwendet RoPE mit θ = 500.000, QK-Normalisierung sowie gekoppelte Input/Output-Embeddings bei einem Vokabular von 128.256 Tokens. MobileMoE wird unter der FAIR Non-Commercial License veröffentlicht und ist damit für kommerzielle Anwendungen nicht frei verwendbar. Der Kontext umfasst 8.192 Tokens bei BF16-Präzision; INT4-Quantisierung bringt das Gewichtsvolumen aller drei Größen unter 3 GB, was dem verfügbaren DRAM gängiger Smartphones entspricht. Neben der Base-Variante (Pre-training + Mid-training) existieren je eine SFT- und eine QAT-Variante, wobei letztere Quantisierungsfehler bereits im Training kompensiert.
- MobileMoE-L-Base: 32 Schichten, Modell-Dimension 1280, Head-Dimension 64, 20 Attention-Heads, 4 KV-Heads via GQA.
- Routing-Mechanismus: Top-k-Sigmoid mit Normalisierung — 4 von 60 gerouteten Experten aktiv pro Token; 1 Shared Expert immer aktiv.
- Kontextfenster: 8.192 Tokens; RoPE-Frequenzbasis θ = 500.000; Trainingspräzision BF16.
- Lizenz: FAIR NC (Non-Commercial) — kommerzielle Nutzung ist ausgeschlossen.
- Drei Varianten pro Größe: Base (Pre-training + Mid-training), SFT (Supervised Fine-Tuning), QAT (Quantization-Aware Training).
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org4d
MoEMB: Universelle multimodale Embeddings via Mixture-of-Experts skalieren
- FORSCHUNGarxiv.org1w
Instella-MoE: Vollständig offenes MoE-Modell mit 16B Parametern auf AMD-GPUs trainiert
- FORSCHUNGyoutube.com1w
320-Milliarden-Parameter-Modell aktiviert nur einen Bruchteil seiner Kapazität