Maple 20B-A1B: Ternäres MoE-Modell mit CPU-Support kommt für llama.cpp
Der Pull Request #27000 für llama.cpp, eingereicht von GitHub-Nutzer AlexGabbia, implementiert die Architektur-Unterstützung für Maple 20B-A1B – ein ternäres Mixture-of-Experts-Modell mit 20 Milliarden Gesamtparametern, von denen pro Inferenzschritt nur rund 1 Milliarde aktiv sind. Das „ternär" im Namen bezieht sich auf das Gewichts-Quantisierungsschema, bei dem Gewichte auf drei Werte beschränkt sind (typischerweise -1, 0, +1), was den Speicherbedarf drastisch reduziert und arithmetisch günstigere Operationen erlaubt. Die Kombination aus ternärer Quantisierung und MoE-Routing macht das Modell besonders attraktiv für CPU-Inferenz, da der geringe Arbeitsspeicherdurchsatz der CPU durch spärliche Aktivierung und schmale Bitbreite kompensiert wird. Ein Vorschau-Checkpoint ist bereits auf Hugging Face unter dem Account „deepgrove" als maple-preview verfügbar, was auf eine baldige Veröffentlichung des vollständigen Modells hindeutet. Im Subreddit r/LocalLLaMA wird der PR vor allem von Nutzern diskutiert, die über wenig oder keinen dedizierten VRAM verfügen und bislang von größeren Modellen ausgeschlossen waren. Der PR ist zum Stand der Veröffentlichung (14. September 2026) noch nicht gemergt; wann genau der finale Merge und die vollständige Modellveröffentlichung erfolgen, ist noch offen.
- Ternäres Gewichtsschema: Maple nutzt 1,58-Bit-artige Ternär-Gewichte (-1/0/+1), was den Speicherbedarf gegenüber FP16 um etwa den Faktor 10 senkt.
- MoE-Routing: Bei 20B Gesamtparametern sind pro Token nur ~1B Parameter aktiv – der Rechenaufwand bleibt damit auf dem Niveau eines 1B-Dense-Modells.
- CPU-fokussiert: Der PR-Titel nennt explizit "CPU" als Zielplattform, womit Maple auch auf RAM-basierten Setups ohne GPU lauffähig sein soll.
- Vorschau-Gewichte bereits verfügbar: Unter huggingface.co/deepgrove/maple-preview existiert ein öffentlicher Preview-Checkpoint.
- PR-Nummer #27000 im ggml-org/llama.cpp-Repository, eingereicht von Contributor AlexGabbia – noch ausstehend (nicht gemergt).
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com1w
Community-Branch: Expert Expansion für MoE-Modelle in llama.cpp
- LAUNCHreddit.com1w
llama.cpp erhält Support für NVIDIA Nemotron-3-Puzzle-75B-A9B
- LAUNCHreddit.com2w
llama.cpp ergänzt --n-cpu-ffn Option für dichte Modelle auf Low-VRAM-Hardware
- MEINUNGreddit.com2w
llama.cpp: Über 50 offene PRs für CPU/RAM/Disk-Inferenz-Optimierung
Maple 20B-A1B: Ternäres MoE-Modell mit CPU-Support kommt für llama.cpp
Der Pull Request #27000 für llama.cpp, eingereicht von GitHub-Nutzer AlexGabbia, implementiert die Architektur-Unterstützung für Maple 20B-A1B – ein ternäres Mixture-of-Experts-Modell mit 20 Milliarden Gesamtparametern, von denen pro Inferenzschritt nur rund 1 Milliarde aktiv sind. Das „ternär" im Namen bezieht sich auf das Gewichts-Quantisierungsschema, bei dem Gewichte auf drei Werte beschränkt sind (typischerweise -1, 0, +1), was den Speicherbedarf drastisch reduziert und arithmetisch günstigere Operationen erlaubt. Die Kombination aus ternärer Quantisierung und MoE-Routing macht das Modell besonders attraktiv für CPU-Inferenz, da der geringe Arbeitsspeicherdurchsatz der CPU durch spärliche Aktivierung und schmale Bitbreite kompensiert wird. Ein Vorschau-Checkpoint ist bereits auf Hugging Face unter dem Account „deepgrove" als maple-preview verfügbar, was auf eine baldige Veröffentlichung des vollständigen Modells hindeutet. Im Subreddit r/LocalLLaMA wird der PR vor allem von Nutzern diskutiert, die über wenig oder keinen dedizierten VRAM verfügen und bislang von größeren Modellen ausgeschlossen waren. Der PR ist zum Stand der Veröffentlichung (14. September 2026) noch nicht gemergt; wann genau der finale Merge und die vollständige Modellveröffentlichung erfolgen, ist noch offen.
- Ternäres Gewichtsschema: Maple nutzt 1,58-Bit-artige Ternär-Gewichte (-1/0/+1), was den Speicherbedarf gegenüber FP16 um etwa den Faktor 10 senkt.
- MoE-Routing: Bei 20B Gesamtparametern sind pro Token nur ~1B Parameter aktiv – der Rechenaufwand bleibt damit auf dem Niveau eines 1B-Dense-Modells.
- CPU-fokussiert: Der PR-Titel nennt explizit "CPU" als Zielplattform, womit Maple auch auf RAM-basierten Setups ohne GPU lauffähig sein soll.
- Vorschau-Gewichte bereits verfügbar: Unter huggingface.co/deepgrove/maple-preview existiert ein öffentlicher Preview-Checkpoint.
- PR-Nummer #27000 im ggml-org/llama.cpp-Repository, eingereicht von Contributor AlexGabbia – noch ausstehend (nicht gemergt).
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com1w
Community-Branch: Expert Expansion für MoE-Modelle in llama.cpp
- LAUNCHreddit.com1w
llama.cpp erhält Support für NVIDIA Nemotron-3-Puzzle-75B-A9B
- LAUNCHreddit.com2w
llama.cpp ergänzt --n-cpu-ffn Option für dichte Modelle auf Low-VRAM-Hardware
- MEINUNGreddit.com2w
llama.cpp: Über 50 offene PRs für CPU/RAM/Disk-Inferenz-Optimierung