llama.cpp erhält Support für poolside Laguna XS.2 und M.1 MoE-Modelle
Der Pull Request #25165 von Nutzer joerowell erweitert llama.cpp um zwei neue Modellarchitekturen des KI-Unternehmens poolside: Laguna XS.2 und Laguna M.1. Poolside ist auf Code-Generation spezialisiert und positioniert beide Modelle explizit für agentisches Coding sowie sogenannte Long-Horizon-Tasks – also Aufgaben, bei denen ein Modell über viele Schritte hinweg eigenständig plant und handelt. Laguna XS.2 kommt mit 33 Milliarden Gesamtparametern, aktiviert pro Token aber nur 3 Milliarden – ein typisches Merkmal von Mixture-of-Experts-Architekturen, das Rechenaufwand und Energieverbrauch deutlich reduziert. Besonders relevant für den lokalen Einsatz ist die Sliding Window Attention mit per-head Gating, die in 30 der 40 Layer zum Einsatz kommt: Sie begrenzt den KV-Cache-Bedarf und beschleunigt die Inferenz erheblich, was Laguna XS.2 auf Consumer-Hardware praxistauglich machen soll. Laguna M.1 ist das größere Schwestermodell mit 225 Milliarden Gesamtparametern und 23 Milliarden aktiven Parametern pro Token; es zielt eher auf leistungsfähigere Hardware. Beide Modelle sind über Hugging Face unter dem poolside-Namespace öffentlich verfügbar. Der PR ist zum Zeitpunkt der Veröffentlichung noch offen; sobald er in den llama.cpp-Hauptzweig gemergt wird, können Nutzer des Frameworks beide Modelle ohne zusätzliche Anpassungen laden und ausführen.
- Laguna XS.2: 33B Gesamtparameter, 3B aktive Parameter pro Token – MoE-Architektur für lokalen Betrieb konzipiert.
- Sliding Window Attention mit per-head Gating in 30 von 40 Layern reduziert KV-Cache-Bedarf und erhöht Inferenzgeschwindigkeit.
- Laguna M.1: 225B Gesamtparameter, 23B aktive Parameter pro Token – deutlich größeres Modell für leistungsfähigere Systeme.
- Beide Modelle sind auf Hugging Face unter poolside/Laguna-XS.2 bzw. poolside/Laguna-M.1 öffentlich verfügbar.
- Der PR stammt von Contributor joerowell und trägt die Nummer #25165 im ggml-org/llama.cpp-Repository.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
llama.cpp erhält Support für poolside Laguna XS.2 und M.1 MoE-Modelle
Der Pull Request #25165 von Nutzer joerowell erweitert llama.cpp um zwei neue Modellarchitekturen des KI-Unternehmens poolside: Laguna XS.2 und Laguna M.1. Poolside ist auf Code-Generation spezialisiert und positioniert beide Modelle explizit für agentisches Coding sowie sogenannte Long-Horizon-Tasks – also Aufgaben, bei denen ein Modell über viele Schritte hinweg eigenständig plant und handelt. Laguna XS.2 kommt mit 33 Milliarden Gesamtparametern, aktiviert pro Token aber nur 3 Milliarden – ein typisches Merkmal von Mixture-of-Experts-Architekturen, das Rechenaufwand und Energieverbrauch deutlich reduziert. Besonders relevant für den lokalen Einsatz ist die Sliding Window Attention mit per-head Gating, die in 30 der 40 Layer zum Einsatz kommt: Sie begrenzt den KV-Cache-Bedarf und beschleunigt die Inferenz erheblich, was Laguna XS.2 auf Consumer-Hardware praxistauglich machen soll. Laguna M.1 ist das größere Schwestermodell mit 225 Milliarden Gesamtparametern und 23 Milliarden aktiven Parametern pro Token; es zielt eher auf leistungsfähigere Hardware. Beide Modelle sind über Hugging Face unter dem poolside-Namespace öffentlich verfügbar. Der PR ist zum Zeitpunkt der Veröffentlichung noch offen; sobald er in den llama.cpp-Hauptzweig gemergt wird, können Nutzer des Frameworks beide Modelle ohne zusätzliche Anpassungen laden und ausführen.
- Laguna XS.2: 33B Gesamtparameter, 3B aktive Parameter pro Token – MoE-Architektur für lokalen Betrieb konzipiert.
- Sliding Window Attention mit per-head Gating in 30 von 40 Layern reduziert KV-Cache-Bedarf und erhöht Inferenzgeschwindigkeit.
- Laguna M.1: 225B Gesamtparameter, 23B aktive Parameter pro Token – deutlich größeres Modell für leistungsfähigere Systeme.
- Beide Modelle sind auf Hugging Face unter poolside/Laguna-XS.2 bzw. poolside/Laguna-M.1 öffentlich verfügbar.
- Der PR stammt von Contributor joerowell und trägt die Nummer #25165 im ggml-org/llama.cpp-Repository.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.