Spark-X2.5: Kompakte Open-Source-Modelle mit 1M-Token-Kontext und 200+ Sprachen
Spark-X2.5 stammt von XHToken und umfasst zwei Modellgrößen – 4B und 1,7B Parameter – die als GGUF-Pakete auf Hugging Face verfügbar sind. Die Architektur setzt auf ein hybrides Attention-Muster: Jeweils eine vollständige Attention-Schicht wird mit drei Sliding-Window-Attention-Schichten kombiniert, was den Rechenaufwand für lange Kontexte gegenüber reinen Full-Attention-Modellen erheblich senkt. Der llama.cpp-Pull-Request #27868 von Contributor KnightYao implementiert die zugehörige Modellklasse Spark2_5ForCausalLM direkt im Projekt und ermöglicht damit die native Nutzung ohne zusätzliche Konvertierungsschritte. Trainiert wurden die Modelle auf Huawei-Ascend-Clustern; als Post-Training-Verfahren kommt unter anderem MOPD (eine großskalige Reinforcement-Learning-Technik) zum Einsatz, um Reasoning, Coding und Instruction-Following zu verbessern. Spark-X2.5 ist in gängige Agentic-Harnesses wie Codex, Claude Code, OpenClaw und Hermes integriert. Neben NVIDIA-Hardware werden auch Huawei Ascend, Hygon und HOUMO.AI als Zielplattformen genannt; Inference-Frameworks wie vLLM, SGLang und MLX werden unterstützt. Für Fine-Tuning ist Kompatibilität mit LLaMA-Factory angegeben.
- Hybride Attention-Architektur: 1 Full-Attention-Layer + 3 Sliding-Window-Attention-Layer pro Block, um Langkontext-Overhead zu reduzieren.
- Training auf Huawei-Ascend-Clustern mit MOPD-Post-Training zur Verbesserung von Reasoning und Agentic-Fähigkeiten.
- Unterstützte Inference-Frameworks: vLLM, SGLang, llama.cpp, MLX — Deployment über Ollama und LM Studio möglich.
- Fine-Tuning-Unterstützung über LLaMA-Factory; Hardware-Kompatibilität mit NVIDIA, Huawei Ascend, Hygon und HOUMO.AI.
- Agentic-Integration mit Codex, Claude Code, OpenClaw und Hermes als explizit genannte Harnesses.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Spark-X2.5: Kompakte Open-Source-Modelle mit 1M-Token-Kontext und 200+ Sprachen
Spark-X2.5 stammt von XHToken und umfasst zwei Modellgrößen – 4B und 1,7B Parameter – die als GGUF-Pakete auf Hugging Face verfügbar sind. Die Architektur setzt auf ein hybrides Attention-Muster: Jeweils eine vollständige Attention-Schicht wird mit drei Sliding-Window-Attention-Schichten kombiniert, was den Rechenaufwand für lange Kontexte gegenüber reinen Full-Attention-Modellen erheblich senkt. Der llama.cpp-Pull-Request #27868 von Contributor KnightYao implementiert die zugehörige Modellklasse Spark2_5ForCausalLM direkt im Projekt und ermöglicht damit die native Nutzung ohne zusätzliche Konvertierungsschritte. Trainiert wurden die Modelle auf Huawei-Ascend-Clustern; als Post-Training-Verfahren kommt unter anderem MOPD (eine großskalige Reinforcement-Learning-Technik) zum Einsatz, um Reasoning, Coding und Instruction-Following zu verbessern. Spark-X2.5 ist in gängige Agentic-Harnesses wie Codex, Claude Code, OpenClaw und Hermes integriert. Neben NVIDIA-Hardware werden auch Huawei Ascend, Hygon und HOUMO.AI als Zielplattformen genannt; Inference-Frameworks wie vLLM, SGLang und MLX werden unterstützt. Für Fine-Tuning ist Kompatibilität mit LLaMA-Factory angegeben.
- Hybride Attention-Architektur: 1 Full-Attention-Layer + 3 Sliding-Window-Attention-Layer pro Block, um Langkontext-Overhead zu reduzieren.
- Training auf Huawei-Ascend-Clustern mit MOPD-Post-Training zur Verbesserung von Reasoning und Agentic-Fähigkeiten.
- Unterstützte Inference-Frameworks: vLLM, SGLang, llama.cpp, MLX — Deployment über Ollama und LM Studio möglich.
- Fine-Tuning-Unterstützung über LLaMA-Factory; Hardware-Kompatibilität mit NVIDIA, Huawei Ascend, Hygon und HOUMO.AI.
- Agentic-Integration mit Codex, Claude Code, OpenClaw und Hermes als explizit genannte Harnesses.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.