mistral.rs v0.9.0: bis zu 1,8× schnellerer CPU-Decode als llama.cpp
mistral.rs v0.9.0 wurde von Eric Buehler entwickelt und stellt einen gezielten Angriff auf llama.cpp als führende CPU-Inferenz-Engine dar. Der Benchmark-Vergleich wurde mit Qwen3 4B im Q4_K-Quantisierungsformat durchgeführt und deckte verschiedene Kontexttiefen ab – bei jedem gemessenen Punkt lag mistral.rs vorne. Besonders hervorzuheben ist die Methodik: Es wurden für beide Engines jeweils die besten verfügbaren Konfigurationen gesucht und verglichen, um einen fairen Head-to-Head zu gewährleisten. Die Optimierungen sind architekturübergreifend: Neben AVX2- und AVX512-Pfaden für x86-Prozessoren (getestet auf Intel Sapphire Rapids) profitieren auch ARM-Chips mit NEON-Erweiterungen, konkret auf dem NVIDIA GB10. Das ISQ-System (In-Situ-Quantisierung) erlaubt es, Modelle direkt von Hugging Face zu laden und on-the-fly zu quantisieren, ohne vorherige manuelle Konvertierungsschritte. Unterstützte Modelle umfassen unter anderem Qwen 3.5/3.6, Gemma 4 und LFM 2.5. Vollständige Benchmarktabellen, Methodikbeschreibung und Reproduktionsskripte sind öffentlich im GitHub-Repository unter releases/v0.9.0/report.md einsehbar.
- Benchmarks wurden auf Intel Sapphire Rapids (x86) und NVIDIA GB10 (ARM) durchgeführt – jeweils mit der besten Konfiguration pro Engine und Messpunkt.
- Das ISQ-System (In-Situ-Quantisierung) ermöglicht direktes Laden von Hugging-Face-Modellen per CLI ohne vorherige Konvertierung, z. B. `mistralrs run -m google/gemma-4-E4B-it --quant 4`.
- Unterstützte Modelle in v0.9.0 umfassen explizit Qwen 3.5/3.6, Gemma 4 und LFM 2.5.
- Installation erfolgt per Einzeiler-Skript für Mac/Linux (curl) und Windows (PowerShell irm), kein Build-Prozess nötig.
- Vollständige Reproduktionsskripte und Benchmarktabellen sind unter github.com/EricLBuehler/mistral.rs/blob/master/releases/v0.9.0/report.md öffentlich zugänglich.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
mistral.rs v0.9.0: bis zu 1,8× schnellerer CPU-Decode als llama.cpp
mistral.rs v0.9.0 wurde von Eric Buehler entwickelt und stellt einen gezielten Angriff auf llama.cpp als führende CPU-Inferenz-Engine dar. Der Benchmark-Vergleich wurde mit Qwen3 4B im Q4_K-Quantisierungsformat durchgeführt und deckte verschiedene Kontexttiefen ab – bei jedem gemessenen Punkt lag mistral.rs vorne. Besonders hervorzuheben ist die Methodik: Es wurden für beide Engines jeweils die besten verfügbaren Konfigurationen gesucht und verglichen, um einen fairen Head-to-Head zu gewährleisten. Die Optimierungen sind architekturübergreifend: Neben AVX2- und AVX512-Pfaden für x86-Prozessoren (getestet auf Intel Sapphire Rapids) profitieren auch ARM-Chips mit NEON-Erweiterungen, konkret auf dem NVIDIA GB10. Das ISQ-System (In-Situ-Quantisierung) erlaubt es, Modelle direkt von Hugging Face zu laden und on-the-fly zu quantisieren, ohne vorherige manuelle Konvertierungsschritte. Unterstützte Modelle umfassen unter anderem Qwen 3.5/3.6, Gemma 4 und LFM 2.5. Vollständige Benchmarktabellen, Methodikbeschreibung und Reproduktionsskripte sind öffentlich im GitHub-Repository unter releases/v0.9.0/report.md einsehbar.
- Benchmarks wurden auf Intel Sapphire Rapids (x86) und NVIDIA GB10 (ARM) durchgeführt – jeweils mit der besten Konfiguration pro Engine und Messpunkt.
- Das ISQ-System (In-Situ-Quantisierung) ermöglicht direktes Laden von Hugging-Face-Modellen per CLI ohne vorherige Konvertierung, z. B. `mistralrs run -m google/gemma-4-E4B-it --quant 4`.
- Unterstützte Modelle in v0.9.0 umfassen explizit Qwen 3.5/3.6, Gemma 4 und LFM 2.5.
- Installation erfolgt per Einzeiler-Skript für Mac/Linux (curl) und Windows (PowerShell irm), kein Build-Prozess nötig.
- Vollständige Reproduktionsskripte und Benchmarktabellen sind unter github.com/EricLBuehler/mistral.rs/blob/master/releases/v0.9.0/report.md öffentlich zugänglich.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.