Übersicht: 1-bit & Ternary LLM-Modelle – Tracking-Thread August 2026
Der Reddit-Thread von u/pmttyji auf r/LocalLLaMA dient als laufendes Community-Register für extrem quantisierte Sprachmodelle (1-bit, 2-bit, ternary) und wird fortlaufend aktualisiert. Ein zentraler Fokus liegt auf Bonsai-27B von PrismML Engineering: Im August 2026 wurden CUDA- und Vulkan-Backend-PRs in den llama.cpp-Mainline-Branch gemergt; eine zusätzliche CUDA-Optimierung brachte 15–40 % mehr Token/s beim Text-Generation-Schritt (tg) und 8 % mehr beim Prompt-Processing (pp). Maple-Preview (DeepGrove, 20B-A1B-Architektur) läuft laut Thread auf einem Mac Mini M4 mit über 200 Token/s und auf einem iPhone mit über 120 Token/s — unterstützt durch einen eigenen MLX-Fork sowie einen offenen CPU-Backend-PR (#27000) für llama.cpp. Mach-1-Additive-35B von Syzygy Research (A3B-Architektur) erreicht bis zu 120 t/s auf Consumer-Laptops; eine Multimodal-Variante ist bereits gelistet, und das Team arbeitet laut eigenem Tweet an Nachfolgern auf Basis von Laguna-S-2.1 und Qwen3.8-27B. Spezialisierte Nischenmodelle wie Pestle-27B-Ternary (medizinische Forschung, Doses AI) und Neutrino-8B (Fermion Research) zeigen, dass der Ansatz über allgemeine Sprachmodelle hinaus angewendet wird. Daneben listet der Thread Bildmodelle (Bonsai-Image-4B in binärer und ternärer Variante, Clark-Air-Sana-1.6B), abliterierte Modelle sowie laufende llama.cpp-PRs zu ternärer Quantisierung und x86-VNNI-Optimierungen. Der Thread schließt explizit Modelle vor 2026 aus und richtet sich laut Disclaimer an den „Poor GPU Club" — also Nutzer ohne leistungsstarke dedizierte Grafikkarte.
- Ternary-Bonsai-27B war zunächst nicht auf allen Backends lauffähig; CUDA- und Vulkan-Support kamen erst im August 2026 via Mainline-Merge nach.
- Maple-Preview-20B nutzt eine A1B-Architektur (Aktive Parameter: ~1B) und wird über einen eigenen MLX-Fork (deepgrove-ai/mlx-lm-deepgrove) sowie llama.cpp PR #27000 unterstützt.
- Syzygy Research kündigt per Tweet Folgemodelle auf Basis von Laguna-S-2.1 und Qwen3.8-27B an — ohne konkreten Releasetermin.
- Laufender llama.cpp-PR #26348 verspricht 3-fache Geschwindigkeitsverbesserung für x86-CPUs mit VNNI-Unterstützung durch Q2_0-Dot-Product-Implementierung.
- Pestle-27B-Ternary von Doses AI ist explizit für medizinische Forschung ausgelegt und nutzt eine eigene Inference-Engine (mortar.cpp) mit CPU-, CUDA- und Metal-Support.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Übersicht: 1-bit & Ternary LLM-Modelle – Tracking-Thread August 2026
Der Reddit-Thread von u/pmttyji auf r/LocalLLaMA dient als laufendes Community-Register für extrem quantisierte Sprachmodelle (1-bit, 2-bit, ternary) und wird fortlaufend aktualisiert. Ein zentraler Fokus liegt auf Bonsai-27B von PrismML Engineering: Im August 2026 wurden CUDA- und Vulkan-Backend-PRs in den llama.cpp-Mainline-Branch gemergt; eine zusätzliche CUDA-Optimierung brachte 15–40 % mehr Token/s beim Text-Generation-Schritt (tg) und 8 % mehr beim Prompt-Processing (pp). Maple-Preview (DeepGrove, 20B-A1B-Architektur) läuft laut Thread auf einem Mac Mini M4 mit über 200 Token/s und auf einem iPhone mit über 120 Token/s — unterstützt durch einen eigenen MLX-Fork sowie einen offenen CPU-Backend-PR (#27000) für llama.cpp. Mach-1-Additive-35B von Syzygy Research (A3B-Architektur) erreicht bis zu 120 t/s auf Consumer-Laptops; eine Multimodal-Variante ist bereits gelistet, und das Team arbeitet laut eigenem Tweet an Nachfolgern auf Basis von Laguna-S-2.1 und Qwen3.8-27B. Spezialisierte Nischenmodelle wie Pestle-27B-Ternary (medizinische Forschung, Doses AI) und Neutrino-8B (Fermion Research) zeigen, dass der Ansatz über allgemeine Sprachmodelle hinaus angewendet wird. Daneben listet der Thread Bildmodelle (Bonsai-Image-4B in binärer und ternärer Variante, Clark-Air-Sana-1.6B), abliterierte Modelle sowie laufende llama.cpp-PRs zu ternärer Quantisierung und x86-VNNI-Optimierungen. Der Thread schließt explizit Modelle vor 2026 aus und richtet sich laut Disclaimer an den „Poor GPU Club" — also Nutzer ohne leistungsstarke dedizierte Grafikkarte.
- Ternary-Bonsai-27B war zunächst nicht auf allen Backends lauffähig; CUDA- und Vulkan-Support kamen erst im August 2026 via Mainline-Merge nach.
- Maple-Preview-20B nutzt eine A1B-Architektur (Aktive Parameter: ~1B) und wird über einen eigenen MLX-Fork (deepgrove-ai/mlx-lm-deepgrove) sowie llama.cpp PR #27000 unterstützt.
- Syzygy Research kündigt per Tweet Folgemodelle auf Basis von Laguna-S-2.1 und Qwen3.8-27B an — ohne konkreten Releasetermin.
- Laufender llama.cpp-PR #26348 verspricht 3-fache Geschwindigkeitsverbesserung für x86-CPUs mit VNNI-Unterstützung durch Q2_0-Dot-Product-Implementierung.
- Pestle-27B-Ternary von Doses AI ist explizit für medizinische Forschung ausgelegt und nutzt eine eigene Inference-Engine (mortar.cpp) mit CPU-, CUDA- und Metal-Support.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.