Ternäre 1,58-Bit-LLMs: Neues Interesse durch mehrere Community-Releases
Das Konzept ternärer LLMs – Modelle, die Gewichte nur in drei Zuständen (−1, 0, +1) speichern und so auf rechnerisch 1,58 Bit pro Parameter kommen – geht auf Microsofts BitNet-Forschung zurück und verspricht drastisch reduzierten Speicherbedarf sowie schnellere Inferenz ohne dedizierte GPU. Nach einer Phase relativer Stille erlebt das Feld laut einem vieldiskutierten Reddit-Thread in r/LocalLLaMA gerade einen kleinen Aufschwung durch mehrere unabhängige Labs. PrismML hat ein 27B-Ternary-Modell veröffentlicht, das in der Community aber gemischte Bewertungen erhielt – Nutzer bemängelten, dass die Benchmark-Angaben nicht immer reproduzierbar seien. Deepgroves Maple-20B-A1B hingegen wird von mehreren Nutzern gelobt: Es soll auf einem iPhone tatsächlich rund 100 Token pro Sekunde erzeugen, was für mobile Edge-Inferenz ein beachtlicher Wert wäre. Doses AI wiederum positioniert sich mit Pestle-27B-Ternary gezielt im Medizinsegment und gibt an, Googles MedGemma-27B in nahezu allen relevanten Metriken zu übertreffen. Der Thread-Autor hebt hervor, dass alle drei Modelle aus kleinen, noch jungen Labs stammen, die bislang kein umfangreiches Reinforcement Learning (RL-Finetuning) betrieben haben – genau das wird als Hauptursache für die Schwächen bei langen, agentic Coding-Aufgaben gesehen. Die Labs haben RL-Training als nächsten Schritt angekündigt, konkrete Zeitpläne wurden nicht genannt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com3w
Übersicht: 1-bit & Ternary LLM-Modelle – Tracking-Thread August 2026
- GERÜCHTreddit.com3w
Liquid AI kündigt 100-Milliarden-Parameter-Modell LFM an
- LAUNCHreddit.com3w
SupraLabs veröffentlicht Supra2-Medium-Base: 25M-Parameter-Modell konkurriert mit 50M-Vorgänger
- MEINUNGreddit.com23h
Community-Diskussion: Modellwahl und Geschwindigkeit auf Apple M5 Pro 64 GB
Ternäre 1,58-Bit-LLMs: Neues Interesse durch mehrere Community-Releases
Das Konzept ternärer LLMs – Modelle, die Gewichte nur in drei Zuständen (−1, 0, +1) speichern und so auf rechnerisch 1,58 Bit pro Parameter kommen – geht auf Microsofts BitNet-Forschung zurück und verspricht drastisch reduzierten Speicherbedarf sowie schnellere Inferenz ohne dedizierte GPU. Nach einer Phase relativer Stille erlebt das Feld laut einem vieldiskutierten Reddit-Thread in r/LocalLLaMA gerade einen kleinen Aufschwung durch mehrere unabhängige Labs. PrismML hat ein 27B-Ternary-Modell veröffentlicht, das in der Community aber gemischte Bewertungen erhielt – Nutzer bemängelten, dass die Benchmark-Angaben nicht immer reproduzierbar seien. Deepgroves Maple-20B-A1B hingegen wird von mehreren Nutzern gelobt: Es soll auf einem iPhone tatsächlich rund 100 Token pro Sekunde erzeugen, was für mobile Edge-Inferenz ein beachtlicher Wert wäre. Doses AI wiederum positioniert sich mit Pestle-27B-Ternary gezielt im Medizinsegment und gibt an, Googles MedGemma-27B in nahezu allen relevanten Metriken zu übertreffen. Der Thread-Autor hebt hervor, dass alle drei Modelle aus kleinen, noch jungen Labs stammen, die bislang kein umfangreiches Reinforcement Learning (RL-Finetuning) betrieben haben – genau das wird als Hauptursache für die Schwächen bei langen, agentic Coding-Aufgaben gesehen. Die Labs haben RL-Training als nächsten Schritt angekündigt, konkrete Zeitpläne wurden nicht genannt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com3w
Übersicht: 1-bit & Ternary LLM-Modelle – Tracking-Thread August 2026
- GERÜCHTreddit.com3w
Liquid AI kündigt 100-Milliarden-Parameter-Modell LFM an
- LAUNCHreddit.com3w
SupraLabs veröffentlicht Supra2-Medium-Base: 25M-Parameter-Modell konkurriert mit 50M-Vorgänger
- MEINUNGreddit.com23h
Community-Diskussion: Modellwahl und Geschwindigkeit auf Apple M5 Pro 64 GB