
PrismML Bonsai 27B: 27-Mrd-Parameter-Modell in 3,9 GB für Smartphones
Der Artikel aus TheSequence Knowledge Issue 924 bettet Bonsai 27B in eine breitere historische Linie der Modell-Destillation ein – von DistilBERT über Gemini Flash bis zu Gemma, Llama, Qwen, DeepSeek, Phi und Ministral. PrismML positioniert Bonsai nicht als klassisches Teacher-Student-Destillationsmodell, sondern als Produkt eines kombinierten Stacks aus End-to-End-Low-Bit-Training und Quantization-Aware Training. Das Ausgangsmodell Qwen3.6-27B benötigt in 16-Bit-Präzision rund 54 GB für seine Gewichte; Bonsai reduziert das auf 5,9 GB (ternär) bzw. 3,9 GB (binär) – eine Größenordnung, die in den Arbeitsspeicher eines High-End-Smartphones passt. Der Autor nutzt Bonsai als Ausgangspunkt, um eine konzeptuelle Neudefinition vorzunehmen: Die relevante Einheit in der modernen KI sei nicht mehr der einzelne Checkpoint, sondern die Modell-Linie (Lineage). Dabei lernt ein kleineres Modell die Wahrscheinlichkeitslandschaft eines größeren, absorbiert Reasoning-Traces, erbt Architekturentscheidungen durch Pruning und wird schließlich in einer Low-Bit-Version für den Geräteeinsatz paketiert. Das Essay behandelt damit die Frage, was heute überhaupt noch als Destillation zählt – eine Grenzfrage, die durch die Konvergenz von Destillation, Pruning und Quantisierung zunehmend schwerer zu beantworten ist.
- Bonsai 27B erschien im Juli 2026 und ist von Qwen3.6-27B abgeleitet, das im Original ~54 GB Gewichtsspeicher benötigt.
- Die ternäre Version wiegt ~5,9 GB, die binäre ~3,9 GB – letztere ist explizit auf das Speicherbudget von High-End-Smartphones ausgelegt.
- PrismML betont in seinen öffentlichen Materialien End-to-End-Low-Bit-Training statt eines klassischen Teacher-Student-Verlusts.
- Der Artikel behandelt die gesamte Destillations-Genealogie von DistilBERT und Gemini Flash bis zu Gemma, Llama, Qwen, DeepSeek, Phi und Ministral.
- Zentrale These des Essays: Die bedeutsame Einheit in moderner KI ist nicht mehr der Checkpoint, sondern die Modell-Linie (Lineage) – ein Stammbaum aus Fähigkeitsübertragungen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge

PrismML Bonsai 27B: 27-Mrd-Parameter-Modell in 3,9 GB für Smartphones
Der Artikel aus TheSequence Knowledge Issue 924 bettet Bonsai 27B in eine breitere historische Linie der Modell-Destillation ein – von DistilBERT über Gemini Flash bis zu Gemma, Llama, Qwen, DeepSeek, Phi und Ministral. PrismML positioniert Bonsai nicht als klassisches Teacher-Student-Destillationsmodell, sondern als Produkt eines kombinierten Stacks aus End-to-End-Low-Bit-Training und Quantization-Aware Training. Das Ausgangsmodell Qwen3.6-27B benötigt in 16-Bit-Präzision rund 54 GB für seine Gewichte; Bonsai reduziert das auf 5,9 GB (ternär) bzw. 3,9 GB (binär) – eine Größenordnung, die in den Arbeitsspeicher eines High-End-Smartphones passt. Der Autor nutzt Bonsai als Ausgangspunkt, um eine konzeptuelle Neudefinition vorzunehmen: Die relevante Einheit in der modernen KI sei nicht mehr der einzelne Checkpoint, sondern die Modell-Linie (Lineage). Dabei lernt ein kleineres Modell die Wahrscheinlichkeitslandschaft eines größeren, absorbiert Reasoning-Traces, erbt Architekturentscheidungen durch Pruning und wird schließlich in einer Low-Bit-Version für den Geräteeinsatz paketiert. Das Essay behandelt damit die Frage, was heute überhaupt noch als Destillation zählt – eine Grenzfrage, die durch die Konvergenz von Destillation, Pruning und Quantisierung zunehmend schwerer zu beantworten ist.
- Bonsai 27B erschien im Juli 2026 und ist von Qwen3.6-27B abgeleitet, das im Original ~54 GB Gewichtsspeicher benötigt.
- Die ternäre Version wiegt ~5,9 GB, die binäre ~3,9 GB – letztere ist explizit auf das Speicherbudget von High-End-Smartphones ausgelegt.
- PrismML betont in seinen öffentlichen Materialien End-to-End-Low-Bit-Training statt eines klassischen Teacher-Student-Verlusts.
- Der Artikel behandelt die gesamte Destillations-Genealogie von DistilBERT und Gemini Flash bis zu Gemma, Llama, Qwen, DeepSeek, Phi und Ministral.
- Zentrale These des Essays: Die bedeutsame Einheit in moderner KI ist nicht mehr der Checkpoint, sondern die Modell-Linie (Lineage) – ein Stammbaum aus Fähigkeitsübertragungen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.