Praxisbericht: Bonsai-Ternary-27B auf RTX 4060Ti 16GB für Agenten-Workflows
Der Bericht stammt von einem langjährigen LocalLLaMA-Leser, der Bonsai-Ternary-27B als Drop-in-Ersatz für sein minimax-m3-Cloud-Abo evaluiert – ausgelöst durch Infrastrukturprobleme des Cloud-Anbieters (zufällige Abbrüche, verlangsamtes Prompt-Processing). Als Backend nutzt er einen PrismML-Fork von llama.cpp hinter llama-swap, davor läuft ein Pi-Agent mit selbst geschriebenen Erweiterungen für Obsidian-Vault-Verwaltung und ein selbst gebautes Projektmanagementsystem. Im direkten Vergleich mit Gemma 4 12B QAT (~1000 tk/s Prefill), Gemma 4 26B QAT (~400 tk/s Prefill) und Qwen 3.6 35B A3B (~300 tk/s Prefill) liegt Bonsai-Ternary-27B mit 600–700 tk/s Prefill im Mittelfeld, überzeugt aber als einziges Modell durch vollständiges Laden in den 16-GB-VRAM ohne Layer-Offloading. Decode-Geschwindigkeit beträgt 20 tk/s ohne dspark; mit funktionierendem dspark steigt sie auf ~40 tk/s – vergleichbar mit den Offloading-Alternativen. Ein konkreter Bug im PrismML-Fork sorgt dafür, dass der dspark-Draft-Kontext an den Hauptmodell-Kontext (150k) gekoppelt wird statt auf 4k zu bleiben, was zu CUDA-Speicherüberlauf führt. Besonders auffällig ist die schwache Instruktionstreue: Das Modell lädt einen vorgeschriebenen Produktivitäts-Skill nur in etwa einem von zehn Durchläufen eigenständig, findet zwar häufig Umwege, aber nicht immer den gewünschten.
- Hardware-Setup: AMD Ryzen 5 (AM5), 32 GB DDR5 @ 6000 MT/s, RTX 4060 Ti 16 GB – Bonsai-Ternary-27B passt vollständig in den VRAM ohne CPU-Offloading.
- Kontext-Limit: Mit f16-KV-Cache nur ~100k Context möglich; Q8_0-KV-Cache ermöglicht bis zu 150k Token im gleichen VRAM-Budget.
- dspark-Bug im PrismML-Fork: Draft-Modell übernimmt fälschlicherweise den -c-Wert des Hauptmodells (z. B. 150k statt 4k), was CUDA-Speicherallokation sprengt; bei funktionierendem dspark steigt Decode von 20 auf ~40 tk/s.
- Vision-Funktion getestet: Das Modell analysierte FR-Diagramme von In-Ear-Monitoren (IEMs) korrekt und lieferte eine Einschätzung der Klangcharakteristik.
- Vergleichsmodelle: Gemma 4 12B QAT (262k Kontext, kein MTP, ~1000 tk/s Prefill) war speed-seitig am komfortabelsten; Qwen 3.6 35B A3B (alle Expert-Layer offloaded) kam qualitativ minimax-m3 am nächsten.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com1w
Community-Diskussion: Welche lokalen LLMs für welche Hardware und Anwendungsfälle?
- LAUNCHthesequence.substack.com2w
PrismML Bonsai 27B: 27-Mrd-Parameter-Modell in 3,9 GB für Smartphones
- MEINUNGreddit.com2w
Ersteinstieg in lokale LLMs mit ik_llama auf 12 GB VRAM
- MEINUNGreddit.com2w
Qwen 3.8 27B UD-IQ3_XXS: 200k+ Kontext auf 16 GB VRAM mit eGPU
Praxisbericht: Bonsai-Ternary-27B auf RTX 4060Ti 16GB für Agenten-Workflows
Der Bericht stammt von einem langjährigen LocalLLaMA-Leser, der Bonsai-Ternary-27B als Drop-in-Ersatz für sein minimax-m3-Cloud-Abo evaluiert – ausgelöst durch Infrastrukturprobleme des Cloud-Anbieters (zufällige Abbrüche, verlangsamtes Prompt-Processing). Als Backend nutzt er einen PrismML-Fork von llama.cpp hinter llama-swap, davor läuft ein Pi-Agent mit selbst geschriebenen Erweiterungen für Obsidian-Vault-Verwaltung und ein selbst gebautes Projektmanagementsystem. Im direkten Vergleich mit Gemma 4 12B QAT (~1000 tk/s Prefill), Gemma 4 26B QAT (~400 tk/s Prefill) und Qwen 3.6 35B A3B (~300 tk/s Prefill) liegt Bonsai-Ternary-27B mit 600–700 tk/s Prefill im Mittelfeld, überzeugt aber als einziges Modell durch vollständiges Laden in den 16-GB-VRAM ohne Layer-Offloading. Decode-Geschwindigkeit beträgt 20 tk/s ohne dspark; mit funktionierendem dspark steigt sie auf ~40 tk/s – vergleichbar mit den Offloading-Alternativen. Ein konkreter Bug im PrismML-Fork sorgt dafür, dass der dspark-Draft-Kontext an den Hauptmodell-Kontext (150k) gekoppelt wird statt auf 4k zu bleiben, was zu CUDA-Speicherüberlauf führt. Besonders auffällig ist die schwache Instruktionstreue: Das Modell lädt einen vorgeschriebenen Produktivitäts-Skill nur in etwa einem von zehn Durchläufen eigenständig, findet zwar häufig Umwege, aber nicht immer den gewünschten.
- Hardware-Setup: AMD Ryzen 5 (AM5), 32 GB DDR5 @ 6000 MT/s, RTX 4060 Ti 16 GB – Bonsai-Ternary-27B passt vollständig in den VRAM ohne CPU-Offloading.
- Kontext-Limit: Mit f16-KV-Cache nur ~100k Context möglich; Q8_0-KV-Cache ermöglicht bis zu 150k Token im gleichen VRAM-Budget.
- dspark-Bug im PrismML-Fork: Draft-Modell übernimmt fälschlicherweise den -c-Wert des Hauptmodells (z. B. 150k statt 4k), was CUDA-Speicherallokation sprengt; bei funktionierendem dspark steigt Decode von 20 auf ~40 tk/s.
- Vision-Funktion getestet: Das Modell analysierte FR-Diagramme von In-Ear-Monitoren (IEMs) korrekt und lieferte eine Einschätzung der Klangcharakteristik.
- Vergleichsmodelle: Gemma 4 12B QAT (262k Kontext, kein MTP, ~1000 tk/s Prefill) war speed-seitig am komfortabelsten; Qwen 3.6 35B A3B (alle Expert-Layer offloaded) kam qualitativ minimax-m3 am nächsten.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com1w
Community-Diskussion: Welche lokalen LLMs für welche Hardware und Anwendungsfälle?
- LAUNCHthesequence.substack.com2w
PrismML Bonsai 27B: 27-Mrd-Parameter-Modell in 3,9 GB für Smartphones
- MEINUNGreddit.com2w
Ersteinstieg in lokale LLMs mit ik_llama auf 12 GB VRAM
- MEINUNGreddit.com2w
Qwen 3.8 27B UD-IQ3_XXS: 200k+ Kontext auf 16 GB VRAM mit eGPU