27B-Reasoning-Modell in 5,9 GB: Ternäres GGUF für llama.cpp
Warum es zählt
Entwickler mit schwacher GPU oder reinem CPU-Setup können jetzt 27B-Klasse-Reasoning lokal betreiben. Die zwei GGUF-Packungen (PTX1_0 / PQ2_0) mit Custom-Ternary-Kerneln für CUDA, Metal und CPU sind direkt in llama.cpp nutzbar – kein FP16-Fallback nötig.
— Lumeric Redaktion
14-Benchmark-Durchschnitt (Thinking-Mode) · Spitzenwert
84.78%
Ternär PTQ1_0 (1,72 bit)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
27B-Reasoning-Modell in 5,9 GB: Ternäres GGUF für llama.cpp
Warum es zählt
Entwickler mit schwacher GPU oder reinem CPU-Setup können jetzt 27B-Klasse-Reasoning lokal betreiben. Die zwei GGUF-Packungen (PTX1_0 / PQ2_0) mit Custom-Ternary-Kerneln für CUDA, Metal und CPU sind direkt in llama.cpp nutzbar – kein FP16-Fallback nötig.
— Lumeric Redaktion
14-Benchmark-Durchschnitt (Thinking-Mode) · Spitzenwert
84.78%
Ternär PTQ1_0 (1,72 bit)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.