CachyLLama: llama.cpp-Fork mit persistentem SSD-KV-Cache für lange Agent-Sessions
CachyLLama ist ein Fork von llama.cpp, der gezielt das Problem der wiederholten Prompt-Verarbeitung in langen Agentic-Sessions adressiert – ein Engpass, der auf älterer oder langsamerer Hardware besonders stark ins Gewicht fällt. Kern der Lösung ist ein SSD-gestützter persistenter KV-Cache, der verarbeiteten Kontext als Checkpoints speichert und auch Server-Neustarts übersteht. Kommt der Anfang eines neuen Requests mit bereits verarbeitetem Kontext überein, stellt der Cache diesen Zustand wieder her und wertet nur den geänderten „Schwanz" des Prompts neu aus – statt von vorne zu beginnen. Darüber hinaus implementiert CachyLLama einen Multi-Tier-KV-Cache sowie einen dedizierten System-Prompt-Cache, der vor allem in Coding-Agent-Setups nützt, bei denen bei jedem Request derselbe große System-Prompt samt Tool-Definitionen mitgesendet wird. Der Post stammt von Reddit-Nutzer /u/UsualResult, der das Projekt auf einem Dual-AMD-MI50-System erprobt hat – ohne kontrolliertes Benchmark, aber mit deutlich spürbarer Verbesserung der Reaktionszeit in langen Sessions. Besonders bemerkenswert ist die Unterstützung für hybride Architekturen wie Qwen 3.5/3.6, Gemma 4 und GLM-4.7, bei denen das Wiederherstellen von rekurrentem Zustand technisch aufwändiger ist als bei rein attention-basierten Modellen. Das Projekt findet sich unter github.com/fewtarius/CachyLLama und war zum Zeitpunkt des Posts in der Community weitgehend unbekannt.
- Benchmark-Hardware für die offiziellen Projektmessungen: AMD 7840U mit integrierter Radeon 780M-GPU — kein High-End-Server.
- Der Reddit-Autor betreibt das System auf einem älteren Dual-AMD-MI50-Setup und berichtet von subjektiv stark verbesserter Reaktionszeit, ohne kontrollierten Benchmark.
- Drei Prompt-Größen im Projekt-Benchmark: ~1.243 Token (9,3 s kalt / 0,41 s warm), ~5.409 Token (43,3 s kalt / 0,57 s warm), ~15.700 Token (143,1 s kalt / 0,99 s warm).
- CachyLLama beschleunigt ausdrücklich NICHT die Token-Generierung, sondern nur die Prompt-Evaluation — ein wichtiger Unterschied zu anderen Optimierungsansätzen.
- Das Projekt wird auf GitHub unter fewtarius/CachyLLama gepflegt und war zum Post-Zeitpunkt in r/LocalLLaMA noch kaum diskutiert worden.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
CachyLLama: llama.cpp-Fork mit persistentem SSD-KV-Cache für lange Agent-Sessions
CachyLLama ist ein Fork von llama.cpp, der gezielt das Problem der wiederholten Prompt-Verarbeitung in langen Agentic-Sessions adressiert – ein Engpass, der auf älterer oder langsamerer Hardware besonders stark ins Gewicht fällt. Kern der Lösung ist ein SSD-gestützter persistenter KV-Cache, der verarbeiteten Kontext als Checkpoints speichert und auch Server-Neustarts übersteht. Kommt der Anfang eines neuen Requests mit bereits verarbeitetem Kontext überein, stellt der Cache diesen Zustand wieder her und wertet nur den geänderten „Schwanz" des Prompts neu aus – statt von vorne zu beginnen. Darüber hinaus implementiert CachyLLama einen Multi-Tier-KV-Cache sowie einen dedizierten System-Prompt-Cache, der vor allem in Coding-Agent-Setups nützt, bei denen bei jedem Request derselbe große System-Prompt samt Tool-Definitionen mitgesendet wird. Der Post stammt von Reddit-Nutzer /u/UsualResult, der das Projekt auf einem Dual-AMD-MI50-System erprobt hat – ohne kontrolliertes Benchmark, aber mit deutlich spürbarer Verbesserung der Reaktionszeit in langen Sessions. Besonders bemerkenswert ist die Unterstützung für hybride Architekturen wie Qwen 3.5/3.6, Gemma 4 und GLM-4.7, bei denen das Wiederherstellen von rekurrentem Zustand technisch aufwändiger ist als bei rein attention-basierten Modellen. Das Projekt findet sich unter github.com/fewtarius/CachyLLama und war zum Zeitpunkt des Posts in der Community weitgehend unbekannt.
- Benchmark-Hardware für die offiziellen Projektmessungen: AMD 7840U mit integrierter Radeon 780M-GPU — kein High-End-Server.
- Der Reddit-Autor betreibt das System auf einem älteren Dual-AMD-MI50-Setup und berichtet von subjektiv stark verbesserter Reaktionszeit, ohne kontrollierten Benchmark.
- Drei Prompt-Größen im Projekt-Benchmark: ~1.243 Token (9,3 s kalt / 0,41 s warm), ~5.409 Token (43,3 s kalt / 0,57 s warm), ~15.700 Token (143,1 s kalt / 0,99 s warm).
- CachyLLama beschleunigt ausdrücklich NICHT die Token-Generierung, sondern nur die Prompt-Evaluation — ein wichtiger Unterschied zu anderen Optimierungsansätzen.
- Das Projekt wird auf GitHub unter fewtarius/CachyLLama gepflegt und war zum Post-Zeitpunkt in r/LocalLLaMA noch kaum diskutiert worden.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.