Blockway veröffentlicht Agens Volundr 32B: Hybrid-Architektur mit nur 18 KV-Cache-Layern
CompaniesHugging Face
Warum es zählt
Für Teams, die Long-Context-Inference auf eigener Hardware betreiben, reduziert die Architektur den KV-Cache-Speicherbedarf drastisch: 23,9 tok/s bei 128K Kontext auf 2× 48-GB-GPUs, INT4 auf einer GPU. Agentic Tasks (SWE-bench: 44 vs. 58–64) sind noch schwach; v1 mit ~10B weiteren Trainings-Tokens ist in Arbeit.
— Lumeric Redaktion
SWE-bench Verified (50-task subset) · Spitzenwert
44%
Agens Volundr 32B
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Blockway veröffentlicht Agens Volundr 32B: Hybrid-Architektur mit nur 18 KV-Cache-Layern
CompaniesHugging Face
Warum es zählt
Für Teams, die Long-Context-Inference auf eigener Hardware betreiben, reduziert die Architektur den KV-Cache-Speicherbedarf drastisch: 23,9 tok/s bei 128K Kontext auf 2× 48-GB-GPUs, INT4 auf einer GPU. Agentic Tasks (SWE-bench: 44 vs. 58–64) sind noch schwach; v1 mit ~10B weiteren Trainings-Tokens ist in Arbeit.
— Lumeric Redaktion
SWE-bench Verified (50-task subset) · Spitzenwert
44%
Agens Volundr 32B
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.