DWARF-55M-Base: Fast vollständig sparsame Attention-Architektur veröffentlicht
ToolsHugging Face
CompaniesHugging Face
Warum es zählt
Der nahezu konstante KV-Cache-Aufwand (O(1)) bei steigender Kontextlänge könnte Inferenz auf Consumer-Hardware deutlich effizienter machen. Die berichtete Generalisierung auf das 3-fache der Trainings-Kontextlänge (2048 → 6144) ist bislang noch nicht abschließend verifiziert.
— Lumeric Redaktion
10B Token
Trainingsumfang auf Dolma3 Mix 150B
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGreddit.com5d
Wave Field LLM: Neuer FFT-Attention-Mechanismus mit O(1)-Inferenz und 128K Kontext
- FORSCHUNGarxiv.org3w
Simplified Sparse Attention via Gist Tokens verbessert Long-Context-Inferenz ohne Architekturänderungen
- FORSCHUNGarxiv.org3w
BD Attention: Verlustfreie Attention-Beschleunigung per Basis-Dekomposition
DWARF-55M-Base: Fast vollständig sparsame Attention-Architektur veröffentlicht
ToolsHugging Face
CompaniesHugging Face
Warum es zählt
Der nahezu konstante KV-Cache-Aufwand (O(1)) bei steigender Kontextlänge könnte Inferenz auf Consumer-Hardware deutlich effizienter machen. Die berichtete Generalisierung auf das 3-fache der Trainings-Kontextlänge (2048 → 6144) ist bislang noch nicht abschließend verifiziert.
— Lumeric Redaktion
10B Token
Trainingsumfang auf Dolma3 Mix 150B
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGreddit.com5d
Wave Field LLM: Neuer FFT-Attention-Mechanismus mit O(1)-Inferenz und 128K Kontext
- FORSCHUNGarxiv.org3w
Simplified Sparse Attention via Gist Tokens verbessert Long-Context-Inferenz ohne Architekturänderungen
- FORSCHUNGarxiv.org3w
BD Attention: Verlustfreie Attention-Beschleunigung per Basis-Dekomposition