102M-Modell: Recursive BitNet-v2 mit 64K-Kontext für 100 € trainiert
Warum es zählt
Das Experiment zeigt, dass BitNet-v2 mit rekursivem Layer-Sharing und 64K-Kontext auf weniger als 5B Tokens trainierbar ist – relevant für Forscher, die effiziente Architekturen mit minimalem Budget erkunden. Das Modell ist inkl. Gewichten und Inferenzcode öffentlich auf HuggingFace verfügbar.
— Lumeric Redaktion
Zero-Shot LM-Eval (lm-eval 0.4.12) · Spitzenwert
40.11%
ARC-Easy
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGreddit.com2w
Engram-Architektur: 2,6B-Modell mit 4,3B-Wissenstabelle im Training
- FORSCHUNGarxiv.org3w
Feedforward-Graph aus gefrorenen LLMs erreicht 87,3 % auf ARC-Challenge
- FORSCHUNGreddit.com6d
Apex-2: 3,87B-MoE-Modell von Grund auf mit nur 86,5B Token trainiert
- LAUNCHreddit.com3w
Aurora 1.0-150M: Kleines Open-Source-Sprachmodell auf GPT-2-Small-Niveau
102M-Modell: Recursive BitNet-v2 mit 64K-Kontext für 100 € trainiert
Warum es zählt
Das Experiment zeigt, dass BitNet-v2 mit rekursivem Layer-Sharing und 64K-Kontext auf weniger als 5B Tokens trainierbar ist – relevant für Forscher, die effiziente Architekturen mit minimalem Budget erkunden. Das Modell ist inkl. Gewichten und Inferenzcode öffentlich auf HuggingFace verfügbar.
— Lumeric Redaktion
Zero-Shot LM-Eval (lm-eval 0.4.12) · Spitzenwert
40.11%
ARC-Easy
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGreddit.com2w
Engram-Architektur: 2,6B-Modell mit 4,3B-Wissenstabelle im Training
- FORSCHUNGarxiv.org3w
Feedforward-Graph aus gefrorenen LLMs erreicht 87,3 % auf ARC-Challenge
- FORSCHUNGreddit.com6d
Apex-2: 3,87B-MoE-Modell von Grund auf mit nur 86,5B Token trainiert
- LAUNCHreddit.com3w
Aurora 1.0-150M: Kleines Open-Source-Sprachmodell auf GPT-2-Small-Niveau