Aurora-80K: Tiny Language Model mit nur 80.000 Parametern veröffentlicht
Aurora-80K ist ein von Reddit-Nutzer /u/Tall_Abrocoma_3533 veröffentlichtes Sprachmodell an der absoluten unteren Grenze dessen, was als „Sprachmodell" bezeichnet werden kann. Mit exakt 80.000 Parametern liegt es weit unterhalb bekannter Tiny-LM-Vergleichsmodelle wie TinyLlama (1,1 Mrd. Parameter) oder MobileLLM. Bemerkenswert ist die Architekturentscheidung, ein faktorisiertes Vokabular mit 4.096 Token einzusetzen — eine Technik, die es erlaubt, trotz extremer Parameterbeschränkung ein funktionales Vokabular abzudecken, ohne den Embedding-Layer zu dominieren. Der Wikitext-2-BPB-Wert von 3,2902 (Bits per Byte) gibt Aufschluss über die Sprachmodellierungsqualität; zum Vergleich erreichen deutlich größere Modelle Werte unter 1,0. Der BLiMP-Score von 52,31 % liegt nur knapp über dem Zufallsniveau von 50 %, was zeigt, dass grammatikalisches Wissen auf dieser Parameterstufe kaum systematisch erworben wird. Arc-Easy mit 26,05 % fällt sogar unter das Zufallsniveau eines Vierwahlformats (25 % wäre Zufall), was die Grenzen des Modells bei Reasoning-Aufgaben klar markiert. Das Modell ist auf Hugging Face verfügbar und richtet sich primär an Forschende, die die untere Parametergrenze funktionierender Sprachmodelle empirisch untersuchen wollen.
- Faktorisiertes Vokabular mit 4.096 Token — ermöglicht breite Tokenabdeckung trotz minimaler Gesamtparameterzahl.
- Wikitext-2 BPB: 3,2902 — deutlich über dem Niveau kompetenter Sprachmodelle, die typischerweise unter 1,0 liegen.
- BLiMP-Score von 52,31 % liegt nur knapp über dem statistischen Zufallsniveau (50 %) für binäre Grammatikalitätsurteile.
- Arc-Easy-Ergebnis von 26,05 % entspricht in etwa dem Zufallsniveau eines Vierwahlformats (~25 %).
- Modell und weitere Informationen sind über eine Hugging-Face-Modellseite öffentlich zugänglich.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com1d
Aurora 1.0-150M: Kleines Open-Source-Sprachmodell auf GPT-2-Small-Niveau
- BENCHMARKreddit.com1w
Ling 3.0 Tiny führt Small-Model-Ranking trotz nur 1,3B aktiver Parameter
- LAUNCHreddit.com3w
SupraLabs veröffentlicht Supra2-Medium-Base: 25M-Parameter-Modell konkurriert mit 50M-Vorgänger
- FORSCHUNGarxiv.org1w
Arkios: Zweisprachiges Englisch-Nepali-Modell mit 1,04B Parametern veröffentlicht
Aurora-80K: Tiny Language Model mit nur 80.000 Parametern veröffentlicht
Aurora-80K ist ein von Reddit-Nutzer /u/Tall_Abrocoma_3533 veröffentlichtes Sprachmodell an der absoluten unteren Grenze dessen, was als „Sprachmodell" bezeichnet werden kann. Mit exakt 80.000 Parametern liegt es weit unterhalb bekannter Tiny-LM-Vergleichsmodelle wie TinyLlama (1,1 Mrd. Parameter) oder MobileLLM. Bemerkenswert ist die Architekturentscheidung, ein faktorisiertes Vokabular mit 4.096 Token einzusetzen — eine Technik, die es erlaubt, trotz extremer Parameterbeschränkung ein funktionales Vokabular abzudecken, ohne den Embedding-Layer zu dominieren. Der Wikitext-2-BPB-Wert von 3,2902 (Bits per Byte) gibt Aufschluss über die Sprachmodellierungsqualität; zum Vergleich erreichen deutlich größere Modelle Werte unter 1,0. Der BLiMP-Score von 52,31 % liegt nur knapp über dem Zufallsniveau von 50 %, was zeigt, dass grammatikalisches Wissen auf dieser Parameterstufe kaum systematisch erworben wird. Arc-Easy mit 26,05 % fällt sogar unter das Zufallsniveau eines Vierwahlformats (25 % wäre Zufall), was die Grenzen des Modells bei Reasoning-Aufgaben klar markiert. Das Modell ist auf Hugging Face verfügbar und richtet sich primär an Forschende, die die untere Parametergrenze funktionierender Sprachmodelle empirisch untersuchen wollen.
- Faktorisiertes Vokabular mit 4.096 Token — ermöglicht breite Tokenabdeckung trotz minimaler Gesamtparameterzahl.
- Wikitext-2 BPB: 3,2902 — deutlich über dem Niveau kompetenter Sprachmodelle, die typischerweise unter 1,0 liegen.
- BLiMP-Score von 52,31 % liegt nur knapp über dem statistischen Zufallsniveau (50 %) für binäre Grammatikalitätsurteile.
- Arc-Easy-Ergebnis von 26,05 % entspricht in etwa dem Zufallsniveau eines Vierwahlformats (~25 %).
- Modell und weitere Informationen sind über eine Hugging-Face-Modellseite öffentlich zugänglich.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com1d
Aurora 1.0-150M: Kleines Open-Source-Sprachmodell auf GPT-2-Small-Niveau
- BENCHMARKreddit.com1w
Ling 3.0 Tiny führt Small-Model-Ranking trotz nur 1,3B aktiver Parameter
- LAUNCHreddit.com3w
SupraLabs veröffentlicht Supra2-Medium-Base: 25M-Parameter-Modell konkurriert mit 50M-Vorgänger
- FORSCHUNGarxiv.org1w
Arkios: Zweisprachiges Englisch-Nepali-Modell mit 1,04B Parametern veröffentlicht