Hobby-Projekt: LLM from Scratch auf 160 GB Texten aus dem 19. Jahrhundert
ToolsHugging Face
CompaniesHugging Face
Warum es zählt
Zeigt, dass domänenspezifisches Pretraining auf historischen Korpora mit überschaubaren Ressourcen möglich ist. Das angestrebte 2B-Modell könnte ein nützlicher Ausgangspunkt für Historiker oder NLP-Projekte mit Fokus auf frühneuzeitlichem Englisch sein.
— Lumeric Redaktion
40B Tokens / 160 GB
Datensatzgröße (1800–1875 englische Texte)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Hobby-Projekt: LLM from Scratch auf 160 GB Texten aus dem 19. Jahrhundert
ToolsHugging Face
CompaniesHugging Face
Warum es zählt
Zeigt, dass domänenspezifisches Pretraining auf historischen Korpora mit überschaubaren Ressourcen möglich ist. Das angestrebte 2B-Modell könnte ein nützlicher Ausgangspunkt für Historiker oder NLP-Projekte mit Fokus auf frühneuzeitlichem Englisch sein.
— Lumeric Redaktion
40B Tokens / 160 GB
Datensatzgröße (1800–1875 englische Texte)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.