Hugging Face veröffentlicht The Stack v3 – bisher größtes offenes Code-Dataset
ToolsHugging Face
CompaniesHugging Face
Warum es zählt
Mit 114 TB ist The Stack v3 das größte verfügbare offene Code-Dataset und ermöglicht das Training oder Fine-Tuning eigener Code-LLMs ohne proprietäre Datenabhängigkeit. Die zwei Varianten (fertig gefiltert vs. Roh-Korpus) decken unterschiedliche Anwendungsfälle ab.
— Lumeric Redaktion
114 TB
Gesamtgröße des Roh-Korpus (Stack v3)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org2d
SciCodePile: 128-GB-Korpus und Benchmark für wissenschaftliche Code-Generierung
- LAUNCHreddit.com10h
HuggingHack: Lokales HuggingFace-Tool jetzt auf GitHub verfügbar
- FORSCHUNGarxiv.org2w
Neuer Benchmark für wissenschaftliche Code-Suche über 5.264 GitHub-Repos
- LAUNCHhuggingface.co2w
Hugging Face & NVIDIA: Open Data für KI-Agenten
Hugging Face veröffentlicht The Stack v3 – bisher größtes offenes Code-Dataset
ToolsHugging Face
CompaniesHugging Face
Warum es zählt
Mit 114 TB ist The Stack v3 das größte verfügbare offene Code-Dataset und ermöglicht das Training oder Fine-Tuning eigener Code-LLMs ohne proprietäre Datenabhängigkeit. Die zwei Varianten (fertig gefiltert vs. Roh-Korpus) decken unterschiedliche Anwendungsfälle ab.
— Lumeric Redaktion
114 TB
Gesamtgröße des Roh-Korpus (Stack v3)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org2d
SciCodePile: 128-GB-Korpus und Benchmark für wissenschaftliche Code-Generierung
- LAUNCHreddit.com10h
HuggingHack: Lokales HuggingFace-Tool jetzt auf GitHub verfügbar
- FORSCHUNGarxiv.org2w
Neuer Benchmark für wissenschaftliche Code-Suche über 5.264 GitHub-Repos
- LAUNCHhuggingface.co2w
Hugging Face & NVIDIA: Open Data für KI-Agenten