SupraLabs veröffentlicht weltgrößtes Chat-Titel-Dataset mit 115K Einträgen
ToolsHugging Face
CompaniesHugging Face
Warum es zählt
Das Dataset eignet sich für Instruction Tuning, klassifikationsbasierte Titelgenerierung und das Benchmarking kleiner Modelle. Die gefilterte Variante (115K) ist direkt nutzbar; die ungefilterte (150K) erlaubt eigene Cleaning-Pipelines.
— Lumeric Redaktion
115K Samples
Gefilterte Dataset-Größe (Rekord)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGtowardsdatascience.com1d
Wieviel Trainingsdaten braucht ein Textklassifizierer wirklich?
- FORSCHUNGarxiv.org0mo
CDTP: 7-Millionen-Instanzen-Datensatz für chinesisches KG-Text-Alignment
- FORSCHUNGhuggingface.co1w
Modulare Pipeline extrahiert Milliarden Token aus historischen Zeitungen
- FORSCHUNGarxiv.org3w
AraDetox: Mehrsprachiger Arabic-Detoxifizierungsdatensatz mit 84.000 Rewrites
SupraLabs veröffentlicht weltgrößtes Chat-Titel-Dataset mit 115K Einträgen
ToolsHugging Face
CompaniesHugging Face
Warum es zählt
Das Dataset eignet sich für Instruction Tuning, klassifikationsbasierte Titelgenerierung und das Benchmarking kleiner Modelle. Die gefilterte Variante (115K) ist direkt nutzbar; die ungefilterte (150K) erlaubt eigene Cleaning-Pipelines.
— Lumeric Redaktion
115K Samples
Gefilterte Dataset-Größe (Rekord)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGtowardsdatascience.com1d
Wieviel Trainingsdaten braucht ein Textklassifizierer wirklich?
- FORSCHUNGarxiv.org0mo
CDTP: 7-Millionen-Instanzen-Datensatz für chinesisches KG-Text-Alignment
- FORSCHUNGhuggingface.co1w
Modulare Pipeline extrahiert Milliarden Token aus historischen Zeitungen
- FORSCHUNGarxiv.org3w
AraDetox: Mehrsprachiger Arabic-Detoxifizierungsdatensatz mit 84.000 Rewrites