Qwen3-0.6B via Knowledge Distillation von 36 % auf 100 % Genauigkeit gebracht
Warum es zählt
Few-Shot-Prompting verschlechterte das 0.6B-Modell aktiv (33 % Accuracy, Kontext-Leakage), während QLoRA-Distillation auf nur ~170 Dokumenten massiv half. Wichtige Warnung: Der Student kopiert Gewohnheiten des Teachers, nicht dessen Absicht – schlechte Teacher-Labels erzeugen schlechte Studenten.
— Lumeric Redaktion
Section Accuracy (10-K Filings, 49 Held-out Docs) · Spitzenwert
98.4%
Teacher (8B)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3-0.6B via Knowledge Distillation von 36 % auf 100 % Genauigkeit gebracht
Warum es zählt
Few-Shot-Prompting verschlechterte das 0.6B-Modell aktiv (33 % Accuracy, Kontext-Leakage), während QLoRA-Distillation auf nur ~170 Dokumenten massiv half. Wichtige Warnung: Der Student kopiert Gewohnheiten des Teachers, nicht dessen Absicht – schlechte Teacher-Labels erzeugen schlechte Studenten.
— Lumeric Redaktion
Section Accuracy (10-K Filings, 49 Held-out Docs) · Spitzenwert
98.4%
Teacher (8B)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.