Qwen 3.6 27B Abliterated: Safety-Alignment auf 7,6 % Refusal Rate reduziert
CompaniesHugging Face
Warum es zählt
Abliterierte Modelle mit minimaler Capability-Degradation (KL 0,120) sind für lokale Setups ohne Zensur relevant, zeigen aber auch, wie fragil RLHF-basierte Safety-Alignment-Methoden gegenüber gezielten Post-Training-Eingriffen sind.
— Lumeric Redaktion
7,6 % Refusal Rate
nach Abliteration (vorher 92 %)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen 3.6 27B Abliterated: Safety-Alignment auf 7,6 % Refusal Rate reduziert
CompaniesHugging Face
Warum es zählt
Abliterierte Modelle mit minimaler Capability-Degradation (KL 0,120) sind für lokale Setups ohne Zensur relevant, zeigen aber auch, wie fragil RLHF-basierte Safety-Alignment-Methoden gegenüber gezielten Post-Training-Eingriffen sind.
— Lumeric Redaktion
7,6 % Refusal Rate
nach Abliteration (vorher 92 %)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.