Qwen3-27B abliteriert: Refusal-Rate 64–99% → 0–6%, Capability kaum verändert
ToolsQwen
Warum es zählt
Die Entkopplung von Refusal und allgemeiner Fähigkeit stützt die Arditi-Hypothese, dass Verweigerungsverhalten auf eine einzelne Richtung im Modell lokalisiert ist. Für AI-Builder bedeutet das: Safety-Alignment lässt sich ohne große Capability-Einbußen entfernen – was Red-Teaming und Alignment-Forschung gleichermaßen betrifft.
— Lumeric Redaktion
MMLU / GSM8K (Capability) vs. Refusal-Rate · Spitzenwert
82%
Qwen3-27B Base – Refusal
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3-27B abliteriert: Refusal-Rate 64–99% → 0–6%, Capability kaum verändert
ToolsQwen
Warum es zählt
Die Entkopplung von Refusal und allgemeiner Fähigkeit stützt die Arditi-Hypothese, dass Verweigerungsverhalten auf eine einzelne Richtung im Modell lokalisiert ist. Für AI-Builder bedeutet das: Safety-Alignment lässt sich ohne große Capability-Einbußen entfernen – was Red-Teaming und Alignment-Forschung gleichermaßen betrifft.
— Lumeric Redaktion
MMLU / GSM8K (Capability) vs. Refusal-Rate · Spitzenwert
82%
Qwen3-27B Base – Refusal
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.