Abliterlitics: 12 Gemma 4 12B Varianten im Uncensoring-Vergleich
Der Reddit-Nutzer hinter dem Abliterlitics-Projekt hat 11 inoffizielle, uncensored Varianten von Gemma 4 12B von HuggingFace gesammelt – sortiert nach Download-Zahlen – und über dreieinhalb Wochen auf einer einzigen RTX 5090 systematisch getestet. Die Studie umfasst zehn vollständige Abliterierungen sowie zwei LoRA-Adapter, die auf Wunsch der Community nachträglich einbezogen wurden. Abliterierung ist eine Gewichtsmanipulation, die gezielt Refusal-Verhalten entfernt, indem sie bestimmte Tensoren im Modell verändert. Ein zentraler Befund: Gemma 4 12B erweist sich als das bislang robusteste Modell im Vergleich – als erstes überhaupt erreicht keine Variante eine HarmBench-ASR von 90 % oder mehr. Besonders relevant ist der Einfluss des Thinking-Mechanismus: Weil das Modell ein Reasoning-Modell ist, brechen manche abliterierten Versionen in Token-Loops aus, bevor eine Antwort produziert wird – bei openyourmind betrifft das 38 % der GSM8K-Versuche. Die Forensik der Gewichte (Weight Forensics und KL-Divergenz) zeigt, dass die chirurgischste Bearbeitung (huihui, nur 12 Tensoren, 1,8 % des Modells) zwar die höchste Unlock-Rate erzielt, aber auch den stärksten TruthfulQA-Einbruch verursacht. Alle 6.800 Modellantworten inklusive vollständiger Reasoning-Traces sind im öffentlichen HarmBench-Explorer auf abliterlitics.dev einsehbar und wurden durch einen GLM-5.2-Judge bewertet.
- huihui bearbeitet nur 12 Tensoren (1,8 % des Modells) und erzielt mit 89,8 % Judge-ASR die höchste Unlock-Rate – editiert aber auch die schlechteste TruthfulQA-Performance (-14,3 pp).
- openyourmind editiert 620 Tensoren, erzielt trotzdem nur 67,0 % ASR und reißt MMLU-Pro um 22,4 pp nach unten; der Autor selbst bestätigt, die Methode ziele auf größere Modelle ab.
- Die sdft-LoRA-Adapter erreichen 79,5 % Judge-ASR auf dem Niveau der Top-4-Abliterierungen, ohne messbare Capability-Verluste – der SDFT-Autor erklärt seine Methodik im Bericht.
- Regex-Klassifikatoren unterschätzen die Compliance von huihui um bis zu 13 Prozentpunkte, weil paraphrasierte, denklastige Antworten nicht von Keyword-Matchern erkannt werden.
- Das Basis-Modell landet bei 21,0 % ASR, davon ein Großteil aus 100 Copyright-Fragen (56 % Kategorie-ASR); bei direkten Schadensfragen liegt es nahe null.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Abliterlitics: 12 Gemma 4 12B Varianten im Uncensoring-Vergleich
Der Reddit-Nutzer hinter dem Abliterlitics-Projekt hat 11 inoffizielle, uncensored Varianten von Gemma 4 12B von HuggingFace gesammelt – sortiert nach Download-Zahlen – und über dreieinhalb Wochen auf einer einzigen RTX 5090 systematisch getestet. Die Studie umfasst zehn vollständige Abliterierungen sowie zwei LoRA-Adapter, die auf Wunsch der Community nachträglich einbezogen wurden. Abliterierung ist eine Gewichtsmanipulation, die gezielt Refusal-Verhalten entfernt, indem sie bestimmte Tensoren im Modell verändert. Ein zentraler Befund: Gemma 4 12B erweist sich als das bislang robusteste Modell im Vergleich – als erstes überhaupt erreicht keine Variante eine HarmBench-ASR von 90 % oder mehr. Besonders relevant ist der Einfluss des Thinking-Mechanismus: Weil das Modell ein Reasoning-Modell ist, brechen manche abliterierten Versionen in Token-Loops aus, bevor eine Antwort produziert wird – bei openyourmind betrifft das 38 % der GSM8K-Versuche. Die Forensik der Gewichte (Weight Forensics und KL-Divergenz) zeigt, dass die chirurgischste Bearbeitung (huihui, nur 12 Tensoren, 1,8 % des Modells) zwar die höchste Unlock-Rate erzielt, aber auch den stärksten TruthfulQA-Einbruch verursacht. Alle 6.800 Modellantworten inklusive vollständiger Reasoning-Traces sind im öffentlichen HarmBench-Explorer auf abliterlitics.dev einsehbar und wurden durch einen GLM-5.2-Judge bewertet.
- huihui bearbeitet nur 12 Tensoren (1,8 % des Modells) und erzielt mit 89,8 % Judge-ASR die höchste Unlock-Rate – editiert aber auch die schlechteste TruthfulQA-Performance (-14,3 pp).
- openyourmind editiert 620 Tensoren, erzielt trotzdem nur 67,0 % ASR und reißt MMLU-Pro um 22,4 pp nach unten; der Autor selbst bestätigt, die Methode ziele auf größere Modelle ab.
- Die sdft-LoRA-Adapter erreichen 79,5 % Judge-ASR auf dem Niveau der Top-4-Abliterierungen, ohne messbare Capability-Verluste – der SDFT-Autor erklärt seine Methodik im Bericht.
- Regex-Klassifikatoren unterschätzen die Compliance von huihui um bis zu 13 Prozentpunkte, weil paraphrasierte, denklastige Antworten nicht von Keyword-Matchern erkannt werden.
- Das Basis-Modell landet bei 21,0 % ASR, davon ein Großteil aus 100 Copyright-Fragen (56 % Kategorie-ASR); bei direkten Schadensfragen liegt es nahe null.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.