Abliteration verändert Modell-Haltung: Uncensored LLMs zeigen Optimismus-Drift
Der Reddit-Nutzer /u/oleczek führte ein strukturiertes Experiment durch, um zu prüfen, ob abliterierte („uncensored") Sprachmodelle bei Börsenprognosen ehrlichere oder bessere Antworten liefern als ihre zensierten Basismodelle. Abliteration ist eine gängige Methode, um Sicherheits-Refusals aus Modellen zu entfernen, ohne ein vollständiges Finetuning vorzunehmen. Das Experiment umfasste 21.600 Einzelentscheidungen auf identischen Eingabedaten – Kursdaten und Nachrichten zu börsennotierten Unternehmen – mit und ohne Abliteration, jeweils für Gemma und Qwen. Vorab registrierte der Autor das Versuchsdesign, um nachträgliche Ergebnis-Selektion auszuschließen. Das zentrale Befund: Die Vorhersagegenauigkeit blieb in allen Varianten auf Münzwurf-Niveau – abliterierte Modelle waren nicht informativer. Überraschend war stattdessen eine messbare Verschiebung im Kommunikationsstil und in der Grundhaltung: Qwen wurde nach der Abliteration deutlich optimistischer (mehr „Up"-Calls, weniger Hedging, längere und selbstsicherere Begründungen), während Gemma in die entgegengesetzte Richtung driftete und vorsichtiger wurde. Dieses gegensätzliche Verhalten bei identischer Methode legt nahe, dass Dispositions-Drift stark von der jeweiligen Modellarchitektur und dem ursprünglichen Alignment-Training abhängt. Die Ergebnisse sind auf arXiv unter der Kennung 2607.17427 mit Code und Daten veröffentlicht.
- Getestet auf eigener Hardware (GB10/Dell) mit lokaler Inferenz – das Experiment lief vollständig offline und ohne Cloud-Dienste.
- Abliteriert wurden huihui's abliterated Versionen von Gemma und Qwen – nicht selbst erstellte Varianten.
- Die Voranmeldung (Preregistration) des Versuchsdesigns vor der Datenerhebung soll Confirmation Bias ausschließen.
- Disposition-Drift äußerte sich konkret in mehr 'Up'-Prognosen, weniger Hedging-Wörtern (maybe/uncertain) und längeren, selbstsichereren Reasoning-Texten – bei gleichbleibender Trefferquote.
- Der Autor fragt gezielt nach ähnlichen Effekten bei anderen Modellfamilien (Llama, Mistral) und alternativen Methoden wie 'Heretic'.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org1w
Fähigere LLMs können systemweite Risiken erhöhen statt senken
- FORSCHUNGarxiv.org4d
Kontextsensitivität bei LLM-Moralurteilen: 22 Modelle im Vergleich
- FORSCHUNGarxiv.org1w
Test-Time-Methode verbessert Treue von LLM-Erklärungen ohne Training
- FORSCHUNGarxiv.org1w
FUSE: Modulares Framework bewertet gefährliche Fähigkeiten von 12 LLMs
Abliteration verändert Modell-Haltung: Uncensored LLMs zeigen Optimismus-Drift
Der Reddit-Nutzer /u/oleczek führte ein strukturiertes Experiment durch, um zu prüfen, ob abliterierte („uncensored") Sprachmodelle bei Börsenprognosen ehrlichere oder bessere Antworten liefern als ihre zensierten Basismodelle. Abliteration ist eine gängige Methode, um Sicherheits-Refusals aus Modellen zu entfernen, ohne ein vollständiges Finetuning vorzunehmen. Das Experiment umfasste 21.600 Einzelentscheidungen auf identischen Eingabedaten – Kursdaten und Nachrichten zu börsennotierten Unternehmen – mit und ohne Abliteration, jeweils für Gemma und Qwen. Vorab registrierte der Autor das Versuchsdesign, um nachträgliche Ergebnis-Selektion auszuschließen. Das zentrale Befund: Die Vorhersagegenauigkeit blieb in allen Varianten auf Münzwurf-Niveau – abliterierte Modelle waren nicht informativer. Überraschend war stattdessen eine messbare Verschiebung im Kommunikationsstil und in der Grundhaltung: Qwen wurde nach der Abliteration deutlich optimistischer (mehr „Up"-Calls, weniger Hedging, längere und selbstsicherere Begründungen), während Gemma in die entgegengesetzte Richtung driftete und vorsichtiger wurde. Dieses gegensätzliche Verhalten bei identischer Methode legt nahe, dass Dispositions-Drift stark von der jeweiligen Modellarchitektur und dem ursprünglichen Alignment-Training abhängt. Die Ergebnisse sind auf arXiv unter der Kennung 2607.17427 mit Code und Daten veröffentlicht.
- Getestet auf eigener Hardware (GB10/Dell) mit lokaler Inferenz – das Experiment lief vollständig offline und ohne Cloud-Dienste.
- Abliteriert wurden huihui's abliterated Versionen von Gemma und Qwen – nicht selbst erstellte Varianten.
- Die Voranmeldung (Preregistration) des Versuchsdesigns vor der Datenerhebung soll Confirmation Bias ausschließen.
- Disposition-Drift äußerte sich konkret in mehr 'Up'-Prognosen, weniger Hedging-Wörtern (maybe/uncertain) und längeren, selbstsichereren Reasoning-Texten – bei gleichbleibender Trefferquote.
- Der Autor fragt gezielt nach ähnlichen Effekten bei anderen Modellfamilien (Llama, Mistral) und alternativen Methoden wie 'Heretic'.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org1w
Fähigere LLMs können systemweite Risiken erhöhen statt senken
- FORSCHUNGarxiv.org4d
Kontextsensitivität bei LLM-Moralurteilen: 22 Modelle im Vergleich
- FORSCHUNGarxiv.org1w
Test-Time-Methode verbessert Treue von LLM-Erklärungen ohne Training
- FORSCHUNGarxiv.org1w
FUSE: Modulares Framework bewertet gefährliche Fähigkeiten von 12 LLMs