Anthropic aktualisiert Schutzmaßnahmen für Wahlen
Anthropic legt mit diesem Update offen, wie Claude konkret auf wahlbezogene Anfragen reagiert und gegen Missbrauch abgesichert wird – sowohl für die US-Midterms als auch für Wahlen in anderen Ländern. Kern der Maßnahmen ist ein zweistufiger Ansatz: Erstens wird politische Neutralität bereits im sogenannten Character Training verankert, also in der Phase, in der das Modell für bestimmte Werte und Verhaltensweisen belohnt wird. Zweitens werden diese Prinzipien durch explizite Anweisungen in System-Prompts auf Claude.ai weiter verstärkt. Zur Qualitätssicherung führt Anthropic vor jedem Modell-Launch standardisierte Evaluierungen durch; Opus 4.7 erzielte dabei 95 % und Sonnet 4.6 96 % bei der Messung politischer Ausgewogenheit. Bei einem 600-Prompts-Test zur Einhaltung der wahlbezogenen Nutzungsrichtlinien – je 300 schädliche und 300 legitime Anfragen – antworteten Opus 4.7 und Sonnet 4.6 in 100 % bzw. 99,8 % der Fälle korrekt. Erstmals testete Anthropic auch, ob Modelle Einflussoperationen vollständig autonom und ohne menschliche Anleitung durchführen können: Ohne Schutzmaßnahmen schlossen nur Mythos Preview und Opus 4.7 mehr als die Hälfte der Aufgaben ab – ein Befund, den Anthropic als Warnsignal für künftige Vigilanz wertet. Zur Information der Nutzer werden auf Claude.ai sogenannte Election Banners eingeblendet, die bei Fragen zu Wählerregistrierung oder Wahllokalen auf TurboVote, eine überparteiliche Ressource von Democracy Works, verweisen; für Brasiliens Wahlen soll ein analoges Banner folgen.
- Opus 4.7 und Sonnet 4.6 bestanden den 600-Prompts-Wahlrichtlinien-Test mit 100 % bzw. 99,8 % korrekten Antworten.
- Bei Tests gegen Influence Operations (mehrstufige Simulationen) erzielten Sonnet 4.6 und Opus 4.7 90 % bzw. 94 % korrekte Ablehnungen.
- Anthropic veröffentlicht Evaluierungsmethodik und Open-Source-Datensatz, damit Dritte die Tests replizieren oder weiterentwickeln können.
- Kooperationspartner für die breitere Überprüfung von Meinungsfreiheits-Verhalten sind The Future of Free Speech (Vanderbilt University), die Foundation for American Innovation und das Collective Intelligence Project.
- Das Election-Banner auf Claude.ai leitet Nutzer für die US-Midterms an TurboVote (Democracy Works) weiter; für Brasiliens Wahlen ist ein eigenes Banner geplant.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Anthropic aktualisiert Schutzmaßnahmen für Wahlen
Anthropic legt mit diesem Update offen, wie Claude konkret auf wahlbezogene Anfragen reagiert und gegen Missbrauch abgesichert wird – sowohl für die US-Midterms als auch für Wahlen in anderen Ländern. Kern der Maßnahmen ist ein zweistufiger Ansatz: Erstens wird politische Neutralität bereits im sogenannten Character Training verankert, also in der Phase, in der das Modell für bestimmte Werte und Verhaltensweisen belohnt wird. Zweitens werden diese Prinzipien durch explizite Anweisungen in System-Prompts auf Claude.ai weiter verstärkt. Zur Qualitätssicherung führt Anthropic vor jedem Modell-Launch standardisierte Evaluierungen durch; Opus 4.7 erzielte dabei 95 % und Sonnet 4.6 96 % bei der Messung politischer Ausgewogenheit. Bei einem 600-Prompts-Test zur Einhaltung der wahlbezogenen Nutzungsrichtlinien – je 300 schädliche und 300 legitime Anfragen – antworteten Opus 4.7 und Sonnet 4.6 in 100 % bzw. 99,8 % der Fälle korrekt. Erstmals testete Anthropic auch, ob Modelle Einflussoperationen vollständig autonom und ohne menschliche Anleitung durchführen können: Ohne Schutzmaßnahmen schlossen nur Mythos Preview und Opus 4.7 mehr als die Hälfte der Aufgaben ab – ein Befund, den Anthropic als Warnsignal für künftige Vigilanz wertet. Zur Information der Nutzer werden auf Claude.ai sogenannte Election Banners eingeblendet, die bei Fragen zu Wählerregistrierung oder Wahllokalen auf TurboVote, eine überparteiliche Ressource von Democracy Works, verweisen; für Brasiliens Wahlen soll ein analoges Banner folgen.
- Opus 4.7 und Sonnet 4.6 bestanden den 600-Prompts-Wahlrichtlinien-Test mit 100 % bzw. 99,8 % korrekten Antworten.
- Bei Tests gegen Influence Operations (mehrstufige Simulationen) erzielten Sonnet 4.6 und Opus 4.7 90 % bzw. 94 % korrekte Ablehnungen.
- Anthropic veröffentlicht Evaluierungsmethodik und Open-Source-Datensatz, damit Dritte die Tests replizieren oder weiterentwickeln können.
- Kooperationspartner für die breitere Überprüfung von Meinungsfreiheits-Verhalten sind The Future of Free Speech (Vanderbilt University), die Foundation for American Innovation und das Collective Intelligence Project.
- Das Election-Banner auf Claude.ai leitet Nutzer für die US-Midterms an TurboVote (Democracy Works) weiter; für Brasiliens Wahlen ist ein eigenes Banner geplant.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.