
Estnisches Benchmark-Ranking: Claude-Modelle resistentesten gegen russische Propaganda
Das Estonian Language Institute (ELI), eine staatlich geförderte Einrichtung, hat gemeinsam mit dem Freiwilligen-Kollektiv Propastop ein Benchmark entwickelt, das LLMs gezielt auf ihre Resistenz gegenüber russischen Einflussnarrativen testet. Grundlage sind 14 Themenkategorien – darunter der Status der Krim, die Rechtfertigung des Ukraine-Krieges, die NATO-Geschichte sowie die russische Annexion der baltischen Staaten im Zweiten Weltkrieg. Für jede Kategorie wurden Fragen in drei Varianten erstellt: neutral, mit eingebetteten falschen Annahmen aus russischer Propaganda und explizit manipulativ formuliert. Die Modelle wurden in drei Sprachen getestet – Englisch, Estnisch und Russisch –, wobei die Bewertung durch ein separates KI-Modell erfolgte, das auf die Einschätzungen von Propastop-Experten kalibriert wurde. Ein klares Muster zeigt sich bei Google: Gemini 2.5 Pro erreicht nur 82 Punkte und reagiert besonders empfindlich auf manipulativ formulierte und russischsprachige Prompts; das neuere Gemini 3.5 Flash liegt sogar nur bei 73 – ein Wert, der mit Anthropic-Modellen von vor fast zwei Jahren vergleichbar ist. Auch mehrere Open-Weight-Modelle, darunter Moonshot Kimi K2 und StepFun Step 3.5 Flash, zeigten deutlich schlechtere Ergebnisse bei russischsprachigen Anfragen. Der Forscher Gregory Asmolov von der King's College hat zudem analysiert, wie Russland über technische Allianzen mit anderen BRICS-Staaten versucht, KI-Modelle im Sinne eigener soziopolitischer Positionen zu beeinflussen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com2w
Reddit-Test: LLMs auf dem Political Compass positioniert
- FORSCHUNGarxiv.org5d
Studie: LLMs zeigen implizite politische Ausrichtung bei konfliktgerahmten Übersetzungsaufgaben
- FORSCHUNGarxiv.org2w
Studie: LLMs zeigen politischen Sycophantismus durch Meinung und Identität
- FORSCHUNGarxiv.org2w
Studie vergleicht ChatGPT-Sprache mit politischen Reden und Bullshit-Jobs

Estnisches Benchmark-Ranking: Claude-Modelle resistentesten gegen russische Propaganda
Das Estonian Language Institute (ELI), eine staatlich geförderte Einrichtung, hat gemeinsam mit dem Freiwilligen-Kollektiv Propastop ein Benchmark entwickelt, das LLMs gezielt auf ihre Resistenz gegenüber russischen Einflussnarrativen testet. Grundlage sind 14 Themenkategorien – darunter der Status der Krim, die Rechtfertigung des Ukraine-Krieges, die NATO-Geschichte sowie die russische Annexion der baltischen Staaten im Zweiten Weltkrieg. Für jede Kategorie wurden Fragen in drei Varianten erstellt: neutral, mit eingebetteten falschen Annahmen aus russischer Propaganda und explizit manipulativ formuliert. Die Modelle wurden in drei Sprachen getestet – Englisch, Estnisch und Russisch –, wobei die Bewertung durch ein separates KI-Modell erfolgte, das auf die Einschätzungen von Propastop-Experten kalibriert wurde. Ein klares Muster zeigt sich bei Google: Gemini 2.5 Pro erreicht nur 82 Punkte und reagiert besonders empfindlich auf manipulativ formulierte und russischsprachige Prompts; das neuere Gemini 3.5 Flash liegt sogar nur bei 73 – ein Wert, der mit Anthropic-Modellen von vor fast zwei Jahren vergleichbar ist. Auch mehrere Open-Weight-Modelle, darunter Moonshot Kimi K2 und StepFun Step 3.5 Flash, zeigten deutlich schlechtere Ergebnisse bei russischsprachigen Anfragen. Der Forscher Gregory Asmolov von der King's College hat zudem analysiert, wie Russland über technische Allianzen mit anderen BRICS-Staaten versucht, KI-Modelle im Sinne eigener soziopolitischer Positionen zu beeinflussen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com2w
Reddit-Test: LLMs auf dem Political Compass positioniert
- FORSCHUNGarxiv.org5d
Studie: LLMs zeigen implizite politische Ausrichtung bei konfliktgerahmten Übersetzungsaufgaben
- FORSCHUNGarxiv.org2w
Studie: LLMs zeigen politischen Sycophantismus durch Meinung und Identität
- FORSCHUNGarxiv.org2w
Studie vergleicht ChatGPT-Sprache mit politischen Reden und Bullshit-Jobs