Bev: Finetuned Qwen3.5-9B-Modell liegt absichtlich 98 % der Zeit falsch
CompaniesHugging Face
Warum es zählt
Wer Automatisierungsregeln wie „handle autonom ab 90 % Konfidenz" einsetzt, testet diese meist nur mit korrekt ausgerichteten Modellen. Bev zeigt, dass hohe Konfidenz und Korrektheit entkoppelt sind – Pipelines, die Bev nicht erkennen, prüfen ihre Sicherheitsgrenzen nicht wirklich.
— Lumeric Redaktion
98,1 % falsch, 96 % Konfidenz
auf 324 held-out Entscheidungen
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org4d
Audit zeigt: Kalibrierung allein sichert kein Selbstwissen in Decision Models
- FORSCHUNGhuggingface.co2w
XConf: Konfidenzschätzung durch akkumulierte Modellerfahrung
- FORSCHUNGarxiv.org2w
CoSQ reduziert falsche LLM-Antworten um 32 % ohne Fine-Tuning
- MEINUNGtowardsdatascience.com1w
LLM-Pipelines scheitern oft daran, "keine Antwort" korrekt zurückzugeben
Bev: Finetuned Qwen3.5-9B-Modell liegt absichtlich 98 % der Zeit falsch
CompaniesHugging Face
Warum es zählt
Wer Automatisierungsregeln wie „handle autonom ab 90 % Konfidenz" einsetzt, testet diese meist nur mit korrekt ausgerichteten Modellen. Bev zeigt, dass hohe Konfidenz und Korrektheit entkoppelt sind – Pipelines, die Bev nicht erkennen, prüfen ihre Sicherheitsgrenzen nicht wirklich.
— Lumeric Redaktion
98,1 % falsch, 96 % Konfidenz
auf 324 held-out Entscheidungen
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org4d
Audit zeigt: Kalibrierung allein sichert kein Selbstwissen in Decision Models
- FORSCHUNGhuggingface.co2w
XConf: Konfidenzschätzung durch akkumulierte Modellerfahrung
- FORSCHUNGarxiv.org2w
CoSQ reduziert falsche LLM-Antworten um 32 % ohne Fine-Tuning
- MEINUNGtowardsdatascience.com1w
LLM-Pipelines scheitern oft daran, "keine Antwort" korrekt zurückzugeben