
KI-Text-Detektion mit klassischem ML: SVM erkennt LLM-Texte mit 85% Genauigkeit
Der Autor des Beitrags startete das Projekt, nachdem er auf der chinesischen Plattform Lofter gehäuft minderwertige, KI-generierte Fanfiction entdeckte – teils sogar mit unbereinigten Markdown-Headern direkt in den Posts. Als Trainingsdaten nutzte er rund 10.000 menschlich verfasste Texte von zwei nicht namentlich genannten chinesischen Plattformen (beschrieben als „Ford-like" und „River-like"), gefiltert auf Veröffentlichungszeitraum 2010–2022, also vor der ChatGPT-Ära. Die LLM-Gegenstücke erzeugte er, indem er Kapitelzusammenfassungen der Originaltexte durch ein LLM schickte und daraus neue Volltexte regenerieren ließ – sieben verschiedene Modelle kamen dabei zum Einsatz, darunter Gemini-3-Pro, Qwen-Code, GLM-5 und Kimi. Um die API-Kosten zu drücken, nutzte er kostenlose Kontingente, Promotions und Batch-Optimierungen; dennoch summierte sich der rechnerische Gegenwert allein der Gemini-Tokens auf über 2.000 US-Dollar (bei regulären Preisen). Den Perplexity-Ansatz – also die Wahrscheinlichkeit jedes Wortes in einem LLM-Prediction-Ranking zu messen – testete er vorab, verwarf ihn aber wegen hoher False-Positive-Rate, schlechter Modell-Generalisierbarkeit und hoher Inferenzkosten. Stattdessen entschied er sich für einen LinearSVC aus scikit-learn, den er gemäß dem offiziellen scikit-learn-Classifier-Roadmap-Schema auswählte. Das fertige Modell ist als Online-Demo sowie als Open-Source-Projekt (lyc8503/AITextDetector auf GitHub) verfügbar.
- Trainingsdaten: ~10.000 menschliche Texte (2010–2022, pre-ChatGPT) + gleichviele LLM-regenerierte Texte, generiert mit 7 Modellen (u.a. gemini-3-pro, qwen-code, GLM-5, Kimi, Deepseek, Doubao, GLM-4.7).
- API-Kosten für Datengenerierung: Nominalwert der verbrauchten Gemini-Token lag bei über 300 Mio. Token / ~2.000 USD; tatsächlich bezahlt wurden nur ~20 USD via CLIProxyAPI + Promotions.
- Perplexity-Methode vorab getestet und verworfen: zu viele False Positives/Negatives, kein sinnvoller Schwellenwert, hohe Inferenzkosten, schlechte Cross-Modell-Generalisierung.
- Scikit-learn-Roadmap genutzt zur Modellwahl: LinearSVC und Naive Bayes als Startpunkte – Naive Bayes wurde ebenfalls erprobt, da LLMs messbare Wortwahl-Muster erzeugen.
- Einsatzkontext: Der Autor wollte primär KI-generierte Fanfiction auf Lofter erkennen; das trainierte Modell ist domänenspezifisch und nicht für allgemeine Texte optimiert.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGthe-decoder.com3w
Post-Training macht LLM-Texte erkennbar – nicht die Modelle selbst
- FORSCHUNGarxiv.org3w
LLM-Detector: Anomalieerkennung in Tabellendaten via In-Context Learning
- FORSCHUNGarxiv.org1w
Token-Filterung bei KI-Text-Erkennung: Weniger ist manchmal mehr
- FORSCHUNGarxiv.org2w
CSFG-Framework erkennt KI-generierten Text mit 97,14 % Genauigkeit

KI-Text-Detektion mit klassischem ML: SVM erkennt LLM-Texte mit 85% Genauigkeit
Der Autor des Beitrags startete das Projekt, nachdem er auf der chinesischen Plattform Lofter gehäuft minderwertige, KI-generierte Fanfiction entdeckte – teils sogar mit unbereinigten Markdown-Headern direkt in den Posts. Als Trainingsdaten nutzte er rund 10.000 menschlich verfasste Texte von zwei nicht namentlich genannten chinesischen Plattformen (beschrieben als „Ford-like" und „River-like"), gefiltert auf Veröffentlichungszeitraum 2010–2022, also vor der ChatGPT-Ära. Die LLM-Gegenstücke erzeugte er, indem er Kapitelzusammenfassungen der Originaltexte durch ein LLM schickte und daraus neue Volltexte regenerieren ließ – sieben verschiedene Modelle kamen dabei zum Einsatz, darunter Gemini-3-Pro, Qwen-Code, GLM-5 und Kimi. Um die API-Kosten zu drücken, nutzte er kostenlose Kontingente, Promotions und Batch-Optimierungen; dennoch summierte sich der rechnerische Gegenwert allein der Gemini-Tokens auf über 2.000 US-Dollar (bei regulären Preisen). Den Perplexity-Ansatz – also die Wahrscheinlichkeit jedes Wortes in einem LLM-Prediction-Ranking zu messen – testete er vorab, verwarf ihn aber wegen hoher False-Positive-Rate, schlechter Modell-Generalisierbarkeit und hoher Inferenzkosten. Stattdessen entschied er sich für einen LinearSVC aus scikit-learn, den er gemäß dem offiziellen scikit-learn-Classifier-Roadmap-Schema auswählte. Das fertige Modell ist als Online-Demo sowie als Open-Source-Projekt (lyc8503/AITextDetector auf GitHub) verfügbar.
- Trainingsdaten: ~10.000 menschliche Texte (2010–2022, pre-ChatGPT) + gleichviele LLM-regenerierte Texte, generiert mit 7 Modellen (u.a. gemini-3-pro, qwen-code, GLM-5, Kimi, Deepseek, Doubao, GLM-4.7).
- API-Kosten für Datengenerierung: Nominalwert der verbrauchten Gemini-Token lag bei über 300 Mio. Token / ~2.000 USD; tatsächlich bezahlt wurden nur ~20 USD via CLIProxyAPI + Promotions.
- Perplexity-Methode vorab getestet und verworfen: zu viele False Positives/Negatives, kein sinnvoller Schwellenwert, hohe Inferenzkosten, schlechte Cross-Modell-Generalisierung.
- Scikit-learn-Roadmap genutzt zur Modellwahl: LinearSVC und Naive Bayes als Startpunkte – Naive Bayes wurde ebenfalls erprobt, da LLMs messbare Wortwahl-Muster erzeugen.
- Einsatzkontext: Der Autor wollte primär KI-generierte Fanfiction auf Lofter erkennen; das trainierte Modell ist domänenspezifisch und nicht für allgemeine Texte optimiert.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGthe-decoder.com3w
Post-Training macht LLM-Texte erkennbar – nicht die Modelle selbst
- FORSCHUNGarxiv.org3w
LLM-Detector: Anomalieerkennung in Tabellendaten via In-Context Learning
- FORSCHUNGarxiv.org1w
Token-Filterung bei KI-Text-Erkennung: Weniger ist manchmal mehr
- FORSCHUNGarxiv.org2w
CSFG-Framework erkennt KI-generierten Text mit 97,14 % Genauigkeit