
Robuste Variablenselektion für Scoring-Modelle via Kreuzvalidierung
Der Artikel von Junior Jumbong auf Towards Data Science beschreibt eine strukturierte Methode zur robusten Variablenselektion für Credit-Scoring-Modelle, die auf dem Kaggle Credit Scoring Dataset mit 32.581 Krediten basiert. Ausgangspunkt sind 11 Kandidatenvariablen – 7 kontinuierliche und 4 kategoriale –, die Kredit- und Kreditnehmermerkmale abdecken, etwa Einkommen, Alter, Beschäftigungsdauer, Kreditbetrag und Zinssatz. Der Selektionsprozess gliedert sich in vier sequenzielle Filterregeln: Zunächst wird via Kruskal-Wallis-Test geprüft, ob kontinuierliche Variablen einen signifikanten Zusammenhang mit dem Default-Target aufweisen (p < 5 %). Anschließend filtert Cramér's V kategoriale Variablen, wobei ein Mindestwert von 10 % pro Fold gefordert wird – loan_intent fällt dabei heraus. In den Schritten drei und vier werden redundante Variablenpaare eliminiert: Bei kontinuierlichen Variablen gilt ein Spearman-Korrelationsschwellenwert von 60 %, bei kategorialen ein Cramér's-V-Schwellenwert von 50 %; jeweils die Variable mit dem schwächeren Default-Bezug wird entfernt. Am Ende verbleiben 5 kontinuierliche (u. a. person_income, loan_int_rate, loan_percent_income) und 2 kategoriale Variablen. Die Ergebnisse sollen in einem Folgeartikel um Monotonie- und Temporalstabilitätsanalysen der 7 selektierten Variablen ergänzt werden.
- Datenbasis: Kaggle Credit Scoring Dataset, 32.581 Kredite für medizinische, persönliche, Bildungs- und Konsolidierungszwecke; Kreditbeträge zwischen 500 und 35.000 US-Dollar.
- Stratifizierung im 4-Fold-Split erfolgt gleichzeitig nach Default-Variable UND Jahr (def_year), um Repräsentativität jedes Folds sicherzustellen.
- Regel 2 (Cramér's V): Schwellenwerte bei 10 % (untere Grenze) und 50 % (starke Assoziation); loan_intent scheitert in mindestens einem Fold und wird eliminiert.
- Regel 3 (Spearman): loan_amnt und cb_person_cred_hist_length werden als redundant entfernt, weil sie mit anderen Variablen ≥60 % korrelieren; die Variable mit niedrigerem Kruskal-Wallis-p-Wert bleibt.
- Regel 4: loan_grade fällt durch starke Cramér's-V-Korrelation mit einer anderen kategorialen Variable sowie schwächerem Default-Bezug heraus.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org1w
Trainingsseed-Varianz gefährdet Stabilität von Recommender-Evaluierungen
- FORSCHUNGarxiv.org1w
Variable Selektion für Feature-basierte Newsvendor-Modelle unter Kardinalitätsbeschränkung
- FORSCHUNGarxiv.org2w
DCIC: Neues Informationskriterium für Modellselektion bei korrelierten Prädiktoren
- FORSCHUNGarxiv.org0mo
Responsiveness Verification: Wie stabil sind ML-Modell-Vorhersagen bei Input-Änderungen?

Robuste Variablenselektion für Scoring-Modelle via Kreuzvalidierung
Der Artikel von Junior Jumbong auf Towards Data Science beschreibt eine strukturierte Methode zur robusten Variablenselektion für Credit-Scoring-Modelle, die auf dem Kaggle Credit Scoring Dataset mit 32.581 Krediten basiert. Ausgangspunkt sind 11 Kandidatenvariablen – 7 kontinuierliche und 4 kategoriale –, die Kredit- und Kreditnehmermerkmale abdecken, etwa Einkommen, Alter, Beschäftigungsdauer, Kreditbetrag und Zinssatz. Der Selektionsprozess gliedert sich in vier sequenzielle Filterregeln: Zunächst wird via Kruskal-Wallis-Test geprüft, ob kontinuierliche Variablen einen signifikanten Zusammenhang mit dem Default-Target aufweisen (p < 5 %). Anschließend filtert Cramér's V kategoriale Variablen, wobei ein Mindestwert von 10 % pro Fold gefordert wird – loan_intent fällt dabei heraus. In den Schritten drei und vier werden redundante Variablenpaare eliminiert: Bei kontinuierlichen Variablen gilt ein Spearman-Korrelationsschwellenwert von 60 %, bei kategorialen ein Cramér's-V-Schwellenwert von 50 %; jeweils die Variable mit dem schwächeren Default-Bezug wird entfernt. Am Ende verbleiben 5 kontinuierliche (u. a. person_income, loan_int_rate, loan_percent_income) und 2 kategoriale Variablen. Die Ergebnisse sollen in einem Folgeartikel um Monotonie- und Temporalstabilitätsanalysen der 7 selektierten Variablen ergänzt werden.
- Datenbasis: Kaggle Credit Scoring Dataset, 32.581 Kredite für medizinische, persönliche, Bildungs- und Konsolidierungszwecke; Kreditbeträge zwischen 500 und 35.000 US-Dollar.
- Stratifizierung im 4-Fold-Split erfolgt gleichzeitig nach Default-Variable UND Jahr (def_year), um Repräsentativität jedes Folds sicherzustellen.
- Regel 2 (Cramér's V): Schwellenwerte bei 10 % (untere Grenze) und 50 % (starke Assoziation); loan_intent scheitert in mindestens einem Fold und wird eliminiert.
- Regel 3 (Spearman): loan_amnt und cb_person_cred_hist_length werden als redundant entfernt, weil sie mit anderen Variablen ≥60 % korrelieren; die Variable mit niedrigerem Kruskal-Wallis-p-Wert bleibt.
- Regel 4: loan_grade fällt durch starke Cramér's-V-Korrelation mit einer anderen kategorialen Variable sowie schwächerem Default-Bezug heraus.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org1w
Trainingsseed-Varianz gefährdet Stabilität von Recommender-Evaluierungen
- FORSCHUNGarxiv.org1w
Variable Selektion für Feature-basierte Newsvendor-Modelle unter Kardinalitätsbeschränkung
- FORSCHUNGarxiv.org2w
DCIC: Neues Informationskriterium für Modellselektion bei korrelierten Prädiktoren
- FORSCHUNGarxiv.org0mo
Responsiveness Verification: Wie stabil sind ML-Modell-Vorhersagen bei Input-Änderungen?