Cost-Sensitive Evaluation for Binary Classifiers
Dieser Beitrag stellt die gewichtete Genauigkeit (WA) als kosten-sensitive Evaluationsmetrik sowie ein allgemeines Umgewichtungsframework vor, um die Optimierung binärer Klassifikatoren mit der Minimierung der Gesamtklassifikationskosten in Einklang zu bringen, und zeigt auf, dass die Maximierung von WA unter Einheitskosten der Kostenminimierung entspricht und sich über diverse Imbalancen- und Kostenszenarien hinweg als robust erweist.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie sind ein Manager, der einen neuen Mitarbeiter zur Briefsortierung einstellt. Ihr Ziel ist es nicht nur, im allgemeinen Sinne die meisten Briefe „richtig" zu sortieren; Ihr Ziel ist es, Geld zu sparen.
In der Welt des maschinellen Lernens ist dies der Unterschied zwischen dem Zählen, wie viele Antworten korrekt sind (Genauigkeit), und der Berechnung der tatsächlichen Gesamtkosten der Fehler, die Sie machen.
Dieses Papier argumentiert, dass die meisten Unternehmen das falsche Lineal verwenden, um ihre KI-Modelle zu messen. Sie verwenden „Genauigkeit", die jeden Fehler als gleichwertig behandelt. Doch in der realen Welt kann ein Fehler in die eine Richtung (wie das Übersehen einer Betrugswarnung) 10.000 Dollar kosten, während ein Fehler in die andere Richtung (wie das Markieren einer sicheren Transaktion) nur 10 Dollar kostet.
Hier ist die Lösung des Papiers, einfach erklärt.
1. Das Problem: Das „Einheits-Lineal"
Stellen Sie sich vor, Sie sind ein Arzt.
- Fehler A: Sie sagen einem gesunden Patienten, er sei krank (Falsch-Positiv). Die Kosten? Er macht sich ein wenig Sorgen und macht einen billigen Test.
- Fehler B: Sie sagen einem kranken Patienten, er sei gesund (Falsch-Negativ). Die Kosten? Er erhält keine Behandlung und wird sehr krank.
Wenn Sie einen Standard-„Genauigkeits"-Score verwenden, kümmert sich der Computer nicht darum, welcher Fehler schlimmer ist. Er zählt einfach die Gesamtzahl der richtigen gegenüber den falschen Antworten. Wenn Sie 1.000 gesunde Patienten und nur einen kranken Patienten haben, wird ein Computer, der sagt „Alle sind gesund", zu 99,9 % genau sein. Aber er hat seinen wichtigsten Job verfehlt: die kranke Person zu finden.
Das Papier sagt: „Hören Sie auf, Genauigkeit zu verwenden. Es lügt Sie über das Geld, das Sie verlieren."
2. Die Lösung: „Gewichtete Genauigkeit" (WA)
Die Autoren schlagen eine neue Metrik vor, die Gewichtete Genauigkeit (WA) genannt wird.
Stellen Sie sich dies wie ein gewichtetes Wahlsystem vor.
- Bei einer normalen Wahl zählt jede Stimme als 1.
- Bei diesem neuen System zählt eine Stimme einer „hochriskanten" Gruppe mehr.
Wenn das Übersehen eines kranken Patienten (Fehler B) 9-mal teurer ist als das Beunruhigen eines gesunden Patienten (Fehler A), gibt das System der Stimme des „kranken Patienten" das 9-fache Gewicht.
Durch die Verwendung dieses gewichteten Scores wird der Computer gezwungen, die teuren Fehler zu priorisieren. Das Papier beweist mathematisch, dass wenn Sie diese Gewichtete Genauigkeit maximieren, Sie automatisch Ihre Gesamtkosten minimieren. Es ist wie das Finden des kürzesten Weges zum Ausgang; wenn Sie der Karte der Gewichteten Genauigkeit folgen, sind Sie garantiert, das meiste Geld zu sparen.
3. Die Falle: „Resampling" (Der Balanceakt)
Viele Datenwissenschaftler versuchen, das Problem der „unausgewogenen Daten" (wo eine Gruppe riesig und die andere winzig ist) durch Resampling zu beheben.
- Die Analogie: Stellen Sie sich einen Beutel mit 100 roten Murmeln und 1 blauen Murmel vor. Sie möchten ein Modell trainieren, um die blaue Murmel zu finden. Resampling ist so, als würden Sie 90 rote Murmeln wegwerfen oder die blaue Murmel 90-mal kopieren, damit der Beutel ausgewogen aussieht (50/50).
Das Papier warnt: Das ist gefährlich.
Nur weil Sie den Beutel ausgeglichen haben, bedeutet das nicht, dass die reale Welt ausgeglichen ist. Wenn die reale Welt immer noch 100 rote Murmeln und 1 blaue Murmel hat, wird Ihr Modell verwirrt sein. Es könnte anfangen, die blaue Murmel zu ignorieren, weil es denkt, die roten seien genauso wichtig, was zu enormen finanziellen Verlusten führt.
Die Autoren schlagen einen besseren Weg vor: Neugewichtung.
Anstatt Murmeln wegzuwerfen oder zu kopieren, sagen Sie dem Computer einfach: „Hey, wenn Sie eine blaue Murmel sehen, achten Sie besonders darauf. Wenn Sie eine rote sehen, achten Sie normal darauf." Sie behalten die Daten genau so, wie sie sind, ändern aber die Bedeutung jedes einzelnen Datenelements. Dies hält das Modell ehrlich zur realen Welt, während es ihm gleichzeitig beibringt, sich um die seltenen, teuren Fehler zu kümmern.
4. Der „Realwelt"-Test
Die Autoren haben nicht nur Mathematik auf Papier betrieben; sie haben dies in zwei unordentlichen, realen Szenarien getestet:
- Churn-Vorhersage: Vorhersage, welche Kunden einen Service kündigen werden. (Den Verlust eines großen Kunden kostet mehr als den Verlust eines kleinen).
- Kredit-Scoring: Vorhersage, wer einen Kredit nicht zurückzahlen wird. (Der Verlust eines Kredits an eine reiche Person kostet mehr als an eine arme Person).
Bei diesen Tests war die „Kosten" eines Fehlers keine feste Zahl; sie hing davon ab, wer der Kunde war.
- Das Ergebnis: Die neue Metrik der Gewichteten Genauigkeit blieb perfekt auf die Geldersparnis ausgerichtet, selbst wenn die Kosten unordentlich waren und von Person zu Person variierten.
- Das Versagen: Die meisten anderen beliebten Metriken (wie F1-Score, Kappa oder ROC-AUC) wurden verwirrt. Sie würden ein Modell auswählen, das auf dem Papier „gut" aussah, dem Unternehmen aber tatsächlich viel Geld kostete.
5. Die „Heavy Tail"-Warnung
Es gibt einen Haken. Das Papier stellt fest, dass, wenn die Kosten extrem verzerrt sind – wie wenn 99 % des gesamten gefährdeten Geldes von nur einem spezifischen Kunden stammen –, selbst die neue Metrik ein wenig unscharf werden kann.
- Analogie: Stellen Sie sich ein Spiel vor, bei dem 99 Personen 1 Dollar wetten und eine Person 1.000.000 Dollar. Wenn Sie die 1.000.000-Dollar-Wette verpassen, verlieren Sie alles. Wenn Ihr Modell nicht genau weiß, wer diese eine Person ist, könnte es Schwierigkeiten haben.
Das Papier zeigt jedoch, dass die neue Metrik für fast alle normalen Geschäftssituationen perfekt funktioniert.
Zusammenfassung
- Verwenden Sie keine Genauigkeit: Sie behandelt alle Fehler als gleichwertig, was im Geschäftsleben selten der Fall ist.
- Resampling von Daten allein reicht nicht: Das Wegwerfen von Daten, um sie „ausgewogen" zu machen, zerstört oft die Fähigkeit des Modells, mit der realen Welt umzugehen.
- Verwenden Sie Gewichtete Genauigkeit (WA): Es ist eine einfache Möglichkeit, dem Computer zu sagen: „Diese Art von Fehler kostet mehr, also beheben Sie sie zuerst."
- Das Ergebnis: Durch die Verwendung von WA stellen Sie sicher, dass Ihre KI tatsächlich auf Return on Investment (ROI) und Geldersparnis optimiert ist, anstatt nur auf einer Tabelle gut auszusehen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.