Never mind the metrics -- what about the uncertainty? Visualising confusion matrix metric distributions
Dieses Paper argumentiert, dass die der empirischen Klassifikator-Leistungsmetriken inhärente erhebliche Unsicherheit oft die beobachteten Unterschiede in der Modellgenauigkeit übersteigt, und plädiert für eine ausgewogene Perspektive durch neuartige Visualisierungen von Konfusionsmatrix-Verteilungen und posterioren prädiktiven Wahrscheinlichkeiten im ROC-Raum.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Die Kernidee: Schau nicht nur auf den Punktestand; schau auf die Stichprobengröße
Stellen Sie sich vor, Sie bewerten einen Kochwettbewerb. Zwei Köche reichen ihre Gerichte ein.
- Koch A kocht einen perfekten Burger.
- Koch B kocht 1.000 Burger, von denen 900 perfekt sind, aber 100 sind verbrannt.
Wenn Sie nur auf die „Erfolgsrate“ (die Metrik) schauen, wirkt Koch A wie ein Genie (100 % Erfolg), und Koch B wirkt wie ein Versager (90 % Erfolg). Aber wenn Sie die Stichprobengröße kennen, erkennen Sie, dass Koch A's perfekter Burger vielleicht nur Glück war, während Koch B bewiesen hat, dass er konsistent gutes Essen zubereiten kann.
Diese Arbeit argumentiert, dass wir in der maschinellen Lernprozesse besessen von der „Punktzahl“ (der Metrik) sind, aber oft vergessen zu fragen: „Auf wie viel Daten basierte dieser Wert?“
Die Autoren, David Lovell und sein Team, wollen, dass wir aufhören darüber zu streiten, welche einzelne Zahl (wie Genauigkeit oder MCC) der „beste“ Weg ist, um ein Computerprogramm zu beurteilen. Stattdessen wollen sie uns dazu bringen, die Unsicherheit hinter diesen Zahlen zu visualisieren. Sie zeigen, dass der „Wert“, wenn man nur kleine Mengen an Daten hat, wackelig und unzuverlässig ist, egal wie ausgefeilt die Metrik auch sein mag.
Die Konfusionsmatrix: Die Ergebnistabelle
Um einen Klassifikator (ein Programm, das „Ja“ oder „Nein“ rät) zu verstehen, verwenden wir eine Konfusionsmatrix. Betrachten Sie dies als eine einfache Ergebnistabelle mit vier Feldern:
- Richtig Positiv (True Positives): Sie haben „Ja“ geraten, und es war „Ja“. (Richtig!)
- Falsch Positiv (False Positives): Sie haben „Ja“ geraten, aber es war „Nein“. (Fehlalarm)
- Falsch Negativ (False Negatives): Sie haben „Nein“ geraten, aber es war „Ja“. (Übersehen)
- Richtig Negativ (True Negatives): Sie haben „Nein“ geraten, und es war „Nein“. (Richtig!)
Normalerweise nehmen die Leute diese vier Zahlen und pressen sie zu einer einzigen Zahl (einer Metrik) zusammen, um zu sagen: „Dieses Modell ist zu 85 % gut.“ Das Papier sagt, dass dies gefährlich ist, weil man Informationen verliert. Es ist, als würde man einen ganzen Film in einem einzigen Wort zusammenfassen.
Das 3D-„Konfusions-Tetraeder“: Eine neue Art des Hinsehens
Die Autoren haben erkannt, dass diese vier Zahlen auf der Ergebnistabelle tatsächlich miteinander verbunden sind. Wenn man die Gesamtzahl der Beispiele kennt, erzwingt die Änderung einer Zahl, dass sich die anderen ändern.
Sie schlagen vor, diese Ergebnistabellen nicht als flache Tabelle, sondern als ein 3D-Pyramide (oder Tetraeder) zu visualisieren.
- Stellen Sie sich eine Pyramide vor, in der jeder einzelne Punkt im Inneren eine einzigartige mögliche Ergebnistabelle darstellt.
- Die Ecken der Pyramide repräsentieren Extremfälle (z. B. alles richtig zu machen oder alles falsch zu machen).
- Indem man diese 3D-Form betrachtet, kann man sehen, wie sich verschiedene Leistungsmetriken (wie „Genauigkeit“ oder „MCC“) verhalten. Sie sind keine flachen Linien; sie sind gekrümmte Oberflächen (Konturen), die sich um diese Pyramide legen.
Die Analogie: Denken Sie an die 3D-Pyramide als eine Landschaft. Die „Leistungsmetriken“ sind wie Höhenlinien auf einer Wanderkarte. Wenn Sie entlang einer bestimmten Konturlinie wandern, bleibt Ihr „Wert“ gleich, obwohl sich Ihre tatsächliche Mischung aus richtigen und falschen Antworten ändert.
Das Problem von „kleinen Daten“ und Unsicherheit
Dies ist der wichtigste Teil der Arbeit.
Wenn ein Computermodell getestet wird, betrachtet es normalerweise eine begrenzte Anzahl von Beispielen (z. B. 100 Fotos).
- Die Realität: Das Modell hat 90 richtig gemacht.
- Die Unsicherheit: Wenn wir es an einem anderen Set von 100 Fotos getestet hätten, hätte es dann immer noch 90 richtig gemacht? Vielleicht 85? Vielleicht 95?
Das Papier verwendet ein mathematisches Werkzeug namens Beta-Binomial-Verteilung (eine schicke Art zu sagen: „Wir wissen, dass wir nicht alles wissen“), um alle möglichen Ergebnistabellen abzubilden, die das Modell produziert hätte, wenn wir es erneut getestet hätten.
Das Visuelle:
Anstatt nur einen Punkt auf einem Graphen zu zeigen (den einzelnen Wert, den wir erhalten haben), zeigen sie eine Punktwolke.
- Wenn der Test viele Daten hatte, ist die Wolke eng und klein. Wir sind uns des Wertes sehr sicher.
- Wenn der Test wenig Daten hatte, ist die Wolke riesig und weit gestreut. Der Wert könnte fast alles sein.
Warum das wichtig ist: Der „Verdunkelungs“-Effekt
Die Autoren zeigen, dass diese „Wolke der Unsicherheit“ so groß sein kann, dass sie die Unterschiede zwischen zwei Modellen verdeckt (eclipses).
Die Metapher:
Stellen Sie sich zwei Läufer vor.
- Läufer A benötigt 10,0 Sekunden.
- Läufer B benötigt 10,1 Sekunden.
Wenn Sie nur auf die Stoppuhr schauen, ist Läufer A schneller. Aber wenn Ihre Stoppuhr wackelig ist und eine Fehlertoleranz von ±0,5 Sekunden hat, können Sie nicht wirklich sagen, wer schneller ist. Die „Unsicherheit“ ist größer als der „Unterschied“.
Das Papier argumentt, dass in vielen Benchmarks für maschinenlernen die Daten zu gering sind. Die Unsicherheit in den Werten ist so groß, dass die Behauptung „Modell A ist besser als Modell B“ oft nur Raten ist.
Klassen-Imbalance: Das Problem seltener Ereignisse
Das Papier befasst sich auch mit der „Klassen-Imbalance“ (Class Imbalance). Dies geschieht, wenn ein Ergebnis selten ist (z. B. die Erkennung einer seltenen Krankheit).
- Wenn Sie 1.000 gesunde Menschen und nur 1 kranken Menschen haben und Ihr Modell für jeden „Gesund“ rät, erreicht es eine Genauigkeit von 99,9 %. Aber es ist bei seiner Aufgabe völlig gescheitert.
Die Autoren zeigen, dass die „Wolke der Unsicherheit“ massiv wird, wenn eine Klasse selten ist. Selbst wenn Sie eine „balancierte“ Metrik verwenden, die darauf ausgelegt ist, dies zu korrigieren, können Sie sich über das Ergebnis nicht sicher sein, sofern Sie nicht mehr Daten über dieses seltene Ereignis haben. Keine magische mathematische Formel kann den Mangel an Daten beheben; Sie brauchen einfach mehr Beispiele.
Das Fazit
Das Papier sagt Ihnen nicht, welche Metrik Sie verwenden sollen (wie „Verwenden Sie MCC statt Genauigkeit“). Stattdessen sagt es Ihnen: Hören Sie auf, über die Metrik zu streiten und beginnen Sie, auf die Daten zu schauen.
- Metriken sind nur Zusammenfassungen: Sie verbergen die chaotische Realität der Daten.
- Unsicherheit ist real: Jeder Wert hat eine „Wolke“ möglicher Werte um sich herum.
- Daten sind das einzige Heilmittel: Wenn Sie sicher sein wollen, dass ein Modell gut ist, benötigen Sie mehr Daten. Wenn Sie wenig Daten haben, könnte Ihr „perfekter Wert“ nur ein Zufallstreffer sein.
Die Autoren stellen interaktive 3D-Visualisierungen zur Verfügung (wie digitale Sandkästen), damit Menschen diese Konzepte ausprobieren können, die „Datenpunkte“ bewegen können und selbst sehen können, wie die Unsicherheitswolken wachsen und schrumpfen. Ihr Ziel ist es, Wissenschaftler und Ingenieure zu der Erkenntnis zu führen, dass ein hoher Wert auf einem kleinen Datensatz keine Garantie für ein gutes Modell ist.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.