Leveraging Dissimilarity Invariance as a Robust Anchor for Learning with Noisy Labels
Dieses Paper führt NegScale ein, ein neuartiges Framework, das das stabile Phänomen der Unähnlichkeitsinvarianz nutzt, um durch die Verlagerung des Fokus von fragilen Ähnlichkeiten auf verlässliche Unähnlichkeiten mittels einer strukturierten negativen Orthogonalitätsstrafe und einer unähnlichkeitskalibrierten Ähnlichkeitsanpassung robust aus verrauschten Labels zu lernen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie bringen einem Roboter bei, Tiere zu erkennen, indem Sie ihm tausende von Bildern zeigen. In der Welt der Informatik nennt man das „visuelle Erkennung“, und so entsperrt Ihr Telefon mit Ihrem Gesicht oder Apps markieren Ihre Freunde auf Fotos. Aber hier ist der Haken: Was wäre, wenn der Lehrer, der dem Roboter die Lernkarten gibt, ein wenig schusselig ist? Manchmal klebt er versehentlich ein Etikett mit der Aufschrift „Hund“ auf ein Bild einer Katze. Das nennt man „verrauschte Labels“ (noisy labels). Wenn ein Roboter versucht, aus diesen durcheinandergebrachten Anweisungen zu lernen, wird er verwirrt. Er beginnt zu denken, dass Katzen und Hunde eigentlich dasselbe sind, weil der Lehrer immer wieder behauptet hat, sie seien es. Diese Arbeit befasst sich genau mit diesem Problem: Wie bringen wir einem Roboter bei, die Wahrheit zu lernen, wenn der Lehrer Fehler macht? Die Kernidee, auf der die Arbeit aufbreibt, ist, dass Roboter lernen, indem sie herausfinden, welche Dinge ähnlich sind (wie zwei verschiedene Hunde) und welche unterschiedlich sind (wie ein Hund und ein Frosch). Normalerweise wird der Roboter sehr schlecht darin, den Unterschied zwischen ähnlichen Dingen zu erkennen, wenn der Lehrer die Labels vermischt.
Doch die Autoren dieser Arbeit, Wenxiao Fan und Kan Li, bemerkten etwas Seltsames und Wunderbares, während sie beobachteten, wie der Roboter lernte. Sie fanden heraus, dass der Roboter zwar verwirrt darüber wurde, wie Dinge einander ähneln, aber er blieb überraschend gut darin zu wissen, was Dinge völlig unähnlich sind. Selbst wenn der Lehrer „Das ist ein Hund!“ rief, während er auf einen Frosch zeigte, wusste der Roboter tief im Inneren immer noch, dass ein Hund und ein Frosch völlig unterschiedlich sind. Die Fähigkeit des Roboters, das „Nicht-Ähnliche“ zu erkennen, blieb stabil, selbst als das „Ähnliche“ völlig durcheinandergebracht wurde. Die Autoren nennen dies „Dissimilaritäts-Invarianz“ (Dissimilarity Invariance). Es ist wie eine Superkraft, bei der man zwar nicht mehr weiß, wer die Freunde sind, weil sie alle verwirrende Namen haben, man aber immer noch sofort erkennt, dass eine Katze kein Toaster ist.
Unter Nutzung dieser Entdeckung entwickelten das Team ein neues Werkzeug namens NegScale. Stellen Sie sich NegScale als einen klugen Trainer für den Roboter vor. Anstatt zu versuchen, die verwirrenden Labels des Lehrers direkt zu korrigieren, sagt der Trainer dem Roboter: „Hey, ignoriere für einen Moment die verwirrenden ‚Gleichsamkeit‘-Labels. Konzentriere dich einfach darauf, dass ein Pferd und ein Auto definitiv nicht dasselbe sind.“ Der Trainer nutzt zwei Haupttricks. Erstens zwingt er den Roboter dazu, „unverbundene“ Dinge in völlig unterschiedliche mentale Boxen zu stecken (wie zum Beispiel einen Schuh und eine Banane in weit voneinander entfernte Räume zu legen). Zweitens fungiert er als Realitätscheck: Wenn der Roboter anfängt zu glauben, dass zwei Dinge zu ähnlich sind, weil ein schlechtes Label dies vorgibt, sagt der Trainer: „Warte, diese beiden Dinge sind in der ‚Nicht-Ähnlichkeits‘-Welt zu weit voneinander entfernt, um Freunde zu sein. Geh zurück!“
Die Arbeit zeigt, dass dieser Ansatz sehr gut funktioniert. Als sie NegScale an Standard-Bilddatensätzen wie CIFAR-10 und CIFAR-100 testeten, bei denen sie die Labels absichtlich verfälscht hatten (manchmal waren bis zu 80 % der Labels falsch!), lernte der Roboter viel besser als zuvor. Tatsächlich übertraf er fast alle anderen Methoden, die Wissenschaftler bisher ausprobiert hatten. Zum Beispiel erreichte ihre Methode bei einem Datensatz mit 80 % Rauschen etwa 95,6 % Genauigkeit, während andere Top-Methoden Schwierigkeiten hatten, über 94 % zu kommen. Sie testeten es auch mit echten, unordentlichen Daten, wie Bildern aus dem Internet, bei denen die Labels oft falsch sind, und es blieb weiterhin an der Spitze.
Die Autoren haben nicht nur geraten, dass dies funktionieren würde; sie haben die Mathematik dahinter bewiesen. Sie zeigten, dass, wenn ein Roboter lernt, der „Abstand“ zwischen Dingen, die wirklich verschieden sind, stabil bleibt, selbst wenn die Labels falsch sind. Aber die „Nähe“ zwischen Dingen, die eigentlich gleich sein sollten, wird wackelig und unzuverlässig. Indem sie den Lernprozess an die stabilen „Nicht-Ähnlichkeits“-Beziehungen ankerten, verhindert NegScale, dass der Roboter durch die verrauschten Labels getäuscht wird. Es ist ein bisschen wie die Navigation auf einer stürmischen See: Wenn die Karte (die Labels) zerrissen und verwirrend ist, versucht man nicht zu raten, wo die Inseln liegen; statlich stellt man einfach sicher, dass man weit genug von den Felsen entfernt bleibt, von denen man weiß, dass sie definitiv da sind. Dieser einfache Fokuswechsel – weg vom Versuch, die perfekte Übereinstimmung zu finden, hin zur Vermeidung unmöglicher Unstimmigkeiten – erweist sich als ein viel stärkerer Weg zu lernen, wenn die Welt chaotisch ist.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.