← Neueste Arbeiten
🤖 machine learning

Debiased Negative Mining Improves Out-of-distribution Detection with Pre-trained Vision-Language Models

Dieser Artikel stellt eine neuartige Methode zur Out-of-Distribution-Erkennung mit vortrainierten Vision-Language-Modellen vor, die das Problem der falsch-negativen Ergebnisse beim Mining negativer Labels durch die Einführung eines theoretischen Rahmens für entvorteilte Stichprobenziehung adressiert, der praktisch als Monte-Carlo-Sampling implementiert wird, um einen State-of-the-Art-Ergebnis zu erzielen.

Ursprüngliche Autoren: Bo Peng, Jie Lu, Guangquan Zhang, Zhen Fang

Veröffentlicht 2026-05-25
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Bo Peng, Jie Lu, Guangquan Zhang, Zhen Fang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ganze: Das „Fremde Gefahr"-Problem für KI

Stellen Sie sich vor, Sie haben einen sehr klugen Sicherheitsbeamten (ein KI-Modell), der trainiert wurde, 1.000 spezifische Tiere zu erkennen (wie Katzen, Hunde und Adler). Dieser Beamte ist hervorragend darin, diese Tiere zu identifizieren. In der realen Welt könnte der Beamte jedoch auf ein völlig neues Tier stoßen, das er noch nie gesehen hat, wie ein Schnabeltier oder einen Roboterhund.

Wenn der Beamte zu selbstbewusst ist, versucht er möglicherweise, das Schnabeltier gewaltsam in die Kategorie „Ente" oder „Biber" zu zwängen, was ein Fehler ist. Dies wird als Out-of-Distribution (OOD)-Fehler bezeichnet. Das Ziel dieses Papers ist es, dem Beamten beizubringen, zu sagen: „Ich weiß nicht, was das ist", anstatt falsch zu raten.

Die aktuelle Lösung: Die „Liste der Nicht-Dieses"-Tiere

Um dem Beamten zu helfen, Fremde zu erkennen, haben Forscher ein spezielles Werkzeug namens Vision-Language Model (VLM) entwickelt. Stellen Sie sich dieses Werkzeug als einen Beamten vor, der nicht nur das Tier sieht, sondern auch die Namen von Tausenden anderer Tiere kennt.

Die derzeit beliebte Methode funktioniert wie folgt:

  1. Der Beamte betrachtet das unbekannte Tier.
  2. Er vergleicht das Tier mit den 1.000 bekannten Tieren (In-Distribution oder ID).
  3. Er vergleicht das Tier auch mit einer langen Liste von zufälligen Tieren, die er aus einem Wörterbuch ausgewählt hat (Negative Labels).
  4. Wenn das unbekannte Tier mehr wie die „zufällige Liste" aussieht als wie die „bekannte Liste", markiert der Beamte es als Fremden.

Das Problem: Die aktuelle Methode wählt diese „zufälligen Tiere" (negative Labels) mit einer einfachen Regel aus: „Wähle Wörter, die sich vom Klang oder Aussehen her von den bekannten Tieren unterscheiden."

  • Der Fehler: Dies ist wie der Versuch, ein „Nicht-Hund" zu finden, indem man Wörter wählt, die nicht „Hund" sind. Man könnte versehentlich „Wolf" oder „Fuchs" auswählen. Für die KI sieht ein Wolf einem Hund sehr ähnlich. Daher gerät die KI in Verwirrung. Sie denkt: „Nun, dieses neue Tier sieht aus wie ein Wolf, und ein Wolf steht auf meiner 'Nicht-Hund'-Liste, also muss dies ein Hund sein!"
  • Das Ergebnis: Die KI macht Fehler, weil ihre „Liste der Fremden" mit Dingen kontaminiert ist, die tatsächlich so aussehen wie die Dinge, die sie kennen sollte. Dies wird als Negative Mining Bias bezeichnet.

Die Lösung des Papers: Der „entzerrte" Detektiv

Die Autoren dieses Papers sagen: „Wir brauchen einen besseren Weg, um unsere 'Fremden'-Liste auszuwählen, ohne versehentlich Dinge auszuwählen, die unseren Freunden ähneln."

Sie haben einen mathematischen Trick entwickelt, um diese Verzerrung zu beheben, ohne dass ein Mensch jedes einzelne Wort auf der Liste überprüfen muss. So gehen sie vor, unter Verwendung einer Analogie:

Die Analogie: Der verrauschte Radiosender

Stellen Sie sich vor, Sie versuchen, einen bestimmten Song zu hören (das „Echte Fremde"-Signal), aber Ihr Radio fängt statisches Rauschen und andere Songs auf (das „Wild Corpus" oder ungelabelte Daten).

  • Alte Methode: Sie drehen einfach die Lautstärke des Rauschens hoch und hoffen, dass der Song, den Sie wollen, laut genug ist, um herauszustechen. Manchmal ertränkt das Rauschen den Song, oder Sie verwechseln einen ähnlich klingenden Song mit dem, den Sie wollen.
  • Neue Methode (Debiased Negative Mining): Die Autoren stellten fest, dass das „Rauschen" (die wilden Daten) tatsächlich eine Mischung aus zwei Dingen ist:
    1. Dinge, die Ihren bekannten Freunden ähnlich sind (Positives Rauschen).
    2. Dinge, die wirklich Fremde sind (Negatives Rauschen).

Anstatt zu raten, was was ist, verwenden sie einen mathematischen Subtraktionstrick.

  1. Sie schätzen ab, wie viel „freundähnliches" Rauschen in der Mischung enthalten ist.
  2. Sie subtrahieren dieses „freundähnliche" Rauschen mathematisch von der gesamten Störung.
  3. Was übrig bleibt, ist ein viel klareres Signal davon, wie ein „wahrer Fremder" tatsächlich aussieht.

In technischen Begriffen verwenden sie eine Technik namens Importance Sampling. Sie nehmen die unordentlichen, ungelabelten Daten und korrigieren mathematisch dafür, dass ein Teil davon den bekannten Klassen zu sehr ähnelt. Dies erzeugt einen „entzerrten" (Debiased) Score.

Wie sie es tun (Die 3 Schritte)

Das Paper beschreibt einen praktischen Dreischritt-Prozess, um diesen besseren „Fremden-Detektor" zu bauen:

  1. Die besten „Fremden" auswählen: Sie nehmen ein riesiges, unordentliches Wörterbuch von Wörtern (das Wild Corpus). Anstatt sie zufällig auszuwählen, wählen sie die Wörter aus, die am „dichtesten" oder am stärksten gruppiert sind. Denken Sie daran wie an die Auswahl der repräsentativsten Beispiele für „Fremdartigkeit" anstatt zufälliger Ausreißer.
  2. Die „Freunde" simulieren: Da sie keine Liste mit „wahren Freunden" haben, um sie abzuziehen, erstellen sie eine gefälschte Liste. Sie nehmen die bekannten Tiernamen (z. B. „Katze") und fügen in den Speicher des Computers ein wenig „Rauschen" (Zufälligkeit) hinzu. Dies simuliert, wie ein „Freund" in den unordentlichen Daten aussieht.
  3. Die mathematische Magie: Sie stecken diese beiden Listen in ihre Formel. Sie berechnen den Score für das unbekannte Tier und subtrahieren dann den simulierten „Freund"-Score vom unordentlichen „Fremden"-Score. Dies hebt die Verwirrung auf.

Die Ergebnisse: Warum es wichtig ist

Die Autoren testeten diese neue Methode gegen die alten mit berühmten Bilddatensätzen (wie ImageNet).

  • Das Ergebnis: Ihre Methode schlug die bisherigen besten Methoden konsequent.
  • Der Beweis: Bei den Tests war ihre KI viel besser darin, „Ich weiß es nicht" zu sagen, wenn ihr ein seltsames Bild gezeigt wurde, und viel weniger wahrscheinlich, mit Selbstvertrauen das falsche Tier zu erraten.
  • Robustheit: Es funktionierte gut, selbst wenn die „bekannten" Tiere leicht unterschiedlich waren (z. B. Zeichnungen statt Fotos) oder wenn verschiedene Arten von KI-Gehirnen verwendet wurden.

Zusammenfassung

Dieses Paper behebt einen spezifischen Fehler darin, wie KI lernt, „Unbekanntes" zu erkennen. Der alte Weg war wie der Versuch, eine Nadel im Heuhaufen zu finden, indem man das Heu ignoriert, aber versehentlich andere Nadeln aufgreift, die ähnlich aussahen. Der neue Weg verwendet einen mathematischen Filter, um diese „falschen Nadeln" zu entfernen, und gibt der KI einen viel klareren Blick darauf, was wirklich unbekannt ist. Dies macht die KI sicherer und zuverlässiger, wenn sie auf Dinge stößt, die sie noch nie gesehen hat.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →