← Neueste Arbeiten
🤖 machine learning

ΔEnergy\Delta \mathrm{Energy}: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization

Dieser Artikel stellt Δ\DeltaEnergy vor, einen neuartigen OOD-Score, der von Energieänderungen während der Vision-Language-Ausrichtung inspiriert ist, sowie ein entsprechendes Feinabstimmungsframework (EBM), das gleichzeitig die Erkennung von Out-of-Distribution-Daten und die Generalisierung in Vision-Language-Modellen verbessert und signifikante Leistungssteigerungen gegenüber bestehenden Methoden erzielt.

Ursprüngliche Autoren: Lin Zhu, Yifeng Yang, Xinbing Wang, Qinying Gu, Nanyang Ye

Veröffentlicht 2026-05-26
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Lin Zhu, Yifeng Yang, Xinbing Wang, Qinying Gu, Nanyang Ye

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen sehr klugen, weit gereisten Führer (ein Vision-Language-Modell), der gelernt hat, Tausende von Objekten aus einer riesigen Bibliothek aus Büchern und Fotos zu erkennen. Dieser Führer ist hervorragend darin, Dinge zu identifizieren, die er zuvor gesehen hat, wie etwa einen „Golden Retriever" oder ein „rotes Sportauto".

Wenn dieser Führer jedoch in die reale Welt hinaustritt, sieht er sich zwei kniffligen Situationen gegenüber:

  1. Das „Cosplay"-Problem (Kovariatenverschiebung): Er sieht einen Golden Retriever, aber dieser ist als Skizze gezeichnet, oder es ist ein Foto, das im Regen aufgenommen wurde, oder es ist ein Gemälde. Der Hund ist derselbe, aber der Stil ist anders. Der Führer könnte verwirrt sein und denken: „Ist das immer noch ein Hund?"
  2. Das „Alien"-Problem (Semantische Verschiebung): Er sieht eine völlig neue Kreatur, wie etwa ein „glitzerndes Einhorn", das nie in seiner Trainingsbibliothek war. Der Führer muss erkennen: „Ich weiß nicht, was das ist", anstatt selbstbewusst zu raten: „Das ist ein Pferd!"

Die Arbeit stellt eine neue Methode namens Δ\DeltaEnergy (Delta Energy) und eine Trainingstechnik namens EBM vor, um dem Führer zu helfen, beide Probleme gleichzeitig zu bewältigen.

Die Kernidee: Der „Stille"-Test

Um zu verstehen, wie dies funktioniert, stellen Sie sich vor, der Führer betrachtet ein Bild und ruft laut, wie sicher er sich bei verschiedenen Labels ist.

  • Wenn er ein Foto eines Hundes sieht, könnte er rufen: „HUND! (99 % Sicherheit) KATZE! (1 %) VOGEL! (0,1 %)."
  • Wenn er ein „glitzerndes Einhorn" sieht, könnte er rufen: „PFERD! (40 %) KATZE! (30 %) HUND! (20 %)." Er ist verwirrt und verteilt seine Wetten dünn.

Der Δ\DeltaEnergy-Trick:
Die Forscher bitten den Führer, ein seltsames Experiment durchzuführen: „Was passiert, wenn ich dich zwinge, über deine Top-Vermutung völlig zu schweigen?"

Sie nehmen die Top-Vermutung des Führers (z. B. „HUND") und setzen ihre Sicherheit auf null. Dann fragen sie: „Okay, jetzt, wo du nicht mehr 'Hund' sagen kannst, wie stark sinkt deine gesamte 'Energie' (oder Gesamtsicherheit)?"

  • Für einen echten Hund (In-Distribution): Der Führer war so sicher, dass es ein Hund ist. Wenn Sie diese Antwort zum Schweigen bringen, gerät der Führer in Panik. Seine gesamte Sicherheit bricht zusammen. Der „Abfall" der Energie ist riesig.
  • Für ein Alien/ein unbekanntes Objekt (Out-of-Distribution): Der Führer war bereits unsicher und hatte seine Wetten auf viele Optionen verteilt. Das Zum-Schweigen-Bringen der Top-Vermutung ändert nicht viel, da er sich nicht nur auf eine Antwort verlassen hat. Der „Abfall" der Energie ist klein.

Durch die Messung dieser Energieänderung (Δ\DeltaEnergy) kann das System leicht den Unterschied zwischen „einem Hund in einem seltsamen Stil" (großer Abfall) und „einer völlig neuen Kreatur" (kleiner Abfall) feststellen.

Das Trainings-Upgrade: EBM (Energy Bound Maximization)

Den Unterschied zu erkennen ist großartig, aber die Arbeit lehrt den Führer auch, wie er sich während des Lernens darin verbessern kann.

Sie führen eine Trainingsregel namens EBM ein. Stellen Sie sich vor, der Führer studiert ein Foto eines Hundes.

  1. Der Führer betrachtet das gesamte Foto.
  2. Dann setzen die Forscher eine „Maske" über einen Teil des Fotos (wie das Verdecken des Gesichts des Hundes oder des Hintergrunds) und bitten den Führer, es erneut zu betrachten.
  3. Das Ziel ist es, den Führer so zu trainieren, dass er selbst mit der Maske dieselbe „Energie"-Änderung spürt wie mit dem vollständigen Foto.

Die Metapher:
Stellen Sie sich vor, Sie lernen, die Stimme eines Freundes zu erkennen.

  • Alter Weg: Sie merken sich seine Stimme perfekt in einem ruhigen Raum. Wenn er in einem lauten Café spricht (Kovariatenverschiebung), erkennen Sie ihn vielleicht nicht wieder.
  • EBM-Weg: Sie üben, ihn zu erkennen, während er flüstert, schreit oder durch eine Wand spricht. Sie lernen das Kernstück seiner Stimme, nicht nur die perfekten Bedingungen.

Indem das Modell während des Trainings gezwungen wird, diese „maskierten" oder „zugeschnittenen" Versionen von Daten zu verarbeiten, lernt es, robust gegenüber Stiländerungen (wie Regen oder Skizzen) zu sein, während es gleichzeitig in der Lage bleibt, völlig neue Dinge zu erkennen.

Die Ergebnisse: Ein superzuverlässiger Führer

Die Arbeit testete dies an massiven Datensätzen (wie ImageNet, das Tausende von Bildern enthält).

  • Bessere Erkennung: Die neue Methode ist viel besser darin, „Aliens" (unbekannte Objekte) zu erkennen als frühere Methoden. Sie reduzierte die Anzahl der Fehlalarme um einen signifikanten Betrag (in einigen Tests 10 %–25 % besser).
  • Bessere Generalisierung: Sie wurde auch viel besser darin, „Cosplay"-Hunde (Objekte in neuen Stilen) zu erkennen, ohne zu vergessen, was sie sind.

Zusammenfassung

Die Arbeit schlägt eine einfache, aber kraftvolle Idee vor: Messen Sie, wie stark sich die Sicherheit eines Modells ändert, wenn Sie seine Top-Vermutung zum Schweigen bringen.

  • Wenn die Sicherheit zusammenbricht, handelt es sich wahrscheinlich um ein bekanntes Objekt in einem neuen Stil.
  • Wenn die Sicherheit stabil bleibt, handelt es sich wahrscheinlich um ein völlig neues Objekt.

Sie nutzen diese Erkenntnis dann, um das Modell robuster zu trainieren und ein System zu schaffen, das sowohl ein besserer Detektiv (das Unbekannte aufspüren) als auch ein besserer Generalist (das Bekannte in neuen Situationen erkennen) ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →