← Neueste Arbeiten
🤖 machine learning

Localized Conformal Prediction for Image Classification with Vision-Language Models

Diese Arbeit präsentiert ein lokalisiertes Conformal-Prediction-Framework für die Bildklassifizierung mit Vision-Language-Modellen und zeigt auf, dass, während die rohe Kosinus-Ähnlichkeit keine Verbesserungen gegenüber nicht-lokalen Baselines erzielt, eine vorgeschlagene einfache nichtlineare Transformation dieser Ähnlichkeiten die Größen der Vorhersagesets signifikant reduziert, während die marginalen Abdeckungsgarantien aufrechterhalten werden.

Ursprüngliche Autoren: Clément Fuchs, Tim Bary, Benoît Macq

Veröffentlicht 2026-07-01
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Clément Fuchs, Tim Bary, Benoît Macq

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bitten einen sehr intelligenten, gut gereisten Freund (ein Vision-Language-Modell), zu identifizieren, was auf einem Foto zu sehen ist. Normalerweise sind sie darin großartig, aber manchmal sind sie unsicher. In der realen Welt ist es riskant, einfach zu raten „Es ist eine Katze“, wenn man sich irren könnte – zum Beispiel, wenn man ein Auto fährt oder einen Patienten diagnostiziert. Man möchte, dass sie sagen: „Ich bin mir ziemlich sicher, dass es eine Katze ist, aber es könnte auch ein Fuchs sein“ oder „Ich habe keine Ahnung, vertrauen Sie mir nicht darauf“.

Hier kommt Conformal Prediction ins Spiel. Betrachten Sie es als ein Sicherheitsnetz. Anstatt eine einzige Antwort zu geben, liefert das System eine Liste von Möglichkeiten (eine „Vorhersagemenge“), die garantiert die richtige Antwort in den meisten Fällen (z. B. 9. in 10 Fällen) enthält.

Das Problem: Das „Einheitsmaß“-Sicherheitsnetz

Die Standardmethode, wie dieses Sicherheitsnetz funktioniert, gleicht einem globalen Regelwerk. Es betrachtet tausende vergangene Beispiele (Kalibrierungsdaten) und sagt: „Okay, um zu 90 % auf der sicheren Seite zu sein, müssen wir für jeden 5 Möglichkeiten auflisten.“

Das Problem? Dieses Regelwerk ist zu stumpf.

  • Für ein einfaches Bild (wie ein klares Foto eines Golden Retrievers) ist es albern, 5 Möglichkeiten aufzulisten. Man braucht nur 1 oder 2.
  • Für ein schwieriges Bild (wie einen verschwommenen Hund, der wie ein Wolf aussieht) sind 5 vielleicht sogar zu wenig.

Die Standardmethode behandelt ein verschwommenes, verwirrendes Bild genauso wie ein kristallklares Bild. Sie passt sich nicht der spezifischen Situation an.

Die vorgeschlagene Lösung: Ein „lokales“ Sicherheitsnetz

Die Autoren versuchten einen klügeren Ansatz namens Localized Conformal Prediction (LCP).

Stellen Sie sich vor, anstatt eines globalen Regelwerks haben Sie für jedes einzelne Foto einen lokalen Guide. Wenn ein neues Foto eintrifft, schaut der Guide auf seine vergangenen Erfahrungen und sagt: „Dieses Foto sieht sehr ähnlich aus wie diese 10 Fotos, die ich gestern gesehen habe. Für jene spezifischen Fotos musste ich nur 2 Optionen auflisten, um sicher zu sein. Also werde ich für dieses neue Foto ebenfalls nur 2 auflisten.“

Dies ist der „lokale“ Teil: Es passt das Sicherheitsnetz basierend darauf an, wie ähnlich das neue Foto den bisherigen ist.

Der Wendepunkt: Der „naive“ Guide scheiterte

Die Forscher versuchten, diesen lokalen Guide mithilfe von Vision-Language-Modellen (VLMs) aufzubauen. Diese Modelle wandeln Bilder in mathematische Punkte in einem riesigen Raum um. Der naheliegendste Weg, Ähnlichkeit zu messen, besteht darin, zu sehen, wie nah zwei Punkte beieinander liegen (mittels Cosine Similarity).

Sie dachten: „Wenn zwei Bilder in diesem mathematischen Raum nah beieinander liegen, sind sie sich ähnlich. Lassen Sie uns diesen Abstand nutzen, um unser Sicherheitsnetz anzupassen.“

Das Ergebnis: Es funktionierte nicht gut. Tatsächlich machte es die Sache oft sogar schlechter.

  • Die Analogie: Stellen Sie sich vor, Sie versuchen zu beurteilen, wie ähnlich sich zwei Menschen sind, indem Sie nur auf ihre Körpergröße schauen. Zwei Menschen können die gleiche Größe haben, aber völlig unterschiedliche Persönlichkeiten, Stile oder Hintergründe besitzen. Die „Größen“-Metrik (Cosine Similarity) war zu einfach, um den wahren „Vibe“ der Bilder zu erfassen, der helfen würde, das Sicherheitsnetz zu optimen. Der „naive“ Guide gab schlechte Ratschläge, was zu Listen führte, die entweder zu lang (verschwenderisch) oder zu kurz (unsicher) waren.

Die Lösung: Der „Sigmoid“-Filter

Die Autoren erkannten, dass sie einen besseren Weg brauchten, um Ähnlichkeit zu messen. Sie führten eine nicht-lineare Transformation (eine mathematische Funktion namens Sigmoid-Funktion) ein.

  • Die Analogie: Stellen Sie sich die rohe Ähnlichkeitsbewertung wie einen Dimmer vor, der von 0 bis 100 geht. Der „naive“ Guide hat die Zahl einfach direkt verwendet. Die neue Methode fügt dem Dimmer eine spezielle Linse hinzu.
    • Wenn die Bilder sehr ähnlich sind, lässt die Linse sie extrem ähnlich erscheinen (sie dreht den Regler hoch).
    • Wenn die Bilder nur mittelmäßig ähnlich sind, lässt die Linse sie sehr verschieden erscheinen (sie dreht den Regler runter).
    • Es schafft eine schärfere Unterscheidung zwischen „nah genug, um zu vertrauen“ und „zu weit weg, um zu vertrauen“.

Durch das Abstimmen dieser Linse (mithilfe eines Prozesses namens Kreuzvalidierung) konnten sie dem lokalen Guide genau sagen, wie er vergangene Beispiele gewichten soll.

Das Ergebnis

Als sie diesen „Linsen“-Ansatz auf 9 verschiedene Arten von Bilddatensätzen testeten (von Autos und Haustieren bis hin zu Blumen und Satellitenfotos):

  1. Kleinere, intelligentere Listen: Die neue Methode produzierte konsistent kleinere Listen von Möglichkeiten als die alte „Einheitsmaß“-Methode, ohne an Sicherheit zu verlieren. Sie war effizienter.
  2. Der „naive“ Weg scheiterte: Die Verwendung der rohen Ähnlichkeit ohne die Linse machte die Listen in vielen Fällen tatsächlich größer und weniger effizient.
  3. Die Sicherheit blieb bestehen: Die Garantie, dass die richtige Antwort in der Liste enthalten ist (die 90 % Abdeckung), blieb gleich. Sie haben die Sicherheit nicht für die Effizienz geopfert.

Was sie nicht fanden

Die Autoren prüften auch, ob diese Methode ein spezifisches Problem namens „Coverage Gaps“ (Abdeckungslücken) behebt (wo bestimmte Gruppen von Bildern, wie etwa seltene Tiere, weniger sicher waren als häufige).

  • Das Ergebnis: Die lokale Methode hat dieses spezifische Problem nicht signifikant behoben. Die Sicherheitslücken blieben in etwa dieselben wie bei der alten Methode. Der Hauptgewinn war schlichtweg, die Listen kürzer und effizienter zu machen, nicht unbedingt die Sicherheit über alle Gruppen hinweg gleichmäßiger zu gestalten.

Zusammenfassung

In dieser Arbeit geht es darum, einer intelligenten KI beizubringen, effizienter zu raten.

  • Alter Weg: „Liste für jeden 5 Optionen auf.“ (Sicher, aber oft verschwenderisch).
  • Gescheiterter neuer Weg: „Schau darauf, wie nah die Bilder im mathematischen Raum liegen, und passe dich an.“ (Zu simpel, machte die Sache schlechter).
  • Erfolgreicher neuer Weg: „Schau darauf, wie nah die Bilder liegen, aber nutze einen speziellen mathematischen Filter, um diese Sicht zu schärfen, damit wir Optionen nur dann auflisten, wenn wir wirklich vertrauenswürdig sind.“ (Sicher, effizient und effektiv).

Sie haben ihren Code veröffentlicht, damit andere diesen „speziellen Filter“ nutzen können, um ihre eigenen KI-Vorhersagen effizienter zu gestalten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →