← Nieuwste papers
💻 computer science

CRoFT: Robust Fine-Tuning with Concurrent Optimization for OOD Generalization and Open-Set OOD Detection

Dit artikel stelt CRoFT voor, een unified fine-tuning framework voor vision-language pre-trained modellen dat gelijktijdig generalisatie buiten de verdeling en open-set detectie optimaliseert door de gradiëntgrootte van energiescores te minimaliseren om domein-consistente Hessians te bereiken.

Oorspronkelijke auteurs: Lin Zhu, Yifeng Yang, Qinying Gu, Xinbing Wang, Chenghu Zhou, Nanyang Ye

Gepubliceerd 2026-05-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lin Zhu, Yifeng Yang, Qinying Gu, Xinbing Wang, Chenghu Zhou, Nanyang Ye

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een zeer slimme, goed gelezen bibliothecaris voor met de naam CLIP. Deze bibliothecaris heeft miljoenen boeken gelezen en miljoenen afbeeldingen bekeken. Hierdoor is deze uitstekend in het herkennen van dingen die ze eerder heeft gezien, zoals een "hond" of een "auto", zelfs als de afbeelding wat wazig is of vanuit een vreemde hoek is genomen.

Echter, de echte wereld is rommelig. Soms krijgt de bibliothecaris twee specifieke problemen wanneer je vraagt om hulp bij het sorteren van nieuwe foto's:

  1. Het "Stijlverschuiving"-probleem (Covariate Shift): Je laat de bibliothecaris een foto van een hond zien, maar deze is getekend in een schetsstijl, of het is een zwart-witfoto, of deze is genomen in de regen. De bibliothecaris weet dat het een hond is, maar omdat de stijl zo verschillend is van de boeken die ze bestudeerde, raakt ze in de war en zou ze kunnen zeggen: "Ik weet het niet zeker."
  2. Het "Onbekend Dier"-probleem (Open-Set OOD): Je laat de bibliothecaris een foto van een panda zien. Ze heeft nooit een panda gezien in haar trainingsboeken. In plaats van te zeggen: "Ik weet niet wat dit is," probeert de bibliothecaris het in een hokje te duwen dat ze wel kent, door bijvoorbeeld te zeggen: "Oh, dat moet een beer zijn!" of "Dat is een hond!" Dit is gevaarlijk omdat het systeem er zeker van is dat het fout zit.

De meeste eerdere methoden probeerden één van deze problemen op te lossen, maar braken daardoor het andere. Als je de bibliothecaris leerde om beter met schetsen om te gaan, werd ze misschien slechter in het opsporen van onbekende dieren. Als je haar leerde om onbekende dieren op te sporen, vergat ze misschien hoe ze met schetsen moest omgaan.

De Oplossing: CRoFT (De "Dubbelcheck"-bibliothecaris)

Het artikel introduceert een nieuwe methode genaamd CRoFT. Denk aan CRoFT als een speciaal trainingsprogramma dat de bibliothecaris leert om beide dingen tegelijk te doen zonder in de war te raken.

Hier is hoe het werkt, met behulp van eenvoudige analogieën:

1. De "Energie-score" (De Vertrouwensmeter)

Het artikel maakt gebruik van een concept dat een "Energie-score" wordt genoemd. Stel je voor dat elke keer als de bibliothecaris naar een foto kijkt, ze een "vertrouwensmeter" heeft.

  • Lage Energie: "Ik ben zeer zeker dat dit een hond is."
  • Hoge Energie: "Dit voelt vreemd. Ik weet het niet zeker."

Het doel is om de meter laag te houden voor dingen die de bibliothecaris kent (honden) en hoog voor dingen die ze niet kent (panda's).

2. De Geheime Truc: "De Heuvels Vlakmaken"

De auteurs ontdekten een slimme wiskundige truc. Ze realiseerden zich dat als je de bibliothecaris leert om hun "vertrouwensmeter" zeer stabiel te maken (wiskundig betekent dit het minimaliseren van de "gradiëntgrootte" of het consistent maken van de "Hessiaan"), er twee magische dingen tegelijk gebeuren:

  • Truc A: De bibliothecaris wordt beter in het opsporen van de "vreemde" afbeeldingen (Open-Set detectie). De meter piekt duidelijk omhoog voor de panda.
  • Truc B: De bibliothecaris wordt robuuster tegenover stijlveranderingen (OOD Generalization). Omdat hun interne "kaart" van de wereld gladder en consistenter is, voelt een schets van een hond voor hen nog steeds als een hond.

Het is alsof je een wandelaar leert lopen op een vlak, glad pad. Als het pad vlak is, struikelt ze niet over een klein steentje (een stijlverandering), en ze kan ook duidelijk zien of er een afgrond aankomt (een onbekend dier).

3. De "Adversariële Training" (De Stress Test)

Om ervoor te zorgen dat de bibliothecaris echt klaar is voor de echte wereld, creëert CRoFT een "stress test".

  • Stel je voor dat de bibliothecaris een foto van een hond bestudeert.
  • CRoFT creëert een "gehallucineerde" versie van die foto die licht vervormd is (zoals een zeer slechte schets of een vreemd filter), maar er nog steeds uitziet als een hond.
  • De bibliothecaris wordt vervolgens gedwongen om te oefenen met het herkennen van deze "slechte" foto.
  • Door te oefenen met deze "worst-case" scenario's, wordt de bibliothecaris supersterk. Ze leert dat zelfs als de foto vreemd eruitziet, het idee van de hond er nog steeds is.

Het Resultaat

Het artikel beweert dat door deze "Dubbelcheck"-aanpak (het vlakmaken van het energielandschap + stress testen) de bibliothecaris (het AI-model) wordt:

  1. Beter in het opsporen van onbekenden: Het stopt met raden dat een panda een hond is. Het zegt: "Ik ken dit niet."
  2. Beter in het omgaan met vreemde stijlen: Het herkent een schets van een hond net zo goed als een foto van een hond.

In hun tests was deze methode aanzienlijk beter dan eerdere methoden. Het verbeterde het vermogen om onbekende dieren op te sporen met wel 20% en verminderde het aantal keren dat het model in de war raakte door stijlveranderingen.

Kortom: CRoFT is een trainingsmethode die AI-modellen leert om zowel flexibel te zijn (het hanteren van verschillende stijlen) als eerlijk (toegeven wanneer ze iets zien dat ze nog nooit hebben gezien), allemaal door de manier waarop het model over de wereld "denkt" te gladstrijken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →