← Nieuwste papers
💬 NLP

From Inference to Adaptation: A Unified Optimal Transport View of Vision Language Model

Dit artikel stelt \algname voor, een verenigd Test-Time Adaptation-framework voor Vision-Language Models dat inferentie en adaptatie overbrugt door zero-shot classificatie te formuleren als een Wasserstein Optimal Transport-probleem om robuuste pseudo-labels te genereren, die vervolgens worden gebruikt in een theoretisch afgestemde InfoNCE contrastieve loss om state-of-the-art prestaties te behalen onder distributieverschuivingen.

Oorspronkelijke auteurs: Qi Yu, Zhichen Zeng, Katherine Tieu, Xiyuan Yang, Ruizhong Qiu, Yuchen Yan, Lihui Liu, Yanjun Zhao, Lingjie Chen, Jingrui He, Hanghang Tong

Gepubliceerd 2026-08-20
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qi Yu, Zhichen Zeng, Katherine Tieu, Xiyuan Yang, Ruizhong Qiu, Yuchen Yan, Lihui Liu, Yanjun Zhao, Lingjie Chen, Jingrui He, Hanghang Tong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de moderne wereld van kunstmatige intelligentie hebben computers geleerd om met verbazingwekkende vloeiendheid te zien en te lezen. Systemen die bekend staan als vision-language modellen kunnen naar een foto kijken en deze beschrijven, of een zin lezen en de bijbehorende afbeelding vinden, zonder dat ze hiervoor expliciet zijn onderwezen voor die specifieke taak. Ze bereiken dit door te leren foto's en woorden te vertalen naar een gedeelde wiskundige taal, een gemeenschappelijke ruimte waar een foto van een kat en het woord "kat" vlak naast elkaar liggen. Deze vaardigheid stelt hen in staat om objecten te herkennen die ze nog nooit eerder hebben gezien, een vaardigheid die zero-shot learning wordt genoemd. Echter, deze modellen zijn fragiel. Wanneer de echte wereld verandert — wanneer een foto wazig is, genomen is in slecht weer, of vervormd is door digitale ruis — breekt de gedeelde taal af. De verbinding tussen de afbeelding en het woord rafelt, en het zelfvertrouwen van het model stort in, wat leidt tot fouten die gevaarlijk kunnen zijn in kritieke toepassingen zoals autonoom rijden of medische diagnose.

Onderzoekers hebben geprobeerd dit op te lossen door het model tijdens het werken "on the fly" te laten leren, een proces dat test-time adaptation wordt genoemd. Het idee is simpel: naarmate het model nieuwe, rommelige afbeeldingen tegenkomt, moet het zijn interne instellingen aanpassen om ze te begrijpen. Maar eerdere pogingen tot dit proces zijn gestruikkeld over een fundamenteel probleem. Om te leren, moet het model weten waarnaar het kijkt, maar in deze real-world scenario's is er niemand die de juiste antwoorden geeft. Het model moet zijn eigen labels raden, en deze gissingen zijn vaak fout. Wanneer het model probeert te leren van zijn eigen foute gissingen, versterkt het de ruis, waardoor het zichzelf slechter maakt. Bovendien probeerden oudere methoden deze fouten glad te strijken door naar brede categorieën te kijken, waarbij elke afbeelding in een groep als hetzelfde werd behand behandeld. Deze grove benadering negeerde de unieke details van individuele plaatjes, waardoor het model niet werkelijk de specifieke relatie tussen een bepaalde afbeelding en de beschrijving ervan kon begrijpen.

Een team van onderzoekers heeft nu een nieuwe manier voorgesteld om dit op te lossen, een methode die zij ORIGIN noemen. In plaats van te vertrouwen op de rauwe, vaak verwarde gissingen van het model, behandelen zij het probleem als een matchingsspel dat moet worden opgelost met globale logica. Stel je een kamer vol mensen voor en een kamer vol namen voor; het doel is om elke persoon met de juiste naam te koppelen. Als je alleen naar elke persoon individueel kijkt, kun je een fout maken. Maar als je naar de hele kamer tegelijk kijkt, kun je gebruikmaken van het feit dat elke naam precies één keer gebruikt moet worden om je fouten te corrigeren. De onderzoekers gebruiken een wiskundig kader genaamd optimal transport om precies dit te doen. Het dwingt het model om naar de gehele batch aan afbeeldingen en tekstbeschrijvingen samen te kijken, en de meest logische manier te vinden om ze aan elkaar te koppelen. Dit globale overzicht filtert de ruis weg en produceert veel betrouwbaardere gissingen over wat de afbeeldingen zijn.

Zodra het model deze betrouwbare gissingen heeft, gebruikt het deze om zichzelf te onderwijzen. De onderzoekers ontdekten dat de beste manier om van deze nieuwe, ruisige afbeeldingen te leren, het is om een methode te gebruiken die nauwkeurig nabootst hoe het model oorspronkelijk is getraind. Ze sturen het model aan om zijn interne instellingen aan te passen, zodat de specifieke afbeelding waar het naar kijkt dichter bij de juiste beschrijving beweegt in die gedeelde wiskundige ruimte, terwijl het zich juist verwijdert van onjuiste beschrijvingen. Dit is een fijnmazige aanpak; het geeft om de unieke details van elk afzonderlijk plaatje, niet alleen het gemiddelde van een groep. Door dit te doen, leert het model zichzelf te heraligneren met de veranderende wereld, waardoor het vermogen om helder te zien wordt hersteld, zelfs wanneer de afbeeldingen gecorrumpeerd zijn.

De genialiteit van deze nieuwe aanpak ligt in het feit dat het twee aparte stappen verenigt die voorheen als verschillend werden behandeld. De onderzoekers lieten zien dat de logica die wordt gebruikt om de initiële gissingen te doen en de logica die wordt gebruikt om van hen te leren, eigenlijk twee kanten van dezelfde munt zijn. De methode die de beste matchingsparen vindt, is wiskundig identiek aan de methode die het model leert te verbeteren. Dit betekent dat het proces van raden en het proces van leren niet met elkaar in strijd zijn; ze helpen elkaar. De betere de gissingen, hoe beter het leren, en hoe beter het leren, hoe nauwkeuriger de toekomstige gissingen worden. Dit creëert een cyclus van verbetering waarbij het model slimmer en robuuster wordt bij elke stap die het zet.

Wanneer getest op standaard benchmarks waar afbeeldingen bewust vervormd waren met ruis, onscherpte en weereffecten, bleek deze nieuwe methode aanzienlijk effectiever dan alles wat eraan voorafging. Op een dataset van kleine, lage-resolutie afbeeldingen verbeterde het de nauwkeurigheid van het model met wel 7,4 procent vergeleken met de beste bestaande methoden. Op een grotere dataset van complexere afbeeldingen presteerde het nog steeds met een ruime marge beter dan de concurrentie. Misschien wel even belangrijk is dat het dit deed zonder het systeem te vertragen. De extra berekeningen die nodig zijn om de beste matches te vinden, waren zo efficiënt dat ze bijna geen vertraging toevoegden aan het proces. Het model kon in realtime adapteren, waarbij het het tempo van de datastroom bijhield terwijl het een hoge prestatie behield.

De onderzoekers verkenden ook waarom dit zo goed werkte door de verschillende onderdelen van hun systeem te analyseren. Ze ontdekten dat het gebruik van de globale matching-logica om de initiële gissingen te genereren cruciaal was; zonder dit worstelde het model met het leren van de ruisige data. Ze ontdekten ook dat het gebruik van een fijnmazige leermethode, die zich richtte op individuele beeld-tekstparen, superieur was aan oudere methoden die alleen naar brede categorieën keken. Wanneer ze deze twee elementen combineerden, waren de resultaten consequent het beste. Het systeem overleefde de distributieverschuivingen niet alleen; het bloeide erin op, wat aantoont dat door de manier waarop een model denkt af te stemmen op de manier waarop het leert, we kunstmatige intelligentie kunnen bouwen die werkelijk veerkrachtig is tegen de rommelige, onvoorspelbare aard van de echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →