Continual Visual Learning under Evolving Semantic Concept Shift
Dit artikel introduceert SemReWrite, een framework dat is ontworpen om evoluerende semantische conceptverschuivingen in visuele foundation models te verwerken door selectief verouderde visuele-semantische mapping bij te werken terwijl geldige kennis behouden blijft, gevalideerd via een nieuwe benchmark (EvoShift-Bench) en gespecialiseerde evaluatiemetrieken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin de regels voor het benoemen van dingen veranderen, maar de dingen zelf niet. Een auto blijft een auto op elke foto, maar een nieuwe verkeerswet kan plotseling vereisen dat we onderscheid maken tussen een "privévoertuig", een "commerciële vrachtwagen" en een "hulpverleningsvoertuig" op basis van subtiele details die voorheen werden genegeerd. Op dezelfde manier kan een vogel die voorheen simpelweg een "mus" werd genoemd, door een nieuwe wetenschappelijke studie worden geherclassificeerd in twee verschillende soorten, of kan een fabrieksfout worden geherdefinieerd door een strengere veiligheidsnorm. Dit is de realiteit voor langdurige computervisie-systemen: de visuele wereld blijft hetzelfde, maar de betekenis die we eraan toekennen evolueert. Decennialang hebben onderzoekers op het gebied van kunstmatige intelligentie zich gericht op het aanleren van het herkennen van objecten door computers, zelfs wanneer de verlichting verandert of de camerahoek verschuift. Echter, er is een nieuwe uitdaging ontstaan: hoe leren we een computer om zijn woordenboek van betekenissen bij te werken zonder de kennis die hij al heeft geleerd uit te wissen?
Een team van onderzoekers heeft dit probleem aangepakt door een nieuw framework te ontwikkelen genaamd SemReWrite. Hun werk richt zich op een specifiek en moeilijk scenario dat bekend staat als "evolving semantic concept shift" (evoluerende semantische conceptverschuiving). In deze situatie verandert het visuele bewijs dat een AI ziet niet, maar de definitie van wat dat bewijs vertegenwoordigt wel. Denk aan een autonoom rijden systeem dat aanvankelijk alle bewegende voertuigen als één categorie behandelt. Later vereist een nieuw beleid dat het systeem passagiersauto's van hulpverleningsvoertuigen scheidt omdat ze verschillende acties vereisen. De afbeeldingen van de auto's zien er identiek uit, maar het juiste antwoord voor de computer is fundamenteel veranderd. Traditionele methoden voor het bijwerken van AI-modellen falen hier vaak. Als je het model simpelweg opnieuw traint op de nieuwe regels, kan het de nieuwe onderscheiden leren, maar vergeet het hoe het de oude, nog steeds geldige categorieën moet afhandelen. Als je probeert de oude kennis te strikt te beschermen, kan het model weigeren de nieuwe regels te leren. De onderzoekers ontdekten dat de oplossing niet ligt in het kiezen tussen leren en onthouden, maar in het doen van beide op selectieve wijze.
De kern van hun aanpak is een systeem dat werkt als een zorgvuldige redacteur in plaats van een onbeschreven blad. Wanneer de semantische regels veranderen, analyseert het systeem eerst het verschil tussen de oude definitie en de nieuwe. Het gebruikt een klein aantal nieuwe voorbeelden, gelabeld met de bijgewerkte regels, om precies aan te wijzen welke delen van de visuele wereld door deze verandering worden beïnvloed. Als bijvoorbeeld de regel verandert om onderscheid te maken tussen typen voertuigen, identificeert het systeem dat de visuele kenmerken van de grootte of vorm van het voertuig nu cruciaal zijn, terwijl de kenmerken van de weg of het weer irrelevant zijn voor de nieuwe definitie. Zodra het weet waar de verandering relevant is, past het een gerichte update toe op alleen die specifieke gebieden van het besluitvormingsproces van het model. De rest van het model, dat de delen van de wereld afhandelt die niet zijn veranderd, blijft onaangetast. Dit zorgt ervoor dat het systeem de nieuwe definities leert zonder per ongeluk de oude, correcte definities te vergeten.
Om dit idee te testen, creëerden de onderzoekers een nieuwe benchmark genaamd EvoShift-Bench, die verschillende manieren simuleert waarop betekenissen kunnen evolueren. Ze testten scenario's waarbij een enkele categorie splitst in tweeën, waarbij twee categorieën samensmelten tot één, waarbij de grens tussen categorieën verschuift, en waarbij geheel nieuwe categorieën worden ingevoegd. Ze testten ook situaties waarin het visuele uiterlijk van de wereld tegelijkertijd met de definities verandert, zoals wanneer een systeem getraind op duidelijke foto's moet adapteren aan schetsen of beelden met weinig licht. In deze tests presteerde het nieuwe framework consequent beter dan bestaande methoden. Terwijl andere benaderingen ofwel faalden in het leren van de nieuwe regels, ofwel de oude regels vergaten, bereikte deze selectieve herschrijfmethode een hoge score op beide gebieden. Het slaagde erin de nieuwe onderscheiden te leren terwijl de nauwkeurigheid van de onveranderde concepten behouden bleef.
De resultaten laten zien dat het systeem bijzonder efficiënt is. Het kan deze nieuwe semantische regels leren met zeer weinig voorbeelden—soms slechts één of twee afbeeldingen per nieuwe categorie. Dit is cruciaal omdat het in de echte wereld vaak moeilijk en duur is om een groot aantal nieuwe, correct gelabelde afbeeldingen te verkrijgen. De onderzoekers ontdekten ook dat het systeem een opeenvolging van veranderingen in de tijd kan afhandelen. Naarmate de regels door meerdere fasen evolueerden, bleef het systeem zich aanpassen zonder fouten te accumuleren of het vermogen om stabiele concepten te herkennen te verliezen. Cruciaal was dat het systeem in staat was om de oude, onjuiste associaties te onderdrukken. Het leerde niet alleen het nieuwe antwoord; het stopte ook actief met het voorspellen van het oude, nu onjuiste antwoord voor de betreffende afbeeldingen. Dit onderscheid is essentieel: een goed adaptatiesysteem moet niet alleen weten wat nu waar is, maar ook weten wat niet langer waar is.
De studie suggereert dat de toekomst van langdurige visuele systemen ligt in dit soort selectieve updates. In plaats van alle kennis als even permanent of even vervangbaar te beschouwen, moeten deze systemen in staat zijn om te identificeren welke delen van hun begrip verouderd zijn en welke delen geldig blijven. Door een helder begrip van hoe de definities zijn veranderd te combineren met een precieze mechanisme voor het bijwerken van alleen de noodzakelijke delen van het model, hebben de onderzoekers een weg vooruit gedemonstreerd voor AI die kan groeien en veranderen samen met de wereld die zij observeert. Het werk beweert niet elk probleem in kunstmatige intelligentie op te lossen, maar biedt een concrete en effectieve methode voor het afhandelen van de specifieke, complexe realiteit van veranderende betekenissen in een statische visuele wereld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.