The JEPA Predictor: A Transferable Operator for Occluded Feature Completion
Dit artikel toont aan dat de voorspellende component van Joint-Embedding Predictive Architectures (JEPA's) bevroren kan worden en via een eenvoudige lineaire projectie kan worden overgedragen naar niet-JEPA encoders, wat hun prestaties op geoccludeerde inputs aanzienlijk verbetert door effectief ontbrekende kenmerken te completeren zonder het onderliggende model opnieuw te hoeven trainen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een vriend probeert te herkennen in een drukke kamer, maar iemand heeft een enorme, ondoorzichtige doos over de helft van zijn gezicht geplaatst. Je brein is geweldig in het invullen van de gaten; het gebruikt het zichtbare oor, het haar en de context van de kamer om te raden hoe het verborgen gezicht eruitziet. In de wereld van kunstmatige intelligentie zijn computers ongelooflijk goed geworden in het herkennen van dingen wanneer ze het hele plaatje kunnen zien. Echter, wanneer delen van een afbeelding ontbreken — zoals een auto die gedeeltelijk achter een boom verborgen is of een medische scan die wordt onderbroken door een metalen implantaat — raken deze slimme computers vaak in de war en maken ze fouten.
Jarenlang hebben wetenschappers twee hoofdtypen "slimme ogen" (AI-modellen) gebouwd om dit op te lossen. Het ene type leert door te proberen de ontbrekende stukjes van een puzzel te raden (het voorspellen van de toekomst op basis van het heden), terwijl een ander type leert door verschillende afbeeldingen te vergelijken om overeenkomsten te vinden. Meestal, wanneer deze modellen klaar zijn met trainen, wordt het deel dat het "raden" doet weggegooid omdat het alleen nodig is tijdens de leerfase. Het eindproduct is alleen het "oog" dat de afbeelding ziet. Maar wat als dat weggegooide "raadmachine" eigenlijk een superkracht was die we vergeten waren te gebruiken? Dit artikel stelt een eenvoudige, speelse vraag: Kunnen we een "raadmachine" van het ene type AI nemen en deze aan een ander type AI vastschroeven om het te helpen door de mist van ontbrekende informatie heen te kijken?
De onderzoekers, William en Christopher Nguyen van Aitomatic, Inc., ontdekten dat het antwoord een luidruchtig "ja" is. Ze ontdekten dat het "voorspeller"-deel van een specifieke AI-architectuur genaamd JEPA (Joint-Embedding Predictive Architecture) fungeert als een universele vertaler voor ontbrekende informatie. Ondanks dat deze voorspeller getraind was op één specifiek type AI, toonden ze aan dat het "geplugd" kan worden in vier totaal verschillende, populaire AI-modellen (zoals CLIP, DINOv3, DINOv2 en MAE) met behulp van een eenvoudige wiskundige brug.
Zo werkte hun experiment: Stel je hebt een foto van een hond, maar 77% ervan is bedekt door een zwart rechthoek. Een standaard AI-model, dat alleen naar het kleine stukje van de hond kijkt dat zichtbaar is, zou kunnen raden dat het een kat of een rots is. De onderzoekers namen een "bevroren" (onveranderde) voorspeller van een JEPA-model en verbonden deze met de andere AI-modellen. Wanneer de AI het zichtbare deel van de hond zag, stuurde het die informatie via een eenvoudige lineaire brug naar de JEPA-voorspeller. De voorspeller gebruikte vervolgens zijn training om te "hallucineren" of te voorspellen hoe de kenmerken van de verborgen 77% van de hond eruit zouden moeten zien. Ten slotte combineerde het systeem de echte zichtbare delen met de voorspelde verborgen delen om tot een definitieve gok te komen.
De resultaten waren opmerkelijk, vooral wanneer de afbeeldingen zwaar geblokkeerd waren. Op een dataset van hondensoorten daalde de nauwkeurigheid van een standaard AI-model (CLIP) naar een verschrikkelijke 15,9% wanneer 77% van de afbeelding verborgen was. Maar zod{%_} ze de JEPA-voorspeller eraan koppelden, schoot de nauwkeurigheid omhoog naar 52,1%. Dat is een enorme sprong van 36 procentpunten. Op een andere dataset met minder categorieën herstelde het model bijna alle nauwkeurigheid die het had verloren door de ontbrekende stukjes.
Het artikel legt uit dat dit werkt vanwege een "kosten-baten"-balans. De eenvoudige brug die de twee modellen verbindt is niet perfect; het vervormt de informatie van de delen van de afbeelding die wel zichtbaar zijn lichtjes (de kosten). Echter, de voorspeller is ongelooflijk goed in het raden van de delen die ontbreken (de baten). Wanneer een afbeelding grotendeels zichtbaar is, is de vervormingskost te hoog en helpt het systeem niet veel. Maar wanneer een afbeelding zwaar geblokkeerd is (zoals bij 77% verborgenheid), overstijgt het voordeel van het hebben van een goede gok voor de ontbrekende delen de kleine kost van de vervorming volledig. De voorspeller wordt in essentie een draagbare "kenmerk-voltooiingsmodule" die werkt over verschillende AI-families heen zonder de hoofdmodellen opnieuw te hoeven trainen.
De onderzoekers testten ook wat er gebeurt als de ontbrekende delen willekeurig verspreid zijn als statische ruis op een tv-scherm, in plaats van een solide blok. In dat geval hielp de voorspeller niet veel, wat suggereert dat hij specifiek is ontworpen om grote, aaneengesloten blokken van ontbrekende informatie te verwerken, zoals een boom die een auto blokkeert of een afsnijding in een foto. Ze bewezen ook dat dit niet alleen de AI was die "gladde randen" maakte of pixels invulde; het was daadwerkelijk het reconstrueren van hoogwaardige kenmerken die de computer in staat stelden de identiteit van het object te begrijpen.
Kortom, dit artikel laat zien dat we niet altijd een nieuwe, gigantische AI vanaf nul moeten bouwen om met ontbrekende gegevens om te gaan. We kunnen een gespecialiseerde "raadmotor" die voor één taak is gebouwd nemen en, met een eenvoudige wiskundige adapter, gebruiken om andere AI-modellen een boost te geven, waardoor ze helder kunnen zien, zelfs wanneer het beeld gebroken is.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.