Retrieval-Augmented Visual Prompting: Guiding Foundation Models in Two-Photon Imaging
Dit artikel introduceert Retrieval-Augmented Visual Prompting (RAVP), een framework dat zero-shot neurondetectie en instantiesegmentatie in twee-foton calciumimaging verbetert door opgehaalde geannoteerde exemplaren als visuele prompts in te injecteren in foundation models zoals SAM 3, wat een effectief alternatief tijdens de inferentie biedt voor traditionele fine-tuning.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de stille, donkere wereld binnen een levende hersenpan gebruiken wetenschappers een krachtige microscoop om te kijken hoe neuronen vuren. Deze techniek, bekend als twee-foton calcium-imaging, legt de elektrische activiteit van individuele hersencellen vast als heldere, gloeiende stippen tegen een donkere achtergrond. Het is een hoeksteen van de moderne neurowetenschap, waardoor onderzoekers kunnen zien hoe populaties cellen samenwerken om gedachte en beweging te creëren. Het omzetten van deze gloeiende video's in bruikbare gegevens is echter ongelooflijk moeilijk. De beelden zijn rommelig; sommige cellen schijnen helder terwijl andere zwak zijn, en het uiterlijk van de cellen verandert drastisch afhankelijk van het dier, de diepte van de hersenen die gefilmd worden, of de specifieke apparatuur die wordt gebruikt. Om deze cellen te bestuderen, moeten wetenschappers eerst een precieze omtrek rond elke cel tekenen, een taak die traag, duur en foutgevoelig is voor menselijke fouten. Jarenlang was de hoop dat kunstmatige intelligentie dit automatisch zou kunnen leren, maar de enorme variëteit in hoe deze cellen eruitzien, heeft het voor computerprogramma's moeilijk gemaakt om te generaliseren van het ene experiment naar het andere.
Onlangs is er een nieuwe generatie kunstmatige intelligentiemodellen opgekomen die afbeeldingen kan begrijpen met zeer weinig instructies. Dit zijn foundation-modellen, en ze zijn getraind op enorme collecties alledaagse foto's, waarbij ze vormen en objecten leren herkennen zonder dat ze elk detail hoeven te leren. Eén zodanig model, ontworpen om alles in een afbeelding te segmenteren, heeft veelbelovend gebleken in de medische beeldvorming. Toch, toen onderzoekers probeerden dit krachtige hulpmiddel direct toe te passen op de complexe, veranderlijke wereld van hersencelvideo's, worstelde het ermee. Het model, getraind op katten, auto's en bomen, begreep de subtiele, gloeiende vlekken van een neuron niet van nature. Het had hulp nodig, maar de traditionele manier om een kunstmatige intelligentie te helpen is door het opnieuw te trainen, door het duizenden nieuwe voorbeelden te voeren totdat het de nieuwe regels leert. Dit proces is traag, vereist enorme hoeveelheden gelabelde data en vergrendelt het model vaak in een specifieke manier van de wereld zien, waardoor het minder flexibel is voor toekomstige experimenten.
Een team van onderzoekers aan de Universiteit van Catania in Italië stelde een andere vraag. In plaats van te proberen de hersenen van de kunstmatige intelligentie te veranderen, vroegen zij zich af of ze de ogen konden veranderen waardoor deze kijkt. Ze stelden een methode voor genaamd Retrieval-Augmented Visual Prompting. Stel je voor dat je een specifiek type wolk probeert te beschrijven aan een vriend die nog nooit zo'n wolk heeft gezien. Je kunt proberen de vorm en kleur met woorden te beschrijven, of je kunt simpelweg een foto van die wolk laten zien. De onderzoekers realiseerden zich dat de beste manier om de kunstmatige intelligentie te begeleiden, het tonen van een afbeelding van de wolk was. Ze bouwden een systeem waarbij, voordat het model naar een nieuwe hersenafbeelding kijkt, het een klein, zorgvuldig gekozen voorbeeld van een neuron uit een bibliotheek van eerder geannoteerde afbeeldingen te zien krijgt. Dit voorbeeld wordt direct naast de nieuwe afbeelding geplaatst en dient als een visuele hint. Het model wordt vervolgens gevraagd om alle andere neuronen te vinden die op het voorbeeld lijken.
De onderzoekers testten dit idee op een enorme publieke dataset van hersenopnames van muizen. Ze ontdekten dat het tonen van een enkel, goed gekozen voorbeeld de capaciteit van het model om neuronen te vinden en te omlijnen drastisch verbeterde, zelfs wanneer het model dat specifieke type hersenopname nog nooit eerder had gezien. De sleutel was niet alleen het tonen van een willekeurig voorbeeld, maar het tonen van het juiste voorbeeld. Ze ontwikkelden een slimme manier om het beste voorbeeld uit hun bibliotheek te selecteren door de helderheid en textuur van het voorbeeld af te stemmen op de specifiek geanalyseerde afbeelding. Wanneer ze deze methode gebruikten, sprong de prestaties van het model aanzienlijk omhoog, waardoor het gat tussen een gloednieuw, ongetraind model en een model dat uitgebreid was hertraind op de specifieke data, werd gedicht. Sterker nog, het gebruik van een enkel, perfect passend voorbeeld was effectiever dan het tonen van meerdere verschillende voorbeelden tegelijkertijd. De studie suggereert dat voor gespecialiseerde taken zoals het analyseren van hersenscans, de meest efficiënte weg voorwaarts misschien niet ligt in het vanaf de grond af aan herbouwen van de kunstmatige intelligentie, maar in het simpelweg geven van de juiste visuele context op het moment dat het een beslissing moet nemen.
De resultaten waren duidelijk en consistent over verschillende soorten hersenopnames. Wanneer het model zelf moest raden, miste het vaak zwakke cellen of tekende het rommelige contouren. Maar wanneer de onderzoekers één relevant voorbeeld uit hun bibliotheek aanboden, begreep het model plotseling waar het naar moest zoeken. Het werd veel beter in het vinden van de zwakke, doffe cellen die normaal gesproken over het hoofd worden gezien en in het scheiden van cellen die elkaar raken. De onderzoekers ontdekten ook dat de specifieke manier waarop ze het voorbeeld kozen, uitmaakte. Een willekeurig voorbeeld hielp, maar een voorbeeld dat gekozen was om overeen te komen met de specifieke condities van de nieuwe afbeelding, hielp nog meer. Ze trainden een klein, lichtgewicht computerprogramma om als selector te fungeren, dat leerde te voorspellen welk voorbeeld het meest nuttig zou zijn voor een gegeven afbeelding. Deze selector stelde het systeem in staat om zich onmiddellijk aan te passen aan nieuwe omstandigheden zonder ooit de kerninstellingen van het hoofdmodel van de kunstmatige intelligentie te veranderen.
Deze aanpak biedt een overtuigend alternatief voor de standaardmethode van het hertrainen van kunstmatige intelligentie. Hertrainen vereist aanzienlijke rekenkracht en tijd, en het resulteert vaak in een model dat uitstekend is in één specifieke taak, maar vergeet hoe het andere taken moet uitvoeren. De nieuwe methode houdt het originele model bevroren en onveranderd, waardoor de algemene kennis behouden blijft terwijl het zich kan aanpassen aan nieuwe, moeilijke taken via eenvoudige visuele aanwijzingen. De onderzoekers ontdekten dat deze methode een groot deel van de prestatiewinst die gewoonlijk wordt bereikt met volledige hertraining, herstelde, maar tegen een fractie van de kosten. Het suggereert dat in velden waar data schaars is en omstandigheden sterk variëren, de toekomst van kunstmatige intelligentie minder kan liggen in het leren van de machine nieuwe feiten, en meer in het leren hoe het door de juiste lens naar de wereld moet kijken. Door visueel geheugen direct in de input te injecteren, hebben de onderzoekers aangetoond dat een foundation-model kan worden gestuurd om expert-taken uit te voeren in gespecialiseerde biomedische beeldvorming zonder de zware last van parameteradaptatie.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.