An Empirical Study into Clustering of Unseen Datasets with Self-Supervised Encoders
Dit artikel toont empirisch aan dat hoewel zelfgesuperviseerde encoders beter generaliseren naar ongeziene datasets dan gesuperviseerde encoders, het finetunen van deze laatste op ImageNet-1k dit voordeel omkeert, en stelt verder vast dat de silhouette score in de UMAP-ruimte dient als een betrouwbare proxy voor het evalueren van clusterprestaties op ongelabelde data.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het uitgestrekte landschap van de moderne kunstmatige intelligentie heeft een krachtig idee wortel geschoten: machines kunnen leren de wereld te zien, niet alleen door te worden verteld wat alles is, maar simpelweg door uit zichzelf miljoenen afbeeldingen te bekijken. Deze aanpak, bekend als zelfgesuperviseerd leren (self-supervised learning), stelt computers in staat om een mentale kaart van visuele patronen op te bouwen — het herkennen van vormen, texturen en structuren — zonder dat een mens elke foto met een naam hoeft te labelen. Zodra een computer deze kaart heeft opgebouwd, kan deze worden gebruikt om nieuwe problemen op te lossen, zoals het identificeren van een specifiek type vogel of het sorteren van medische scans. Er bleef echter een kritische vraag bestaan: als we een computer die leerde van een enorme bibliotheek aan algemene foto's een compleet nieuwe set afbeeldingen geven die hij nog nooit heeft gezien, kan hij deze dan nog steeds begrijpen? Kan hij deze onbekende plaatjes op een manier groeperen die logisch zin geeft, simpelweg door naar de patronen te kijken die hij eerder heeft geleerd, zonder verdere training?
Een team van onderzoekers zette zich in om deze vraag te beantwoorden door de interne "kaart" van de computer te behandelen als een instrument voor ontdekking. Ze namen verschillende soorten vooraf getrainde computervisiemodellen — sommige die leerden door te worden verteld wat de juiste antwoorden waren, en andere die leerden door patronen in de data op eigen houtje te vinden — en vroegen hen om een grote verscheidenheid aan ongeziene collecties afbeeldingen te sorteren. Deze collecties varieerden van vertrouwde objecten zoals auto's en bloemen tot meer abstracte categorieën zoals texturen, handgeschreven cijfers en zelfs microscopische beelden van tumorweefsel. De onderzoekers leerden de modellen niets nieuws; ze lieten de modellen simpelweg naar de afbeeldingen kijken, deze omzetten in een lijst met getallen die hun kenmerken vertegenwoordigen, en gebruikten vervolgens standaard sorteeralgoritmes om vergelijkbare getallen bij elkaar te groeperen. Het doel was om te zien of de groepen die de computer vormde overeenkwamen met de reële categorieën die wij kennen, zoals "hond" of "auto", of dat de computer ze groepeerde op basis van iets heel anders, zoals de kleur van de achtergrond of de stijl van de afbeelding.
De resultaten onthulden een fascinerende splitsing in hoe deze verschillende soorten modellen denken. Wanneer de afbeeldingen vergelijkbaar waren met de afbeeldingen die de modellen tijdens hun initiële training hadden gezien, presteerden de modellen die expliciet waren onderwezen in de juiste namen van objecten het best. Zij konden deze vertrouwde items met een hoge nauwkeurigheid sorteren. Echter, naarmate de onderzoekers overgingen naar afbeeldingen die zeer verschillend waren van de trainingsdata — zoals schetsen, schilderijen of microscopische dia's — begonnen de modellen die op eigen houtje hadden geleerd de getrainde modellen te overtreffen. Deze zelfgeleerde modellen waren beter in het vinden van de onderliggende structuur in volkomen vreemde visuele werelden. Het lijkt erop dat de modellen die door mensen getraind werden om specifieke objecten te herkennen, te veel gefocust raakten op de details van die specifieke objecten, terwijl de zelfgeleerde modellen een meer flexibel begrip van visuele patronen ontwikkelden dat standhield, zelfs wanneer de context volledig veranderde.
De studie bracht ook een verrassende zwakte aan het licht van de zelfgeleerde modellen wanneer zij later werden gedwongen specifieke namen te leren. Wanneer de onderzoekers de zelfgeleerde modellen namen en hen een spoedcursus gaven in het benoemen van objecten, werden ze uitstekend in het sorteren van vertrouwde items, maar hun vermogen om de vreemde, onbekende afbeeldingen te hanteren werd juist slechter. Ze werden minder flexibel en verloren juist de kwaliteit die hen zo goed maakte in het omgaan met het onbekende. Dit suggereert een afruil: een model onderwijzen om een expert te zijn in een specifieke taak kan het minder in staat maken om een generalist te zijn. Bovendien ontdekten de onderzoekers dat de zelfgeleerde modellen veel gemakkelijker in de war raakten door de achtergrond van een afbeelding dan de gesuperviseerde modellen. Als de achtergrond van een foto werd veranderd, hadden de zelfgeleerde modellen moeite om het object te herkennen, terwijl de modellen die getraind waren met menselijke labels beter waren in het negeren van de achtergrond en het focussen op het onderwerp. Dit duidt erop dat de zelfgeleende modellen de hele afbeelding als een enkele, onscheidbare eenheid behandelen, terwijl de gesuperviseerde modellen leren om het hoofdonderwerp te scheiden van de omgeving.
Een van de meest praktische ontdekkingen van dit werk is een nieuwe manier om te beoordelen hoe goed een model presteert zonder dat daar de juiste antwoorden voor nodig zijn. Normaal gesproken moet je, om te weten of een computer een stapel foto's correct heeft gesorteerd, het juiste antwoord voor elke foto weten. De onderzoekers ontdekten dat ze konden voorspellen hoe goed de sortering werkte, simpelweg door te kijken naar hoe compact de groepen bij elkaar waren gepakt. Als de groepen van vergelijkbare afbeeldingen heel dicht bij elkaar lagen en ver van andere groepen af stonden, was de sortering waarschijnlijk correct. Deze "compactheidsscore" werkte vooral goed wanneer de afbeeldingen eerst werden vereenvoudigd in een lager-dimensionale ruimte, een proces dat onnodige ruis wegfiltert. Dit bevinding is significant omdat het betekent dat wetenschappers nu kunnen testen hoe goed een model een nieuwe dataset begrijpt, zelfs wanneer ze geen labels hebben, simpelweg door te controleren hoe natuurlijk de data clusteren.
De onderzoekers testten ook hoe goed deze modellen om kunnen gaan met afbeeldingen die zeer fijne onderscheidende details vereisen, zoals het onderscheid tussen verschillende vogelsoorten of variëteiten van bloemen. Ze kwamen tot de conclusie dat de modellen over het algemeen moeite hadden met deze zeer specifieke taken en veel beter presteerden wanneer de categorieën breder waren, zoals "vogel" versus "bloem". Dit komt overeen met het idee dat hoewel deze modellen uitstekend zijn in het zien van het grote geheel, ze nog niet van nature geschikt zijn voor de minuscule details die het ene specifieke type ding van het andere onderscheiden. De studie concludeert dat voor het sorteren van nieuwe, onbekende data, de beste aanpak vaak het gebruik van een zelfgeleerd model is dat niet gedwongen is om specifieke namen te leren, en dat de data eerst vereenvoudigd moeten worden om de patronen duidelijker te maken. Dit biedt een duidelijk pad vooruit voor het gebruik van kunstmatige intelligentie om de enorme, ongelabelde visuele wereld te organiseren en te begrijpen die buiten de datasets bestaat die we gebruiken om ze te trainen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.