← Nieuwste papers
🧬 biology

Extremely coarse learning objectives induce human-aligned representations in AI vision models

Deze studie toont aan dat het trainen van AI-visiemodellen met extreem grove leerdoelen, zoals het onderscheiden van slechts acht brede categorieën, leidt tot interne representaties die nauwer aansluiten bij menselijke neurale responsen en perceptuele oordelen dan modellen die getraind zijn op fijnmazige of zelfgesuperviseerde taken.

Oorspronkelijke auteurs: Yash Mehta, Michael Bonner

Gepubliceerd 2026-09-25
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yash Mehta, Michael Bonner

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

Decennialang hebben wetenschappers geprobeerd te begrijpen hoe het menselijk brein een vloedgolf aan licht omzet in een helder beeld van de wereld. Ze hadden lang vermoed dat het antwoord lag in de manier waarop ons visuele systeem informatie organiseert, door de chaos van de natuur te sorteren in nette categorieën zoals "dier", "gereedschap" of "voertuig". Om deze ideeën te testen, hebben onderzoekers kunstmatige intelligentiesystemen gebouwd die de structuur van het brein nabootsen, waarbij ze deze hebben getraind om duizenden specifieke objecten te herkennen. Deze digitale breinen zijn krachtige instrumenten geworden, maar een hardnekkige vraag bleef: heeft het brein daadwerkelijk zo'n groot aantal specifieke labels nodig om een mensachtige visuele verstandhouding op te bouwen? Misschien ligt het geheim van zien als een mens niet in het memoriseren van een enorme encyclopedie van objecten, maar in het leren van een veel eenvoudigere, bredere manier om de wereld te sorteren.

Een team onderzoekers aan de Johns Hopkins University zette zich schouder aan schouder met deze mogelijkheid door de complexiteit van standaard AI-training weg te strippen. In plaats van hun kunstmatige netwerken te leren om tussen duizend verschillende categorieën afbeeldingen te onderscheiden, zoals gebruikelijk is, leerden ze hen om dezelfde afbeeldingen in slechts een handvol zeer brede groepen te sorteren. Ze gebruikten geen door mensen gemaakte labels voor deze groepen; in plaats daarvan lieten ze de computer zijn eigen natuurlijke onderverdelingen binnen de data vinden, waardoor categorieën ontstonden die bijvoorbeeld "levende wezens" van "machines" of "binnenruimtes" van "buitenruimtes" zouden kunnen scheiden. Vervolgens trainden ze honderden van deze netwerken, waarbij ze het aantal groepen varieerden van slechts twee tot zesentwintig, en vergeleken ze hoe goed de resulterende digitale breinen overeenkwamen met de werkelijke activiteit van het menselijk brein en het gedrag van menselijke waarnemers.

De resultaten waren verrassend. De onderzoekers ontdekten dat netwerken die getraind waren op deze extreem eenvoudige, grove categorieën interne kaarten van de visuele wereld ontwikkelden die net zo goed, en vaak zelfs beter, overeenkwamen met de menselijke hersenactiviteit dan netwerken die getraind waren op de volledige duizend categorieën. Wanneer zij maten hoe goed deze kunstmatige breinen aansloten bij scans van de menselijke visuele cortex en opnames van de hersenen van macrocutapen, presteerden de modellen die getraind waren op slechts acht brede groepen op hetzelfde niveau als de meest complexe modellen. Nog indrukweender was dat deze eenvoudige netwerken menselijke oordelen over welke objecten qua uiterlijk op elkaar lijken, beter maten dan enig ander getest model, inclusclusief de meest geavanceerde kunstmatige intelligentiesystemen van vandaag.

Deze ontdekking daagt het heersende idee uit dat men, om een machine te bouwen die ziet als een mens, moet trainen op een massale, gedetailleerde lijst van specifieke objectnamen. De studie suggereert dat het menselijke visuele systeem mogelijk geen fijnmazige classificatieopdracht van duizend categorieën nodig heeft om een verfijnd begrip van de wereld te ontwikkelen. In plaats daarvan lijkt het vermogen om afbeeldingen in brede, betekenisvolle clusters te groeperen voldoende te zijn om een representatie van het zicht te genereren die de onze weerspiegelt. De onderzoekers demonstreerden dat dit effect standhoudt bij verschillende soorten neurale netwerkarchitecturen, van oudere, eenvoudigere ontwerpen tot moderne, complexe systemen, en dat het werkt, zelfs wanneer de trainingsdata beperkt is.

Het team onderzocht ook of de specifieke manier waarop zij deze brede categorieën creëerden, uitmaakte. Zij vonden dat de resultaten standhielden, ongeacht of de categorieën werden afgeleid van de statistische patronen van de afbeeldingen zelf of werden gedefinieerd door duidelijke, menselijk begrijpelijke concepten zoals "natuurlijk versus kunstmatig" of "klein versus groot". Dit geeft aan dat de cruciale factor de grofheid van het leerdoel zelf is, en niet de specifieke labels die worden gebruikt. De studie toonde verder aan dat deze grof getrainde netwerken niet simpelweg een vereenvoudigde versie leerden van wat een complex netwerk leert; ze ontwikkelden een fundamenteel andere manier om visuele informatie te organiseren die toevallig nauwer aansloot bij de menselijke perceptie.

Door aan te tonen dat een verrassend eenvoudig leerdoel een mens-gealigneerde visie kan produceren, herformuleert dit werk ons begrip van wat noodzakelijk is om een machine te laten zien. Het suggereert dat de weg naar kunstmatige intelligentie die de menselijke perceptie werkelijk weerspieeft, niet ligt in het voeden ervan met meer data of complexere taken, maar in het leren zien van de wereld in bredere, meer fundamentele termen. De bevindingen openen een nieuwe weg voor het bouwen van AI-systemen die niet alleen krachtig zijn, maar ook werkelijk in lijn zijn met de manier waarop menselijke wezens hun visuele ervaring waarnemen en organiseren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →