← Nieuwste papers
💻 computer science

Low-Pass Filtering Improves Behavioral Alignment of Vision Models

Deze studie toont aan dat het toepassen van een laagdoorlaatfilter (bijvoorbeeld door testbeelden te vervagen) de gedragsalignatie van discriminatieve visiemodellen met het menselijk waarnemen drastisch verbetert, waardoor de kloof met menselijke observatoren wordt gehalverd en een nieuwe state-of-the-art wordt bereikt.

Oorspronkelijke auteurs: Max Wolff, Thomas Klein, Evgenia Rusak, Felix Wichmann, Wieland Brendel

Gepubliceerd 2026-02-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Max Wolff, Thomas Klein, Evgenia Rusak, Felix Wichmann, Wieland Brendel

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De "Wazige Bril" die Computers menselijker maakt

Stel je voor dat je een kunstenaar bent die probeert te begrijpen hoe een ander mens een schilderij bekijkt. Je hebt een superkrachtige camera (een kunstmatige intelligentie) die elk detail van het schilderij scherp in beeld kan brengen, tot op het niveau van één pixel. Maar als je kijkt naar hoe die camera het schilderij "begrijft", valt het op: hij ziet iets heel anders dan jij.

Wanneer jij een hond ziet, kijk je naar zijn vorm (de oren, de staart). De camera kijkt echter vooral naar de textuur (de vacht, de vlekken). Als je de camera een foto geeft van een hond die eruitziet als een kat (maar dan met een vacht van een kat), denkt de camera: "Dat is een kat!" Jij denkt: "Nee, dat is een hond, kijk naar de vorm!"

Dit is het probleem waar deze nieuwe studie over gaat: Hoe maken we computers menselijker in hun denken?

De oude theorie: "Maak ze creatief"

Vroeger dachten onderzoekers dat het antwoord lag in het type "hersenen" dat we aan de computer gaven. Ze dachten: "Als we een computer laten leren om nieuwe plaatjes te maken (generatief), in plaats van alleen plaatjes te herkennen (discriminatie), dan gaat hij opeens menselijker denken."

Een groot model genaamd Imagen deed dit en was inderdaad heel menselijk. Maar de onderzoekers van deze paper (Max Wolff en collega's) zeggen: "Wacht even, misschien is het niet omdat hij creatief is, maar omdat hij slecht ziet."

De ontdekking: De "Wazige Bril"

Bij het maken van Imagen werd de foto die de computer kreeg, eerst heel klein gemaakt (van 224 pixels naar 64 pixels). Dit klinkt als een fout, maar het is eigenlijk als het opzetten van een wazige bril.

De onderzoekers ontdekten iets verrassends:

  1. Mensen zien wazig: Onze ogen zijn niet perfect. Ze filteren van nature de scherpe, hoge frequenties (de fijne details) eruit. We zien de wereld eerst als een zachte vorm, en pas later zien we de details.
  2. Computers zien te scherp: Computers kijken naar alles tegelijk, zelfs de ruis en de fijste details die mensen niet eens zien.
  3. De oplossing: Als je een slimme computer (zoals CLIP) een wazige bril opzet (door de foto te vervagen of te verkleinen) voordat hij hem bekijkt, dan gaat hij opeens veel meer lijken op een mens!

Het is alsof je een fotograaf die een microscoop gebruikt, een zachte bril opzet. Plotseling kijkt hij niet meer naar de stofvezels, maar naar de grote lijnen, net zoals jij.

Wat gebeurde er in het experiment?

De onderzoekers deden een proef met een simpele truc:

  • Ze namen een heel slim computermodel.
  • Ze maakten de foto's wazig (alsof je door een vieze bril kijkt) voordat ze ze aan de computer gaven.
  • Het resultaat: De computer begon precies dezelfde fouten te maken als mensen. Als mensen dachten dat een hond een kat was, dacht de computer dat ook. De "menselijkheid" van de computer verdubbelde bijna!

Dit is nog beter dan de vorige recordhouder (Imagen), en dat zonder dat de computer opnieuw getraind hoefde te worden. Het was alleen een kwestie van de foto's even wazig maken.

Waarom werkt dit? (De Analogie van de Muziek)

Stel je voor dat geluid een spectrum is:

  • Basse tonen zijn de grote vormen (de vorm van een hond).
  • Hoge tonen zijn de fijne details (de textuur van de vacht).

Mensen zijn als een radio die de hoge tonen een beetje dempt. We horen vooral de bas. Computers zijn als een radio die alle tonen hard opzet, tot het een oorverdovend geluid wordt. Hierdoor vergeten ze de bas (de vorm) en focussen ze op de hoge tonen (de textuur).

Door de computer een "laagdoorlaatfilter" (low-pass filter) te geven, doen we precies wat onze ogen doen: we dempen de hoge tonen. De computer hoort dan weer de bas, en denkt daardoor menselijker.

De grote les

Deze studie leert ons twee dingen:

  1. Soms is minder meer: Door informatie weg te halen (de scherpe details), wordt de computer slimmer in het begrijpen van de wereld, omdat hij dan doet wat mensen doen.
  2. Generatief is niet alles: Je hoeft geen ingewikkelde "creatieve" modellen te bouwen om menselijk te zijn. Soms is het gewoon een kwestie van kijken naar de wereld zoals wij dat doen: een beetje wazig, met de nadruk op de vorm in plaats van de details.

Kortom: Als je wilt dat een computer menselijker denkt, geef hem dan niet een super-scherp oog, maar zet hem een zachte, wazige bril op. Dan ziet hij de wereld eindelijk zoals wij.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →