Probing Perceptual Constancy in Large Vision-Language Models
Deze studie evalueert 155 Vision-Language Modellen over 236 experimenten met betrekking tot kleur-, grootte- en vormconstantie, waarbij een significante variabiliteit in prestaties en een duidelijke dissociatie tussen de vermogens voor vormconstantie en die voor kleur en grootte worden onthuld.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je naar een rode appel kijkt. Als je er vandaan loopt, lijkt hij kleiner. Als je er een blauwe zaklamp op schijnt, ziet hij er paars uit. Als je er vanaf de zijkant naar kijkt, ziet hij eruit als een ovaal in plaats van een cirkel.
Een menselijk brein is geweldig omdat het weet dat de appel nog steeds een grote, rode, ronde appel is, ongeacht deze veranderingen. Het laat zich niet foppen door de afstand, het vreemde licht of de hoek. Deze superkracht wordt Perceptuele Constante genoemd.
Dit artikel is als een gigantisch rapportcijfer voor 155 verschillende "AI-hersenen" (genaamd Vision-Language Models) om te zien of ze deze zelfde superkracht hebben. De onderzoekers hebben een speciale test gebouwd genaamd ConstancyBench om drie specifieke vaardigheden te controleren:
1. De drie geteste vaardigheden
Beschouw deze vaardigheden als drie verschillende niveaus van een videogame:
- Kleurconstante (Het "Verlichtingsniveau"): Kan een AI begrijpen dat een witte muur wit is, zelfs als de kamer wordt verlicht door een gele lamp of een blauw neonbord?
- De Test: De AI kijkt naar een Rubik's kubus in vreemd licht en moet de echte kleur van het middelste vierkantje raden.
- Grootteconstante (Het "Afstandsniveau"): Kan een AI begrijpen dat een auto ver weg dezelfde grootte heeft als een auto vlak naast hem, ook al ziet de verre auto er klein uit op het scherm?
- De Test: De AI kijkt naar twee raketten, één ver naar achteren en één dichtbij, en moet beslissen of ze echt verschillende groottes hebben of dat ze er alleen anders uitzien door het perspectief.
- Vormconstante (Het "Hoekniveau"): Kan een AI weten dat een rond bord nog steeds een cirkel is, zelfs als het gekanteld is waardoor het op een ovaal lijkt?
- De Test: De AI kijkt naar een deur die een beetje openstaat en gekanteld is, waardoor het eruitziet als een trapezium, en moet beseffen dat het eigenlijk een rechthoek is.
2. De resultaten: Wie is geslaagd?
De onderzoekers hebben 155 verschillende AI-modellen getest, variërend van kleine, lichte modellen tot enorme, superintelligente modellen (zoals GPT-4o). Dit is wat ze ontdekten:
- De "Vorm"-vaardigheid is makkelijk: De AI-modellen waren verrassend goed in Vormconstante. Het is alsof ze heel goed zijn in het herkennen van de "omtrek" van dingen. Zelfs kleinere modellen konden doorhebben dat een gekantelde rechthoek nog steeds een rechthoek is.
- De "Kleur" en "Grootte" vaardigheden zijn moeilijk: De modellen hadden veel meer moeite met Kleur en Grootte. Ze werden vaak gefopt door de verlichting of de afstand. Het is alsof ze naar een platte foto kijken en vergeten dat de wereld 3D is en veranderlijk licht heeft.
- Grotere hersenen doen het beter: Er was een duidelijke regel: hoe groter het AI-model, hoe beter het was in deze tests.
- Kleine modellen faalden vaak en raakten in de war door simpele trucjes.
- De enorme modellen (de "reuzen" van de AI-wereld) deden het veel beter, vooral bij het begrijpen van grootte en afstand. Het lijkt erop dat naarmate je de AI meer "hersencapaciteit" (parameters) geeft, het beter wordt in het begrijpen van de 3D-wereld.
3. De belangrijkste conclusie
Het artikel concludeert dat AI nog geen enkelvoudig, perfect "menselijk" visie heeft. In plaats daarvan heeft het een gestratificeerde (gelaagde) visie:
- Het is goed in eenvoudige geometrie (Vorm).
- Het wordt beter in het begrijpen van de schaal en de verlichting van de wereld (Grootte en Kleur), maar alleen als het model enorm groot is.
De auteurs suggereren dat hoewel deze AI-modellen slimmer worden, ze de wereld misschien niet op dezelfde manier "zien" als mensen. Ze zijn misschien gewoon erg goed in het voorspellen op basis van patronen die ze in hun trainingsdata hebben gezien, in plaats van dat ze werkelijk de natuurkunde begrijpen.
Kortom: Als je een AI vraagt om een vorm te identificeren, is het meestal slim. Als je het een AI vraagt hoe groot of welke kleur iets echt is wanneer de verlichting of de afstand lastig is, is het nog steeds aan het leren. En hoe groter de AI, hoe minder waarschijnlijk het is dat het wordt gefopt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.