CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
Dit artikel introduceert CompareBench, een uitgebreide benchmarksuite bestaande uit TallyBench, OmniCaps en een visuele vergelijkingsdataset van 1.200 vragen, om systematische zwakheden in huidige visie-taalmodellen met betrekking tot objecttellen en geometrische, ruimtelijke en temporele redenering te evalueren en bloot te leggen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Menselijke visie gaat niet alleen over zien; het gaat over vergelijken. Wanneer we een kamer bekijken, registreren we niet alleen dat er stoelen en tafels aanwezig zijn; we beoordelen direct welke stoel hoger is, welke tafel dichterbij staat, hoeveel kopjes er op het aanrecht staan, of of een foto een scène uit het verleden of het heden weergeeft. Dit vermogen om het ene tegen het andere af te wegen, is een fundamenteel onderdeel van hoe wij de wereld begrijpen. In de afgelopen jaren hebben computers geleerd om met opmerkelijke vaardigheid te zien, in staat om afbeeldingen te beschrijven en vragen te beantwoorden over wat ze bevatten. Deze systemen, bekend als vision-language modellen, zijn de motoren achter veel moderne hulpmiddelen die een grafiek kunnen lezen, een foto kunnen beschrijven of een visuele puzzel kunnen oplossen. Toch is het, hoewel deze machines bekwaam zijn geworden in herkenning en beschrijving, onduidelijk gebleven of zij over hetzelfde intuïtieve begrip van vergelijking beschikken dat mensen elke seconde van de dag gebruiken.
Een onderzoeker heeft nu een gespecialiseerde test gebouwd om deze vraag te beantwoorden, waarbij een nieuwe evaluatiesuite is gecreëerd die ontworpen is om de specifieke handeling van het vergelijken van visuele informatie te isoleren. De onderzoeker ontdekte dat, hoewel de meest geavanceerde computersystemen goed presteren op algemene taken, ze aanzienlijk moeite hebben wanneer ze direct wordt gevraagd om vergelijkingen te maken over hoeveelheid, grootte, afstand of tijd. De studie laat zien dat zelfs de slimste modellen kunnen falen bij het tellen van objecten die duidelijk zichtbaar zijn, de lengte van twee items verkeerd inschatten, of in de war raken over welke van twee mensen dichter bij de camera staat. De onderzoeker ontdekte dat deze systemen vaak struikelen over taken die voor een mens triviaal zijn, wat suggereert dat het vermogen om visuele details te vergelijken een systematische zwakte blijft in de huidige kunstmatige intelligentie.
Om dit gat te onderzoeken, heeft de onderzoeker een uitgebreide reeks tests samengesteld genaamd CompareBench, die wordt ondersteund door twee andere bronnen die zij heeft ontwikkeld: TallyBench en OmniCaps. TallyBench is een collectie van tweeduizend afbeeldingen, elk vergezeld van een eenvoudige vraag die de computer vraagt om een specifiek type object te tellen, zoals honden, boeken of lepels. Deze bron dient als fundament voor het testen van hoe goed een model individuele items kan tellen en levert ook de bronafbeeldingen voor de taak van hoeveelheidsvergelijking. OmniCaps is een kleinere set van zevenhonderd en zestien afbeeldingen met historische gebeurtenissen, beroemde landmerken en bekende personen, elk voorzien van een specifieke datum. Deze collectie stelt de onderzoeker in staat om te testen of een model het verstrijken van de tijd kan begrijpen door afbeeldingen chronologisch te ordenen. De hoofdlest, CompareBench, brengt deze elementen samen in twaalfhonderd vragen die de computer vragen om directe vergelijkingen te maken. Deze vragen zijn verdeeld in vier categorieën: het vergelijken van hoeveelheden, het vergelijken van geometrische eigenschappen zoals lengte en dikte, het beoordelen van ruimtelijke relaties zoals diepte en hoogte, en het ordenen van gebeurtenissen in de tijd. De subset voor hoeveelheidsvergelijking put specifiek uit TallyBench om zeshonderd vragen te vormen.
De onderzoeker testte negen verschillende versies van vooraanstaande computer vision-systemen van drie grote technologiebedrijven. De onderzoeker vroeg deze modellen om de twaalfhonderd vergelijkingsvragen en de tweeduizend telopdrachten op te lossen. De resultaten toonden een duidelijke kloof tussen menselijke prestaties en machineprestaties. Mensen behaalden bijna perfecte scores op bijna elke taak, waarbij ze objecten correct telden en groottes gemakkelijk beoordeelden. De computermodellen vertoonden echter hardnekkige fouten. Bij de telopdrachten behaalden de beste modellen ongeveer achttachtigzeven procent van de antwoorden correct, wat betekent dat ze objecten in meer dan één op de tien afbeeldingen misten of verkeerd telden. Op de vergelijkingsopdrachten varieerde de prestatie per categorie. De modellen waren redelijk goed in het vergelijken van hoeveelheden, maar ze hadden aanzienlijke problemen met ruimtelijk redeneren, waarbij ze vaak faalden in het bepalen welk object dichter bij de camera stond of welk punt hoger van de grond was. Ze hadden ook moeite met geometrische vergelijkingen, zoals het beslissen welk van de twee boeken dikker was.
Een van de meest verrassende bevindingen kwam naar voren in de categorie van de temporele, of tijdgebaseerde, vergelijking. In dit gedeelte werd de modellen gevraagd naar afbeeldingen van historische scènes, landmerken of beroemde personen te kijken en te beslissen welke eerder in de geschiedenis verscheen. Hier presteerden de computermodellen de menselijke proefpersonen daadwerkelijk het beste. De mensen, die beperkt waren tot het kijken naar het visuele bewijs in de foto's, konden vaak de juiste volgorde niet bepalen omdat de afbeeldingen erg op elkaar leken. De computermodellen hadden echter toegang tot een enorme hoeveelheid bestaande kennis over geschiedenis, architectuur en beroemde figuren. Ze konden deze interne database gebruiken om de afbeeldingen correct te ordenen, zelfs wanneer de visuele aanwijzingen alleen onvoldoende waren. Dit suggereert dat hoewel de modellen een werkelijk visueel begrip van ruimte en grootte missen, ze dit soms kunnen compenseren door hun enorme geheugen van feiten te gebruiken om problemen op te lossen die externe kennis vereisen.
Ondanks deze incidentele successen benadrukt de studie dat de kernvaardigheid om visuele elementen te vergelijken nog niet volledig door kunstmatige intelligentie is beheerst. De onderzoeker merkte op dat de modellen vaak de lengte van een object verwarden met de hoogte, of faalden om onderscheid te maken tussen een object op de voorgrond en een object op de achtergrond. Ze vonden ook dat de modellen vaak deels verborgen objecten misten bij het tellen, een taak die mensen instinctief afhandelen. De onderzoeker concludeerde dat de huidige systemen nog niet betrouwbaar zijn voor taken die een fijnmazige visuele vergelijking vereisen, en dat deze fouten niet slechts willekeurige vergissingen zijn, maar systematische beperkingen in de manier waarop de modellen visuele informatie verwerken. Door een gerichte set tests te bieden die deze specifieke vaardigheden isoleert, biedt de nieuwe benchmark een duidelijke manier om vooruitgang in dit gebied te meten. De onderzoeker hoopt dat door hun gegevens en methoden publiek te maken, andere wetenschappers deze instrumenten kunnen gebruiken om betere modellen te bouwen die uiteindelijk het menselijke vermogen kunnen evenaren om de wereld om ons heen te zien, te vergelijken en te begrijpen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.