Do Composed Image Retrieval Benchmarks Require Multimodal Composition?
Dit artikel onthult dat huidige benchmarks voor samengestelde beeldretrieval (CIR) multimodale compositiecapaciteiten overschatten omdat een aanzienlijk deel van de queries via unimodale shortcuts kan worden opgelost of slecht geformuleerd is, waardoor een gevalideerde subset noodzakelijk is om te waarborgen dat modellen beeld- en tekstinput werkelijk combineren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een spelletje "Raad de Afbeelding" speelt.
In dit spel krijg je twee aanwijzingen om een specifieke foto te vinden die verborgen zit in een enorme bibliotheek met miljoenen afbeeldingen:
- Een startfoto (bijvoorbeeld een foto van een rode jurk).
- Een tekstinstructie (bijvoorbeeld: "Maak hem blauw en voeg lange mouwen toe").
Het doel is om de doelafbeelding te vinden (de blauwe jurk met lange mouwen). Dit wordt Composed Image Retrieval (CIR) genoemd. Het idee is dat een slimme computer de visuele aanwijzing (de rode jurk) en de tekstuele aanwijzing (de instructies) moet combineren om de puzzel op te lossen. Als hij dit niet kan, "begrijpt" hij niet echt hoe hij afbeeldingen en woorden moet mengen.
Het Probleem: De Cheats
De auteurs van dit artikel onderzochten vier populaire "Raad de Afbeelding"-spellen (benchmarks) die worden gebruikt om te testen hoe goed AI-modellen deze taak uitvoeren. Ze vermoedden dat de spellen waren opgezet met cheats.
Ze ontdekten dat voor een groot aantal puzzels de AI in feite de afbeelding en de tekst niet hoefde te combineren. Het kon winnen door gebruik te maken van slechts één aanwijzing:
- De Tekst-Cheat: Soms was de tekstinstructie zo specifiek ("Vind een foto van een blauwe jurk met lange mouwen") dat de AI de startfoto volledig kon negeren en gewoon op de tekstbeschrijving kon zoeken. Het vond het antwoord zonder ooit naar de afbeelding te kijken.
- De Afbeeldings-Cheat: Soms was de tekstinstructie zo vaag of onbruikbaar ("Maak het beter") dat de AI de tekst kon negeren en gewoon een gok kon wagen op basis van de startfoto.
De Metafoor:
Stel je voor dat een leraar een leerling een wiskundeprobleem geeft: "Begin met het getal 5, tel vervolgens 3 op."
- Echt leren: De leerling rekent uit.
- De Cheat: De leerling negeert het deel "Begin met 5" en onthoudt gewoon dat het antwoord op "tel 3 op" altijd 8 is, of negeert de wiskunde en raadt gewoon omdat de leraar altijd 8 kiest.
Het artikel ontdekte dat in deze AI-benchmarks 32% tot 83% van de vragen eigenlijk op te lossen was met slechts één aanwijzing (de cheat), in plaats van dat de leerling de feitelijke wiskunde moest doen (het combineren van afbeelding en tekst). Dit betekent dat de hoge scores die AI-modellen behaalden vaak nep waren – ze zaten te valsspelen in plaats van te leren.
Het Tweede Probleem: Gebroken Puzzels
De auteurs vroegen zich toen af: "Oké, laten we alle cheat-vragen verwijderen. Nu hebben we alleen nog de moeilijke puzzels die beide aanwijzingen vereisen. Zijn die eerlijk?"
Ze vroegen mensen om naar de overgebleven "moeilijke" puzzels te kijken. Ze ontdekten dat veel daarvan gebroken waren:
- Te Vaag: De instructie was "Maak het donkerder", maar er waren 50 verschillende donkerdere versies van de jurk in de bibliotheek. Welke was het "correcte" antwoord? De puzzel had geen enkel juist antwoord.
- Niet Overeenstemmend: De instructie zei "Voeg een hoed toe", maar de foto met het "correcte" antwoord had zelfs geen hoed. De puzzel was vanaf het begin kapot.
De Metafoor:
Het is alsof een leraar een leerling een raadsel geeft: "Wat is iets dat rond en rood is?"
- Gebroken Puzzel: De leraar zegt dat het antwoord "Een appel" is, maar de leerling zou ook correct "Een tomaat" of "Een bal" kunnen zeggen. Omdat er veel juiste antwoorden zijn, is de toets oneerlijk.
- Niet Overeenstemmend: De leraar zegt dat het antwoord "Een vierkant" is, maar het raadsel vroeg om iets ronds. De toets is onzin.
De Oplossing: CIRCUS
Om dit op te lossen, maakten de auteurs een nieuwe, opgeschoonde versie van deze tests genaamd CIRCUS.
- Ze verwijderden alle "cheat"-vragen waarbij de AI kon winnen met slechts één aanwijzing.
- Ze verwijderden alle "gebroken" vragen waarbij het antwoord vaag of verkeerd was.
Ze hielden een veel kleinere set over van 1.689 echt moeilijke puzzels.
De Resultaten: De AI werd Veel Slechter (Maar dat is Goed)
Toen ze de AI-modellen opnieuw testten op deze nieuwe, schone set puzzels:
- De scores daalden drastisch. Bijvoorbeeld, de score van één model op één test daalde van 70% naar 24%.
- Waarom is dit goed? Het bewijst dat het model voorheen niet echt slim was in het combineren van afbeeldingen en tekst; het was gewoon goed in het opsporen van de cheats.
- Op de nieuwe schone tests moesten de modellen daadwerkelijk zowel de afbeelding als de tekst gebruiken om het antwoord goed te krijgen. De "kloof" tussen het gebruik van alleen tekst, alleen afbeeldingen en het gebruik van beide, werd veel duidelijker.
De Conclusie
Het artikel concludeert dat huidige AI-tests voor "het mengen van afbeeldingen en tekst" gebrekkig zijn. Ze zijn als een rijexamen waarbij de auto kan slagen door alleen op het gaspedaal te drukken zonder ooit te sturen. De auteurs hebben een nieuwe, strengere rijtest (CIRCUS) gebouwd die de auto dwingt om daadwerkelijk te sturen. Totdat we tests zoals deze gebruiken, overschatten we misschien hoe slim onze AI echt is.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.