VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch
Dit artikel introduceert VistaHop, een nieuwe benchmark en evaluatieomgeving die is ontworpen om de capaciteiten van multimodale grote redeneermodellen te beoordelen bij het uitvoeren van complexe, multi-hop visuele redenering en iteratieve beeldinspectie voor Visual DeepSearch, waarbij wordt onthuld dat huidige state-of-the-art modellen nog steeds aanzienlijk worstelen met deze taken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective inhuurt om een mysterie op te lossen. In het verleden waren de meeste "detective-tests" voor AI als eenvoudige raadsels: je liet de AI één foto zien en vroeg: "Welke kleur heeft de auto?" De AI keek slechts één keer, raadde de kleur en ging weer door.
Maar echt onderzoek in de echte wereld is veel moeilijker. Soms moet je, om een zaak op te lossen, inzoomen op een minuscuul logo op een schoen, de geschiedenis van dat merk opzoeken, uitzoeken waar de fabriek staat, het weer daar controleren en vervolgens al die punten verbinden om te achterhalen wie er op de plaats delict was.
Dit paper, VistaHop, gaat over het bouwen van een veel moeilijkere test om te zien of AI-detectives dit soort diepgaande, meerstaps werk daadwerkelijk kunnen doen.
Het Probleen: De "Eén-Blik"-valstrik
De auteurs stellen dat huidige AI-tests te makkelijk zijn. Ze zijn alsof je een detective een foto geeft en vraagt: "Is er een hond in deze afbeelding?" De AI werpt slechts één blik en zegt: "Ja."
Echt "Visueel Diepzoeken" (Visual DeepSearch) is anders. Het vereist dat de AI:
- Nauwkeurig kijkt: Inzoomen op specifieke onderdelen van een afbeelding (zoals een kleine tekst op een bord).
- Heen en weer gaat: Realiseren dat hij een aanwijzing heeft gemist, opnieuw inzoomen en naar een ander deel van de foto kijken.
- De punten verbindt: Wat hij in de foto ziet combineren met externe kennis (zoals het raadplegen van een database) over vele stappen heen.
De auteurs zeggen dat bestaande tests falen omdat ze de AI laten valsspelen door tekstuele aanwijzingen te gebruiken of simpelweg te gokken zonder echt de details te "zien".
De Oplossing: VistaHop (De "Obstacle Course")
Om dit op te lossen, heeft het team VistaHop gecreëerd, een nieuwe benchmark (een testsuite) die is ontworpen als een complexe hindernisbaan.
- De Opzet: Ze hebben 300 hoogwaardige foto's verzameld (zoals een drukke straat in een stad of een museum).
- De Taak: Ze hebben 350 vragen gemaakt die de AI dwingen tot een lange reis te maken.
- Voorbeeld: "Kijk naar de oranje zeecontainer rechtsonder. Zoek het bedrijfslogo. Zoek uit wanneer dat bedrijf is opgericht. Zoek nu de stad waar hun hoofdkantoor is gevestigd. In welk jaar werd die stad gesticht? Trek de twee jaartallen van elkaar af."
- De Regels: De AI mag niet zomaar gokken. Hij moet bewijzen dat hij naar het specifieke deel van de afbeelding heeft gekeken, het logo heeft gevonden en de keten van aanwijzingen heeft gevolgd. Als de AI probeert te antwoorden met alleen de tekst van de vraag (zonder naar de afbeelding te kijken), vangt de test hem en wordt het antwoord afgewezen.
Ze hebben ook VistaArena gebouwd, een "sportschool" waar ze de AI kunnen trainen. Het laat de AI hulpmiddelen gebruiken zoals een vergrootglas (om afbeeldingen te croppen/in te zoomen), een zoekmachine (om feiten te vinden) en een rekenmachine.
De Resultaten: De AI is Nog een Rookie
De auteurs lieten de slimste beschikbare AI-modellen (zoals SenseNova, GPT-5 en Gemini) door deze hindernisbaan gaan.
Het oordeel? De AI had het enorm zwaar.
- Zelfs het beste model kreeg slechts ongeveer 24% van de antwoorden goed bij de eerste poging.
- Wanneer de AI werd gedwongen om alleen naar de afbeelding te kijken zonder zoektools te gebruiken, kreeg hij minder dan 8% goed.
- De AI werd beter wanneer hij de mogelijkheid kreeg om tools te gebruiken (inzoomen en zoeken), maar hij faalde nog steeds vaak wanneer de "keten van aanwijzingen" te lang werd of het vereiste om naar meerdere verschillende plekken in de foto te kijken.
De Belangrijkste Conclusie
Het paper concludeert dat hoewel AI goed wordt in het "zien" van afbeeldingen, het nog steeds erg slecht is in het zijn van een volhardende onderzoeker. De AI heeft de neiging om te snel op te geven, kleine details te missen of te vergeten om terug te gaan en de afbeelding opnieuw te controleren.
De auteurs hebben VistaHop niet gebouwd om een product te verkopen, maar om de wereld te laten zien dat we betere tests en betere trainingsmethoden nodig hebben als we willen dat AI werkelijk complexe visuele mysteries begrijpt. Ze hebben hun data en code openbaar gemaakt zodat andere onderzoekers betere "detectives" kunnen bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.