From Web to Pixels: Bringing Agentic Search into Visual Perception
Dit artikel introduceert "Perception Deep Research", een nieuwe open-wereld visuele perceptie-uitdaging waarbij objecten via externe kennis moeten worden geïdentificeerd voordat ze gelokaliseerd worden, en adresseert deze met de WebEye-benchmark en het Pixel-Searcher-agentframework, dat state-of-the-art open-source prestaties demonstreert in zoekgebaseerde grounding, segmentatie en VQA.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je het spel "Waar is Wally?" (of "Where's Waldo?") speelt, maar dan met een draai.
In het klassieke spel kijk je naar een drukke afbeelding en vind je Wally op basis van zijn uiterlijk: een rood-wit gestreept shirt, een hoed en een bril. Je hoeft niet te weten wie Wally is; je moet gewoon het visuele patroon herkennen.
Dit artikel stelt dat de meeste huidige AI-viziesystemen vastzitten in het spelen van het klassieke spel. Ze zijn uitstekend in het vinden van dingen die eruitzien als een "rode auto" of een "persoon in een blauw shirt". Maar ze hebben moeite wanneer de vraag niet gaat over hoe iets eruitziet, maar over wie het is, gebaseerd op feiten die je niet in de afbeelding kunt zien.
De Nieuwe Uitdaging: "De Mysteriegast"
De auteurs introduceren een nieuwe, moeilijkere versie van het spel genaamd Perception Deep Research.
Stel je een foto voor van een drukke feest. De vraag is niet "Vind de persoon in het rode shirt". In plaats daarvan is de vraag:
"Vind de persoon die in januari 2026 wereldwijd ambassadeur werd voor een huidverzorgingsmerk, nadat dat merk was overgenomen door een bedrijf voor 2,7 miljard dollar."
Je kunt dit niet oplossen door alleen naar de foto te kijken. De foto toont niet het prijskaartje van de overname of de datum van de ambassadeur-aankondiging. Om de juiste persoon te vinden, moet de AI:
- Op Webjacht gaan: Zoek op internet uit welk merk werd overgenomen, in welke maand, en wie de ambassadeur was.
- Het Mysterie Oplossen: Besef: "Ah, de persoon op de foto met de naam 'Winter' is degene die we zoeken."
- Naar de Pixel wijzen: Ga uiteindelijk terug naar de foto en teken een kader om Winter.
Het artikel noemt dit "Van Web naar Pixels". Het gaat om het verbinden van internetfeiten met specifieke plekken in een afbeelding.
De Tools die Ze Bouwden
Om te testen of AI dit kan, bouwde het team twee hoofdcomponenten:
1. WebEyes (Het Testcircuit)
Denk hierbij aan een gespecialiseerd obstakelcircuit voor AI. Het bevat 120 complexe afbeeldingen en honderden lastige vragen.
- De Draai: Elke vraag vereist dat de AI verborgen feiten opzoekt (zoals de recente rol van een beroemdheid, de lanceringdatum van een product of de achtergrondverhaal van een personage) voordat het zelfs maar kan raden waar het in de afbeelding moet kijken.
- Het Doel: De AI moet niet alleen de vraag beantwoorden; het moet de exacte persoon of het exacte object in de afbeelding aanwijzen dat overeenkomt met het antwoord.
2. Pixel-Searcher (De Slimme Detective)
Dit is de nieuwe AI-agent die de auteurs hebben gemaakt om de test te doorlopen. In plaats van alleen naar de afbeelding te staren en te raden, handelt Pixel-Searcher als een detective met een vergrootglas en een laptop.
- Stap 1: Het Zoeken. Het breekt de vraag af. "Wie was de ambassadeur?" "Wanneer vond de deal plaats?" Het zoekt op het web en leest de resultaten.
- Stap 2: De Redenering. Het verbindt de punten. "Oké, de deal vond plaats in januari, en de ambassadeur is Winter."
- Stap 3: De Jacht. Het gaat terug naar de afbeelding. Het zoekt naar een persoon die eruitziet als Winter (misschien controlerend op specifieke kleding of kenmerken die in het zoekresultaat werden genoemd) en tekent een kader om hen heen.
Wat Ze Vonden
De onderzoekers testten Pixel-Searcher tegen andere slimme AI-modellen. Hier is het oordeel:
- Oude AI-modellen: Wanneer ze geconfronteerd werden met deze "Mysteriegast"-vragen, raakten standaard AI-modellen in de war. Ze probeerden te raden op basis van alleen wat ze in de afbeelding zagen of wat ze al "wisten" uit hun training. Ze kozen vaak de verkeerde persoon omdat ze de verborgen feiten niet konden vinden.
- Pixel-Searcher: Deze nieuwe agent presteerde het beste onder open-source modellen. Door daadwerkelijk het web te doorzoeken en de aanwijzingen te redeneren, vond het succesvol veel vaker de juiste doelen.
Waar het nog steeds moeite heeft:
Het artikel merkt op dat de AI niet faalt omdat het geen perfect kader om een persoon kan tekenen. Het faalt eerder in het proces:
- Slecht Zoeken: Het zoekt soms naar het verkeerde ding of mist een cruciaal feit.
- Verkeerde Identiteit: Het komt de juiste feiten achter maar kiest de verkeerde persoon op de foto (bijvoorbeeld: het weet dat de ambassadeur "Winter" is, maar wijst naar de verkeerde persoon met de naam Winter).
- Binding: Het heeft moeite om het "feit" (Winter) te verbinden met het "visuele" (de persoon op de foto).
Het Grote Plaatje
Het artikel concludeert dat AI om de wereld echt te begrijpen, niet alleen een "camera" kan zijn die vormen ziet. Het moet een "onderzoeker" zijn die informatie kan opzoeken, puzzels kan oplossen en die kennis vervolgens kan gebruiken om naar het juiste ding in een afbeelding te wijzen. Ze noemen dit nieuwe veld Perception Deep Research, en ze hebben de tools (WebEyes en Pixel-Searcher) verschaft om andere wetenschappers te helpen betere "detective"-AI's te bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.