From Web to Pixels: Bringing Agentic Search into Visual Perception
Ce papier présente « Perception Deep Research », un nouveau défi de perception visuelle en monde ouvert où les objets doivent être identifiés via des connaissances externes avant d'être localisés, et y répond avec l'évaluation WebEye et le cadre agentique Pixel-Searcher, qui démontrent des performances à l'état de l'open-source en matière d'ancrage, de segmentation et de VQA basés sur la recherche.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous jouiez à un jeu de « Où est Charlie ? » (ou « Où est Wally ? »), mais avec une variante.
Dans le jeu classique, vous examinez une image bondée et trouvez Charlie en vous basant sur son apparence : un pull rayé rouge et blanc, un bonnet et des lunettes. Vous n'avez pas besoin de savoir qui est Charlie ; vous devez simplement repérer le motif visuel.
Ce papier soutient que la plupart des systèmes de vision par ordinateur actuels sont coincés à jouer au jeu classique. Ils sont excellents pour trouver des objets qui ressemblent à une « voiture rouge » ou à une « personne en chemise bleue ». Mais ils peinent lorsque la question ne porte pas sur l'apparence de quelque chose, mais sur qui il est, en fonction de faits invisibles sur l'image.
Le nouveau défi : « L'Invité Mystère »
Les auteurs introduisent une nouvelle version, plus difficile, du jeu appelée Recherche Approfondie de Perception.
Imaginez une photo d'une fête bondée. La question n'est pas « Trouvez la personne en chemise rouge ». Au contraire, la question est :
« Trouvez la personne qui est devenue ambassadrice mondiale d'une marque de soins de la peau en janvier 2026, après que cette marque a été rachetée par une entreprise pour 2,7 milliards de dollars. »
Vous ne pouvez pas résoudre cela simplement en regardant la photo. L'image ne montre ni le prix de l'acquisition ni la date de l'annonce de l'ambassadeur. Pour trouver la bonne personne, l'IA doit :
- Partir à la chasse sur le Web : Explorer Internet pour déterminer quelle marque a été rachetée, en quel mois, et qui était l'ambassadeur.
- Résoudre l'énigme : Se rendre compte : « Ah, la personne sur la photo nommée 'Winter' est celle que nous cherchons. »
- Pointer le pixel : Enfin, revenir à la photo et dessiner un cadre autour de Winter.
Le papier appelle cela « Du Web aux Pixels ». Il s'agit de relier des faits internet à des emplacements spécifiques dans une image.
Les outils qu'ils ont construits
Pour tester si l'IA peut faire cela, l'équipe a construit deux éléments principaux :
1. WebEyes (Le parcours d'obstacles)
Pensez-y comme à un parcours d'obstacles spécialisé pour l'IA. Il contient 120 images complexes et des centaines de questions pièges.
- La variante : Chaque question oblige l'IA à rechercher des faits cachés (comme le rôle récent d'une célébrité, la date de lancement d'un produit ou l'histoire d'un personnage) avant même de pouvoir deviner où regarder dans l'image.
- L'objectif : L'IA ne doit pas seulement répondre à la question ; elle doit pointer la personne ou l'objet exact dans l'image qui correspond à la réponse.
2. Pixel-Searcher (Le détective intelligent)
C'est le nouvel agent IA que les auteurs ont créé pour passer le test. Au lieu de simplement fixer l'image et de deviner, Pixel-Searcher agit comme un détective avec une loupe et un ordinateur portable.
- Étape 1 : La recherche. Il décompose la question. « Qui était l'ambassadeur ? » « Quand a eu lieu l'accord ? » Il recherche sur le web et lit les résultats.
- Étape 2 : Le déduction. Il fait le lien. « D'accord, l'accord a eu lieu en janvier, et l'ambassadeur est Winter. »
- Étape 3 : La chasse. Il revient à l'image. Il cherche une personne qui ressemble à Winter (peut-être en vérifiant des vêtements ou des caractéristiques spécifiques mentionnés dans la recherche) et dessine un cadre autour d'elle.
Ce qu'ils ont découvert
Les chercheurs ont testé Pixel-Searcher contre d'autres modèles d'IA intelligents. Voici le verdict :
- Anciens modèles d'IA : Face à ces questions d'« Invité Mystère », les modèles d'IA standards étaient perdus. Ils tentaient de deviner uniquement sur la base de ce qu'ils voyaient dans l'image ou de ce qu'ils « savaient » déjà de leur entraînement. Ils choisissaient souvent la mauvaise personne car ils ne pouvaient pas trouver les faits cachés.
- Pixel-Searcher : Cet nouvel agent a obtenu les meilleurs résultats parmi les modèles open-source. En recherchant réellement sur le web et en raisonnant à travers les indices, il a réussi à trouver les bonnes cibles beaucoup plus souvent.
Où il continue de peiner :
Le papier note que l'IA n'échoue pas parce qu'elle ne peut pas dessiner un cadre parfait autour d'une personne. Elle échoue plus tôt dans le processus :
- Mauvaise recherche : Elle cherche parfois la mauvaise chose ou manque un fait clé.
- Mauvaise identité : Elle déduit les bons faits mais pointe la mauvaise personne sur la photo (par exemple, elle sait que l'ambassadeur est « Winter », mais elle pointe la mauvaise personne nommée Winter).
- Liaison : Elle a du mal à relier le « fait » (Winter) au « visuel » (la personne sur la photo).
La grande image
Le papier conclut que pour que l'IA comprenne véritablement le monde, elle ne peut pas être simplement une « caméra » qui voit des formes. Elle doit être un « chercheur » capable de consulter des informations, de résoudre des énigmes, puis d'utiliser cette connaissance pour pointer la bonne chose sur une image. Ils appellent ce nouveau domaine Recherche Approfondie de Perception, et ils ont fourni les outils (WebEyes et Pixel-Searcher) pour aider d'autres scientifiques à construire de meilleures IA « détectives ».
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.