← Derniers articles
🤖 AI

Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning

Ce document présente Visual-Seeker, un système de recherche agentique multimodal nativement visuel qui exploite un raisonnement visuel actif et un ensemble de données synthétisées de 5 000 trajectoires de haute qualité pour atteindre des performances de pointe dans des tâches de recherche complexes en monde ouvert en récoltant dynamiquement des preuves visuelles fines.

Auteurs originaux : Zhengbo Zhang, Changtao Miao, Jinbo Su, Zhaowen Zhou, Chunxia Zhang, Xukai Wang, Ruiqi Liu, Kaiyuan Zheng, Jiansheng Cai, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

Publié 2026-06-16
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Zhengbo Zhang, Changtao Miao, Jinbo Su, Zhaowen Zhou, Chunxia Zhang, Xukai Wang, Ruiqi Liu, Kaiyuan Zheng, Jiansheng Cai, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de résoudre un mystère, mais qu'au lieu de simplement lire des indices sur une feuille de papier, vous deviez examiner une photographie chaotique et bondée pour trouver la réponse.

Le Problème : Le Détective « Aveugle »
Les détectives IA actuels (appelés Modèles de Langage Multimodaux) sont excellents pour lire du texte et regarder des images simples. Mais lorsqu'ils sont confrontés à une photo complexe du monde réel — comme un stade rempli de monde ou une affiche de film avec des détails minuscules — ils peuvent s'embrouiller. Ils savent peut-être ce qu'est un joueur de basket, mais ils ne parviennent pas facilement à identifier quel joueur spécifique porte le maillot numéro 45 dans une photo de foule floue.

De plus, lorsque ces IA cherchent des réponses sur Internet, elles traitent généralement l'image comme un « instantané » statique. Elles regardent l'image une fois, posent une question textuelle, et s'arrêtent là. Elles ne savent pas comment zoomer, recadrer un visage spécifique ou chercher activement de nouvelles images pour les comparer à l'originale. Elles sont comme un détective qui regarde une photo de scène de crime une seule fois, puis ferme les yeux et devine la réponse en se basant sur sa mémoire.

La Solution : Visual-Seeker
Les auteurs de cet article ont construit un nouvel agent IA appelé Visual-Seeker. Considérez Visual-Seeker comme un détective qui ne se contente pas de regarder la photo ; il l'enquête activement.

Au lieu de simplement fixer l'image, Visual-Seeker :

  1. Zoome : Il peut repérer des détails minuscules, comme la couleur d'une plume sur un chapeau ou le numéro sur un maillot.
  2. Chasse les preuves : Si la photo n'est pas assez claire, il sait qu'il doit aller sur Internet, chercher des « couvertures de DVD officielles » ou des « photos d'équipe », et télécharger de nouvelles images pour les comparer.
  3. Relie les points : Il combine ce qu'il voit dans les nouvelles images avec la question d'origine pour résoudre l'énigme.

Comment ils l'ont formé : Le « Simulateur d'Entraînement »
On ne peut pas simplement dire à une IA d'« être meilleure pour regarder ». Il faut lui montrer comment faire. Les chercheurs ont construit une usine d'entraînement spéciale (appelée « Pipeline de Données de Raisonnement Visuel Actif »).

Imaginez un concepteur de jeux vidéo créant un parcours d'entraînement pour une nouvelle recrue :

  • Étape 1 (La Cible) : Ils prennent une photo réelle et désordonnée et demandent à l'IA d'isoler une personne ou un objet spécifique (ex : « Trouvez l'homme au t-shirt rose »).
  • Étape 2 (La Piste) : Ils créent un faux « jeu de piste ». L'IA doit passer d'un fait à un autre, comme un détective suivant une piste de indices.
  • Étape 3 (Le Rebondissement) : Crucialement, ils forcent l'IA à réaliser que le texte ne suffit pas. Ils injectent des « preuves visuelles » dans l'entraînement. Ils font réaliser à l'IA : « Hé, tu ne peux pas répondre juste en lisant ; tu dois trouver une photo du chapeau pour voir la couleur ! »

Ils ont créé 5 000 de ces scénarios d'entraînement complexes pour apprendre à l'IA à être un chercheur actif plutôt qu'un lecteur passif.

Les Résultats : Le Nouveau Champion
Lorsqu'ils ont testé Visual-Seeker contre d'autres modèles d'IA de pointe (y compris des modèles propriétaires coûteux de grandes entreprises technologiques), il a gagné.

  • Il ne s'est pas contenté de deviner ; il est réellement allé chercher les bonnes images et a zoomé sur les détails.
  • Il a obtenu de meilleurs résultats que les experts « uniquement textuels » et a même battu certains des modèles « multimodaux » les plus puissants actuellement disponibles.
  • Il a prouvé que si l'on donne à une IA les outils pour regarder et chercher activement des indices visuels, elle devient bien plus intelligente pour résoudre des énigmes du monde réel.

En Bref
Les IA précédentes étaient comme des étudiants qui mémorisaient un manuel mais ne savaient pas l'appliquer lors d'un examen complexe du monde réel. Visual-Seeker est l'étudiant qui apporte une loupe, une carte et un appareil photo à l'examen, rassemblant activement des preuves pour résoudre le problème étape par étape. L'article démontre que cette approche de « regard actif » est la clé pour rendre l'IA véritablement intelligente dans un monde visuel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →