← Derniers articles
💬 NLP

VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch

Cet article introduit VistaHop, un nouveau benchmark et environnement d'évaluation conçu pour évaluer les capacités des grands modèles de raisonnement multimodaux à effectuer un raisonnement visuel complexe à plusieurs étapes (multi-hop) et une inspection d'image itérative pour le Visual DeepSearch, révélant que les modèles de pointe actuels éprouvent encore des difficultés significatives face à ces tâches.

Auteurs originaux : Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

Publié 2026-06-03
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous engagiez un détective pour résoudre un mystère. Par le passé, la plupart des « tests de détection » pour l'IA ressemblaient à de simples devinettes : vous montriez une seule photo à l'IA et demandiez : « De quelle couleur est la voiture ? ». L'IA regardait simplement une fois, devinait la couleur, et passait à autre chose.

Mais l'enquête en conditions réelles est beaucoup plus difficile. Parfois, pour résoudre une affaire, il faut zoomer sur un minuscule logo sur une chaussure, chercher l'histoire de cette marque, trouver où se trouve son usine, vérifier la météo là-bas, puis relier tous ces points pour découvrir qui était sur les lieux.

Ce document, VistaHop, vise à construire un test bien plus exigeant pour voir si les détectives IA sont réellement capables de ce genre de travail profond et multi-étapes.

Le Problème : Le Piège du « Regard Unique »

Les auteurs soutiennent que les tests d'IA actuels sont trop faciles. Ils reviennent à donner une photo à un détective et lui demander : « Y a-t-il un chien sur cette image ? ». L'IA jette un coup d'œil et répond simplement « Oui ».

La véritable « Recherche Visuelle Profonde » (Visual DeepSearch) est différente. Elle exige que l'IA :

  1. Regarde de près : Zoomer sur des parties spécifiques d'une image (comme un minuscule texte sur un panneau).
  2. Fasse des va-et-vient : Réaliser qu'elle a manqué un indice, zoomer à nouveau et regarder une autre partie de l'image.
  3. Relie les points : Combiner ce qu'elle voit dans la photo avec des connaissances extérieures (comme la consultation d'une base de données) à travers de nombreuses étapes.

Les auteurs affirment que les tests existants échouent car ils permettent à l'IA de tricher en utilisant des indices textuels ou en se contentant de deviner sans vraiment « voir » les détails.

La Solution : VistaHop (Le « Parcours du Combattant »)

Pour corriger cela, l'équipe a créé VistaHop, un nouveau benchmark (un ensemble de tests) conçu comme un parcours d'obstacles complexe.

  • La Configuration : Ils ont rassemblé 300 photos de haute qualité (comme une rue animée ou un musée).
  • La Tâche : Ils ont créé 350 questions qui forcent l'IA à entreprendre un long voyage.
    • Exemple : « Regardez le conteneur maritime orange en bas à droite. Trouvez le logo de l'entreprise. Trouvez quand cette entreprise a été fondée. Maintenant, trouvez la ville où se trouve leur siège social. En quelle année cette ville a-t-elle été fondée ? Soustrayez les deux années. »
  • Les Règles : L'IA ne peut pas simplement deviner. Elle doit prouver qu'elle a regardé la partie spécifique de l'image, trouvé le logo et suivi la chaîne d'indices. Si elle tente de répondre en utilisant uniquement le texte de la question (sans regarder l'image), le test la détecte et rejette la réponse.

Ils ont également construit VistaArena, une « salle de sport » où ils peuvent observer l'IA s'entraîner. Cela permet à l'IA d'utiliser des outils comme une loupe (pour recadrer/zoomer sur les images), un moteur de recherche (pour trouver des faits) et une calculatrice.

Les Résultats : L'IA est encore une Recrue

Les auteurs ont soumis les modèles d'IA les plus intelligents disponibles (comme SenseNova, GPT-5 et Gemini) à ce parcours d'obstacles.

Le verdict ? L'IA a énormément lutté.

  • Même le meilleur modèle n'a obtenu environ 24 % de bonnes réponses du premier coup.
  • Lorsque l'IA était forcée de simplement regarder l'image sans utiliser d'outils de recherche, elle obtenait moins de 8 % de bonnes réponses.
  • L'IA s'est améliorée lorsqu'on l'autorisait à utiliser des outils (zoom et recherche), mais elle échouait encore souvent lorsque la « chaîne d'indices » devenait trop longue ou nécessitait de regarder plusieurs endroits différents de la photo.

Ce qu'il faut retenir

L'article conclut que, bien que l'IA devienne douée pour « voir » des images, elle est encore très mauvaise pour être un enquêteur persévérant. Elle a tendance à abandonner trop vite, à manquer de petits détails ou à oublier de revenir vérifier l'image.

Les auteurs ont construit VistaHop non pas pour vendre un produit, mais pour montrer au monde qu'il nous faut de meilleurs tests et de meilleures méthodes d'entraînement si nous voulons que l'IA comprenne réellement les mystères visuels complexes. Ils ont rendu leurs données et leur code publics afin que d'autres chercheurs puissent tenter de construire de meilleurs « détectives ».

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →