InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
Ce document présente InterLV-Search, un cadre de référence et d'évaluation complet pour la recherche agentic multimodale entrelacée, qui met en évidence des limitations significatives actuelles dans la capacité des systèmes à intégrer dynamiquement des preuves textuelles et visuelles à travers des scénarios de recherche active, de recherche hors ligne contrôlée et de recherche sur le web ouvert.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez de résoudre une énigme complexe, comme retrouver une personne spécifique à partir d'une série d'indices.
L'Ancienne Méthode (Anciens Référentiels) :
La plupart des « détectives » IA actuels sont entraînés ainsi : vous leur donnez une photo d'un suspect et vous demandez : « Qui est-ce ? » ou « De quelle couleur est son chapeau ? » L'IA examine la photo et répond. Si la photo ne suffit pas, l'IA peut chercher sur Internet des textes concernant la personne, mais elle traite la photo simplement comme le point de départ ou la réponse finale. Elle utilise rarement une photo qu'elle trouve au milieu de son enquête pour changer de direction. C'est comme un détective qui regarde une photo de la scène de crime, puis se contente de lire un article de journal, sans jamais réaliser qu'une nouvelle photo trouvée à la page 3 du journal l'oriente en fait vers une ville complètement différente.
La Nouvelle Méthode (InterLV-Search) :
Les auteurs de cet article, « InterLV-Search », ont construit un nouveau terrain d'entraînement (un référentiel) pour tester si l'IA peut accomplir quelque chose de beaucoup plus difficile : La Recherche Agentique Multimodale Entrelacée.
Pensez-y comme à un détective qui doit constamment alterner entre la consultation de cartes (texte) et l'examen de photos (images) pour résoudre l'affaire.
- La Surprise : L'IA trouve une photo, l'examine et réalise : « Oh ! Le logo sur ce bâtiment dans la photo m'indique que je dois chercher un nom de marque spécifique. » Elle recherche alors cette marque, trouve une nouvelle photo d'une voiture, voit une plaque d'immatriculation, et cette plaque lui indique de chercher une ville spécifique.
- L'Objectif : La photo n'est pas seulement la réponse ; la photo est un volant. Elle indique à l'IA où conduire ensuite.
Les Trois Niveaux de Difficulté
L'article teste l'IA sur trois niveaux, comme un jeu vidéo dont la difficulté augmente :
Niveau 1 : Le Défi « Trouver l'Image ».
- La Tâche : On donne à l'IA une description textuelle comme : « Trouvez le jeu qui met en scène ce bateau pirate. » Elle doit déterminer ce qu'est le bateau, le chercher, trouver l'image, puis répondre à une question sur l'image (par exemple : « Quel moteur utilise le bateau ? »).
- La Métaphore : On vous donne une énigme sur un objet caché. Vous devez trouver l'objet avant de pouvoir répondre à l'énigme.
Niveau 2 : Le Défi « Labyrinthe Contrôlé ».
- La Tâche : L'IA se trouve dans une pièce fermée (une base de données hors ligne contrôlée) avec une carte. Elle commence avec un indice textuel, trouve une image, l'image donne un nouvel indice, elle trouve une autre image, et ainsi de suite.
- La Métaphore : Imaginez une chasse au trésor où trouver une photo d'une porte rouge vous mène à un indice textuel sur une voiture bleue, qui vous mène à une photo d'un oiseau jaune. L'IA doit utiliser la photo de la porte pour décider de chercher la voiture. Si elle ignore la photo et continue simplement de lire du texte, elle se perd.
Niveau 3 : Le Défi « Internet Sauvage ».
- La Tâche : Maintenant, l'IA est sur le véritable Internet, chaotique. Elle doit chercher des indices, trouver des photos, réaliser que certaines photos sont fausses ou sans rapport, comparer différents chemins (par exemple : « Ce film dure-t-il 60 minutes ou 90 minutes ? »), et choisir le bon chemin pour continuer.
- La Métaphore : C'est comme un détective essayant de résoudre une affaire en utilisant tout Internet. Il doit trier des millions de sites web, certains avec de mauvaises photos, d'autres avec de mauvaises dates, et décider quel chemin suivre en fonction de ce qu'il voit dans les images.
Que Ont-ils Découvert ?
Les auteurs ont testé de nombreux modèles d'IA les plus intelligents (comme GPT-5, Gemini et Claude) sur ce nouveau test.
- Le Résultat : Les modèles d'IA sont actuellement très mauvais dans cette tâche. Même les meilleurs obtiennent moins de 50 % de bonnes réponses.
- Le Problème : Les modèles d'IA sont excellents pour lire du texte et excellents pour examiner une seule image. Mais ils peinent à relier les points lorsqu'une photo trouvée au milieu d'une recherche doit modifier l'ensemble du plan de recherche. Ils restent souvent bloqués à chercher du texte alors qu'ils devraient regarder une photo, ou ils traitent la photo simplement comme un « contrôle final » plutôt que comme un « nouvel indice ».
La Boîte à Outils (InterLV-Agent)
Pour s'assurer que tout le monde jouait selon les mêmes règles, les auteurs ont construit un « contrôleur de jeu » standard appelé InterLV-Agent. Cet outil permet à l'IA d'utiliser un navigateur web, de rechercher des images, de recadrer des images et de tenir un « carnet de notes » (mémoire) de ce qu'elle a trouvé jusqu'à présent. Cela garantit que lorsque nous disons qu'une IA a échoué, c'est parce qu'elle n'a pas pu résoudre l'énigme, et non parce qu'elle n'avait pas les bons outils.
Résumé
En termes simples, cet article dit : « Nous avons créé un nouveau test plus difficile pour les détectives IA. Nous avons constaté que, bien que l'IA devienne plus intelligente, elle ne peut toujours pas utiliser efficacement les images qu'elle trouve pendant une recherche pour changer d'avis et trouver le prochain indice. C'est comme un détective qui peut lire une carte et regarder une photo, mais qui ne parvient pas à comprendre que la photo lui indique en fait de prendre une route différente. »
Les auteurs ont publié ce test et les outils afin que d'autres chercheurs puissent essayer de construire une IA meilleure dans ce style de pensée « entrelacée ».
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.