← Derniers articles
💬 NLP

Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks

Cet article présente Agent-X, une référence à grande échelle comprenant 828 tâches multimodales du monde réel réparties dans six environnements diversifiés, ainsi qu'un cadre d'évaluation fine au niveau des étapes pour évaluer le raisonnement approfondi des agents centrés sur la vision, révélant que les modèles de pointe actuels peinent à atteindre le succès de la chaîne complète dans des scénarios complexes et multi-étapes.

Auteurs originaux : Tajamul Ashraf, Amal Saqib, Hanan Ghani, Muhra AlMahri, Yuhao Li, Noor Ahsan, Umair Nawaz, Jean Lahoud, Hisham Cholakkal, Mubarak Shah, Philip Torr, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman Khan

Publié 2026-05-26
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Tajamul Ashraf, Amal Saqib, Hanan Ghani, Muhra AlMahri, Yuhao Li, Noor Ahsan, Umair Nawaz, Jean Lahoud, Hisham Cholakkal, Mubarak Shah, Philip Torr, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman Khan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez construit un assistant robotique ultra-intelligent. Vous lui donnez une caméra, un cerveau et une boîte à outils remplie d'outils (comme une loupe, une calculatrice ou un navigateur web). Vous lui demandez de résoudre une énigme complexe, telle que « Trouvez le vol le moins cher pour Paris, vérifiez la météo sur place et dites-moi si j'ai besoin d'un parapluie ».

Pendant longtemps, nous avons testé ces robots avec des énigmes simples et factices qui ressemblaient à des niveaux de jeu vidéo. Mais le monde réel est désordonné, implique des vidéos et exige que le robot réfléchisse en plusieurs étapes, pas seulement en une seule.

Voici Agent-X. Considérez ce document comme la création d'un nouveau « parcours d'obstacles » extrêmement difficile, conçu spécifiquement pour évaluer dans quelle mesure ces assistants robotiques peuvent réfléchir en profondeur et utiliser leurs outils dans le monde réel.

Voici le détail de ce qu'ils ont fait, en utilisant quelques analogies du quotidien :

1. Le Problème : Le « Jeu Vidéo » vs Le « Monde Réel »

Les tests précédents ressemblaient à donner à un robot un niveau de jeu vidéo où les règles sont écrites sur le mur : « Utilisez la clé rouge pour ouvrir la porte bleue ». Le robot suit simplement l'instruction.

Mais dans la vie réelle, personne ne vous dit quel outil utiliser. Vous dites simplement : « Réparez le robinet qui fuit ». Le robot doit déterminer : Ai-je besoin d'une clé à molette ? Dois-je chercher un tutoriel vidéo ? Dois-je appeler un plombier ?

Les auteurs affirment que les robots actuels ressemblent à des élèves excellents pour mémoriser les réponses à un test spécifique, mais qui se figent lorsqu'on leur demande de résoudre un problème qu'ils n'ont jamais rencontré. Ils peinent à enchaîner plusieurs étapes de réflexion.

2. La Solution : Le « Parcours d'Obstacles » Agent-X

L'équipe a créé Agent-X, une vaste collection de 828 défis du monde réel.

  • Les Scénarios : Au lieu d'images factices, ils ont utilisé de vraies photos, vidéos et captures d'écran provenant de six différents « quartiers » de la vie :
    • Conduite : Regarder une vidéo d'une voiture et déterminer si un piéton s'apprête à traverser.
    • Surveillance : Examiner des images de vidéosurveillance pour repérer une personne suspecte.
    • Sports : Analyser une vidéo de match pour compter les joueurs ou prédire le vainqueur.
    • Navigation Web : Naviguer sur un site web pour trouver des informations spécifiques sans qu'on vous dise exactement quels boutons cliquer.
    • Mathématiques et Logique Générale : Résoudre des équations trouvées dans des images ou comparer plusieurs images.
  • La Surprise : Les robots ne reçoivent pas une liste de contrôle. Ils doivent regarder l'image, réaliser ce qui manque, choisir le bon outil dans leur boîte à outils, l'utiliser, examiner le résultat, puis décider de la suite.

3. Le « Juge » : Comment ils notent les robots

C'est la partie la plus importante. Habituellement, nous vérifions simplement si le robot a trouvé la bonne réponse finale (comme un enseignant corrigeant un test de mathématiques).

Agent-X introduit un juge étape par étape. Imaginez un enseignant qui ne regarde pas seulement la réponse finale, mais qui observe le brouillon de l'élève.

  • Ont-ils choisi le bon outil ? (Par exemple : Ont-ils utilisé une calculatrice au lieu d'une loupe ?)
  • Ont-ils utilisé l'outil correctement ? (Par exemple : Ont-ils saisi les chiffres dans le bon ordre ?)
  • Leur logique est-elle cohérente ? (Par exemple : Ont-ils tiré une conclusion sans examiner les preuves ?)

Si un robot devine la bonne réponse mais y arrive en hallucinant (en inventant des choses) ou en sautant des étapes, Agent-X lui attribue une note d'échec. C'est comme un chef qui prépare un gâteau délicieux mais avec les mauvais ingrédients ; le gâteau a bon goût, mais le processus était défectueux.

4. Les Résultats : Les Robots Apprennent Encore

Les auteurs ont testé 12 des modèles d'IA les plus intelligents disponibles (y compris des noms connus comme GPT-4, Gemini et Qwen).

Le Verdict : Même les robots les plus « intelligents » peinent.

  • Le Score : Les meilleurs modèles ont obtenu moins de 50 % des tâches entièrement correctes du début à la fin.
  • Le Goulot d'étranglement : Les robots sont bons pour voir l'image et parler d'elle, mais ils sont terribles pour planifier. Ils ont souvent tendance à :
    • Oublier d'utiliser un outil dont ils ont besoin.
    • Utiliser un outil qu'ils n'ont pas (halluciner un outil qui n'existe pas).
    • Se perdre lorsqu'ils doivent regarder une vidéo et suivre ce qui se passe au fil du temps.
    • Se tromper dans la mise en forme de leurs réponses (comme écrire une lettre au lieu de remplir un formulaire).

5. La Conclusion

L'article conclut que, bien que ces agents d'IA soient impressionnants, ils ne sont pas encore prêts à être des travailleurs entièrement autonomes. Ils ressemblent à un stagiaire brillant qui connaît beaucoup de faits, mais qui a besoin d'une supervision constante pour comprendre comment faire le travail.

Les auteurs ont créé Agent-X comme un « test de résistance » qui nous montre exactement où ces robots échouent, afin que les chercheurs puissent réparer les parties spécifiques de leurs « cerveaux » qui gèrent la planification et l'utilisation d'outils. Ils ne demandent pas seulement : « Pouvez-vous répondre à cela ? » Ils demandent : « Pouvez-vous réfléchir votre chemin à travers cela ? » et jusqu'à présent, la réponse est « Pas encore tout à fait ».

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →