← Derniers articles
🤖 AI

EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

L'article présente EgoCoT-Bench, une référence fine pour les vidéos en vue subjective comportant 3 172 paires de questions-réponses vérifiables avec des annotations explicites de raisonnement étape par étape, conçue pour évaluer et améliorer les capacités de raisonnement ancré et centré sur l'opération des grands modèles de langage multimodaux.

Auteurs originaux : Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

Publié 2026-05-20
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardiez une vidéo de quelqu'un cuisinant depuis son propre point de vue (comme si vous portiez une GoPro sur votre front). Vous voyez des mains saisir un couteau, une casserole et une cuillère. Maintenant, imaginez que vous demandiez à un robot IA super-intelligent : « Où se trouve le salier après que le chef l'a posé ? »

Le robot pourrait dire : « Il est sur le comptoir. » Et il pourrait avoir raison ! Mais voici le hic : le robot a-t-il réellement vu le salier se déplacer là, ou a-t-il simplement deviné ?

C'est le problème que l'article EgoCoT-Bench tente de résoudre.

Le Problème : Le Robot du « Coup de Chance »

Actuellement, de nombreux modèles d'IA sont comme des élèves qui mémorisent la clé des réponses sans comprendre les mathématiques. Ils peuvent regarder une vidéo et donner la bonne réponse à une question, mais leur explication (leur « raisonnement ») peut être inventée, incohérente ou basée sur des éléments qui ne se sont pas réellement produits dans la vidéo.

Dans le monde des vidéos « à la première personne » (égocentriques), c'est encore plus difficile car :

  • Les mains bloquent souvent la vue.
  • Les objets disparaissent et réapparaissent.
  • La caméra tremble et bouge de manière erratique.

Les tests existants pour l'IA vérifient simplement si la réponse finale est correcte. Cet article affirme : « Ce n'est pas suffisant ! Nous devons vérifier si l'histoire racontée par l'IA sur ce qui s'est passé correspond réellement à la vidéo. »

La Solution : EgoCoT-Bench (Le Test du « Détective de la Vérité »)

Les auteurs ont créé un nouveau test ultra-détaillé appelé EgoCoT-Bench. Pensez-y comme à un « permis de conduire » pour l'IA, mais au lieu de conduire une voiture, l'IA doit comprendre une vidéo de quelqu'un effectuant des tâches avec ses mains.

Comment ils l'ont construit :

  1. La Carte (STSG) : Au lieu de simplement regarder la vidéo, ils ont d'abord construit une « carte » de la vidéo. Cette carte suit chaque objet, chaque main et chaque seconde, comme un script détaillé d'une pièce de théâtre.
  2. Les Questions : Ils ont utilisé cette carte pour créer 3 172 questions. Ce ne sont pas de simples questions du type « De quelle couleur est la tasse ? ». Ce sont des questions pièges comme : « La main a saisi la tasse bleue à 1 h 00, puis la tasse rouge à 1 h 05. Laquelle était sur la table à 1 h 03 ? »
  3. La Preuve : Chaque question est accompagnée d'un « reçu ». Le test inclut l'heure exacte, l'emplacement et la preuve visuelle nécessaire pour y répondre. Ainsi, nous pouvons vérifier si le raisonnement de l'IA correspond au reçu.

Les 4 Types de Défis

Le test est divisé en quatre catégories principales, comme des niveaux dans un jeu vidéo :

  1. Repérer l'Action (Ancrage et Perception) : « Que touche la main en ce moment ? » (L'IA peut-elle voir ce qui se passe maintenant ?)
  2. La Machine à Remonter le Temps (Rétrospection) : « Où était la cuillère avant que la main ne la saisisse ? » (L'IA peut-elle se souvenir du passé ?)
  3. La Voyante (Prédiction et Inférence Causale) : « La main tient le couvercle. Que va-t-il se passer ensuite ? » ou « Pourquoi le café s'est-il renversé ? » (L'IA peut-elle deviner le futur ou expliquer la cause ?)
  4. La Vue d'Ensemble (Raisonnement de Haut Niveau) : « Le chef a-t-il fini de faire le sandwich, ou reste-t-il une étape ? » (L'IA peut-elle comprendre l'objectif global ?)

Ce Qui S'est Passé Lors du Test de l'IA

Les auteurs ont pris les modèles d'IA les plus intelligents disponibles (comme GPT-5, Qwen et LLaVA) et les ont soumis à ce test. Voici ce qu'ils ont découvert :

  • Le Phénomène du « Coup de Chance » : De nombreux modèles ont obtenu la bonne réponse (par exemple : « La bouteille est sur l'étagère »), mais lorsqu'on leur a demandé pourquoi, leur explication était fausse. Ils pouvaient dire : « Parce que j'ai vu une bouteille », alors que la vidéo montrait en réalité que la bouteille avait été déplacée après le moment de la question.
  • L'Écart : Même les meilleurs modèles d'IA ont obtenu environ 60 à 70 % de bonnes réponses. Les humains ont obtenu près de 96 %. Cela signifie qu'il existe toujours un énorme fossé entre la compréhension humaine et la compréhension de l'IA lorsqu'il s'agit d'observer des mains manipuler des objets.
  • La Partie la Plus Difficile : L'IA était correcte pour deviner ce qui se passe ensuite, mais terrible pour suivre l'historique d'un objet (comme suivre une étiquette spécifique sur un t-shirt alors qu'on l'enlève).

La Conclusion

L'article introduit une nouvelle façon de noter l'IA. Au lieu de simplement attribuer une note basée sur la réponse finale, ils notent désormais le raisonnement également.

Ils ont découvert que de nombreuses IA sont « faussement correctes » : elles obtiennent la bonne réponse pour les mauvaises raisons. C'est dangereux car si vous demandez à une IA d'aider un robot dans une cuisine, et que l'IA devine la bonne réponse mais a une mauvaise idée de l'endroit où se trouve le couteau, le robot pourrait couper quelque chose qu'il ne devrait pas.

EgoCoT-Bench est un outil pour forcer l'IA à arrêter de deviner et à commencer à prêter attention aux preuves réelles dans la vidéo, étape par étape.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →