← Derniers articles
💻 computer science

Chain Of Interaction Benchmark (COIN): When Reasoning meets Embodied Interaction

Ce papier présente COIN, un nouveau benchmark évaluant le raisonnement interactif des agents incarnés via 50 tâches réalistes, un jeu de données de téléopération et des métriques d'évaluation qui révèlent les limites actuelles des modèles face à l'écart entre la compréhension visuelle et l'exécution motrice.

Auteurs originaux : Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li

Publié 2026-04-21
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseignez à un robot comment faire la vaisselle. Un robot "intelligent" ne devrait pas seulement savoir saisir une assiette. Il devrait aussi savoir : "Oh, le tiroir est coincé, je dois d'abord le pousser doucement. Et si je ne vois pas la fourchette, je dois ouvrir le tiroir du haut pour chercher."

C'est exactement le problème que le papier COIN (Chain of Interaction) tente de résoudre. Voici une explication simple, avec des images mentales, de ce que les chercheurs ont créé.

1. Le Problème : Le Robot qui a la mémoire courte

Actuellement, les robots sont comme des chefs cuisiniers qui oublient tout.

  • Ils peuvent suivre une recette simple : "Prends la pomme, mets-la dans le bol".
  • Mais si la pomme est cachée dans un tiroir verrouillé, ils paniquent. Ils ne savent pas qu'ils doivent d'abord trouver la clé, ouvrir le tiroir, puis chercher la pomme.
  • Les benchmarks (les examens) actuels testent des tâches trop simples, comme "mets le cube sur la table". Ils ne testent pas la capacité du robot à réfléchir en agissant, à s'adapter quand quelque chose ne va pas, et à faire des liens de cause à effet.

2. La Solution : COIN, le "Grand Jeu de l'Oie" pour Robots

Les chercheurs ont créé COIN (Chain of Interaction), un nouveau terrain de jeu pour tester les robots. Imaginez-le comme un jeu de l'Oie géant où chaque case demande une petite réflexion.

Le benchmark est divisé en trois niveaux, comme un jeu vidéo :

  • Niveau 1 (COIN-Primitive) : Les mouvements de base. C'est comme apprendre à un enfant à marcher. Le robot doit juste savoir ouvrir une porte, fermer un tiroir ou saisir un objet. C'est la brique de base.
  • Niveau 2 (COIN-Composition) : Les combinaisons. Ici, on mélange les briques. "Ouvre le tiroir, puis prends la pomme, puis ferme le tiroir." C'est un peu plus complexe, comme assembler des Lego.
  • Niveau 3 (COIN-50) : La vraie vie. C'est le niveau final. Le robot doit résoudre des énigmes. Par exemple : "Trouve la pomme dans le placard." Mais le placard est fermé, la clé est sur une étagère haute, et il y a un objet qui bloque le passage. Le robot doit raisonner, échouer, changer de plan et réessayer. C'est là que la vraie intelligence se joue.

3. L'Innovation : Le "Télécommande" pas cher

Pour entraîner ces robots, il faut des humains qui leur montrent comment faire. Habituellement, cela coûte des milliers de dollars avec des robots complexes.

  • L'astuce des chercheurs : Ils ont créé un système de télécommande utilisant un simple smartphone (comme un vieux iPhone ou un Android).
  • L'analogie : Imaginez que vous mettez un casque de réalité augmentée sur votre téléphone. Vous bougez votre main, et le robot bouge exactement pareil.
  • Le coût ? Moins de 20 dollars en matériel d'occasion ! C'est comme passer d'un avion de ligne privé à un vélo pour faire des recherches. Cela permet à tout le monde de collecter des données. Ils ont ainsi enregistré 1 000 démonstrations humaines pour apprendre aux robots les gestes de base.

4. Le Verdict : Les robots sont encore des bébés

Quand les chercheurs ont testé les robots les plus avancés du monde (ceux qui utilisent l'IA générative, comme les grands modèles de langage) sur ce nouveau test COIN, le résultat a été sans appel :

  • Les humains réussissent environ 40% des tâches (et 100% dans la vraie vie).
  • Les robots réussissent moins de 3% des tâches.

Pourquoi ça rate ?
C'est comme si le robot avait un cerveau très brillant pour comprendre les mots, mais des mains très maladroites.

  • Le robot comprend la phrase "Ouvre la porte", mais il ne sait pas comment tourner la poignée si elle résiste.
  • Il ne sait pas faire le lien entre "Je ne vois pas l'objet" et "Je dois bouger ma tête pour mieux voir".
  • Il y a un fossé énorme entre ce qu'il voit (la vision) et ce qu'il fait (l'action).

En résumé

Ce papier nous dit : "Arrêtons de faire des examens de mathématiques aux robots. Donnons-leur des énigmes de la vie réelle."

Ils ont créé un nouvel examen (COIN) avec des questions difficiles, un moyen pas cher de les entraîner, et ils ont prouvé que nos robots sont encore très loin de pouvoir gérer les imprévus du quotidien. Pour qu'un robot puisse vraiment nous aider à la maison, il ne doit pas seulement être programmé, il doit apprendre à penser en boucle : Agir -> Observer -> Réfléchir -> Réagir. C'est ce que COIN aide à mesurer.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →