← Derniers articles
💻 computer science

ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions

Cet article présente le défi ERR@HRI 3.0, qui a introduit deux jeux de données vidéo naturalistes et issus du crowdsourcing afin de faire progresser l'apprentissage automatique multimodal de bout en bout pour la détection des réactions des spectateurs face aux erreurs des robots et l'anticipation des défaillances potentielles, démontrant que les modèles soumis ont surpassé les systèmes de référence.

Auteurs originaux : Maria Teresa Parreira, Micol Spitale, Maia Stiber, Shiye Cao, Amama Mahmood, Chien-Ming Huang, Hatice Gunes, Wendy Ju

Publié 2026-07-14
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Maria Teresa Parreira, Micol Spitale, Maia Stiber, Shiye Cao, Amama Mahmood, Chien-Ming Huang, Hatice Gunes, Wendy Ju

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardez un robot essayer de faire un sandwich. Parfois, le robot fait tomber le pain. Parfois, il essaie de mettre le grille-pain dans le réfrigérateur. Dans le passé, les scientifiques ont essayé d'apprendre aux robots à remarquer ces erreurs en leur donnant une liste de « caractéristiques » (comme « est-ce que le pain est par terre ? ») et en leur demandant d'examiner des données qui avaient déjà été nettoyées et organisées. Mais les auteurs de cet article disent : « Attendez une minute ! C'est comme essayer d'apprendre à faire du vélo en regardant un diagramme de vélo dans un studio parfaitement éclairé. La vraie vie est désordonnée ! »

Cet article présente l'ERR@HRI 3.0, un défi conçu pour aider les robots à devenir meilleurs pour repérer leurs propres bévues — et même à les deviner avant qu'elles ne se produisent — en observant les réactions humaines réelles et désordonnées.

Les deux grandes missions

Le défi a proposé aux chercheurs deux « niveaux de jeu vidéo » différents à résoudre, en utilisant des séquences vidéo brutes de webcams de personnes regardant des robots (et des humains) échouer.

Niveau 1 : Le détecteur d'« Oups ! » (Le jeu de données BAD)
Imaginez 45 personnes assises devant un écran, regardant des vidéos où un robot ou un humain commet une erreur. L'objectif ici est réactif : un ordinateur peut-il regarder le visage de la personne après l'erreur et dire : « Oh, ils viennent de voir un échec ! » ?

  • Le piège : Les vidéos sont brutes. L'éclairage change, les angles de caméra sont bancals et les gens sont assis à des endroits différents. C'est le monde réel, pas un laboratoire.
  • Les données : Il y avait 46 scénarios d'échec différents et 1 645 clips vidéo au total. Les clips durent environ 15,5 secondes.
  • Le résultat : Le défi a vu 3 équipes soumettre des modèles. Toutes ont fait mieux que le propre modèle « baseline » de l'article (qui était essentiellement un réseau neuronal standard faisant de son mieux). Le modèle de référence a obtenu un macro F1 de 0,502 (un score spécifique pour mesurer sa capacité à équilibrer la détection des échecs et des non-échecs, plutôt qu'un simple pourcentage de précision), mais les nouveaux modèles ont réussi à le battre.

Niveau 2 : Le prédicteur de « Mauvaise idée ! » (Le jeu de données Bad Idea)
C'est la partie la plus cool et la plus sournoise. Imaginez 29 personnes regardant une vidéo d'un robot commençant à faire quelque chose, mais la vidéo s'arrête avant que nous voyions s'il réussit ou échoue. Les gens doivent deviner : « Est-ce que cela va bien se terminer ou mal se terminer ? »

  • L'objectif : Un ordinateur peut-il regarder le visage de la personne pendant qu'elle devine et dire ce qu'elle pense qu'il va se passer ? C'est de l'anticipation. Il s'agit de capter le regard de type « oh non » avant le crash.
  • Les données : Il y avait 30 scénarios et 865 clips. Ces clips sont très courts, environ 1,95 seconde.
  • Le résultat : Encore une fois, les 3 équipes qui ont joué à ce niveau ont battu la baseline. Le modèle de référence avait un score AUC-ROC de 0,564 (une mesure de sa capacité à distinguer une bonne prédiction d'une mauvaise, où 0,5 correspond à un choix aléatoire), montant que prédire l'avenir basé sur une expression faciale d'une fraction de seconde est vraiment, vraiment difficile.

Ce à quoi cet article dit « Non »

Les auteurs sont très clairs sur ce qui ne fonctionne pas bien pour ce problème, et ils ont explicitement écarté les anciennes méthodes de travail :

  1. Pas de « données pré-nettoyées » : L'article note que la plupart des travaux antérieurs reposaient sur des caractéristiques extraites au préalable, ce qui limitait les types de méthodes utilisables par les chercheurs. Pour corriger cela, le défi a publié des vidéos brutes. Ce choix de conception n'était pas destiné à interdire l'ingénierie de caractéristiques, mais à permettre aux chercheurs d'appliquer des méthodes modernes d'apprentissage de bout en bout directement sur les pixels et de voir s'ils pouvaient mieux gérer le désordre de la vie réelle que les anciennes approches.
  2. Pas de « réglages de laboratoire parfaits » : Ils ont rejeté l'idée que les robots ne devraient apprendre que dans des pièces contrôlées avec un éclairage parfait. Ils voulaient le désordre des données issues du crowdsourcing (caméras différentes, angles étranges) car c'est ce à quoi les robots seront réellement confrontés dans le monde réel.
  3. Pas de « simple réaction » : Ils ont soutenu qu'attendre qu'une erreur se produise pour ensuite la corriger est trop tard. Ils ont poussé pour l'anticipation — comprendre qu'un problème survient avant qu'il ne se produise pleinement.

À quel point en sont-ils sûrs ?

L'article ne prétend pas avoir résolu le problème de la sécurité des robots pour toujours. Au lieu de cela, ils suggèrent que leurs nouveaux jeux de données et méthodes sont un meilleur point de départ.

  • Ils ont mesuré les résultats en utilisant des scores mathématiques spécifiques (comme le macro F1 et l'AUC-ROC) sur un ensemble de test que les équipes n'avaient jamais vu auparavant.
  • Ils ont constaté que, bien que les nouveaux modèles soient meilleurs que les anciennes baselines, la tâche d'anticipation (Niveau 2) reste délicate. La baseline a mis 35,6 % du temps du clip pour commencer à détecter le signal, contre 8,8 % pour la tâche réactive. Cela suggère que lire un visage de type « mauvaise idée » est beaucoup plus difficile que de lire un visage de type « oops ».
  • Les auteurs déclarent que trois équipes ont soumis des modèles valides, et que toutes ont surpassé les baselines. Ils ne disent pas que les modèles sont parfaits, mais qu'ils constituent une étape supplémentaire.

La conclusion

Considérez cet article comme les organisateurs d'une foire scientifique qui auraient dit : « Arrêtez de construire des robots qui ne fonctionnent que dans une boîte en verre. Voyons s'ils peuvent gérer le chaos d'un vrai salon. » Ils ont fourni deux nouveaux ensembles de vidéos réelles et désordonnées et ont mis au défi les codeurs les plus brillants de construire des modèles capables de repérer l'erreur d'un robot ou de deviner un désastre avant qu'il ne se produise. Les résultats montrent que, bien qu'il soit possible de faire mieux que les anciennes méthodes, la capacité de « boule de cristal » pour prédire les erreurs est encore un travail en cours. Les auteurs espèrent que ces outils aideront à construire des robots plus conscients, plus dignes de confiance et prêts pour la réalité désordonnée de la vie humaine.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →