← Derniers articles
💻 computer science

Can People Distinguish Human and AI Agency in Humanoid Teleoperation? A Preliminary Study of Agency Perception

Cette étude préliminaire introduit le cadre « Ghost-in-the-Loop » pour démontrer que les participants peinent souvent à distinguer l'agence humaine de l'IA dans la téléopération humanoïde, leurs jugements étant principalement dictés par la perception de la naturalité et de la cohérence multimodale plutôt que par la source réelle du contrôle.

Auteurs originaux : Xiang Li, Koya Dendo, Keigo Minamida, Yuto Nakamura, Per Ola Kristensson, Jun Rekimoto

Publié 2026-09-09
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xiang Li, Koya Dendo, Keigo Minamida, Yuto Nakamura, Per Ola Kristensson, Jun Rekimoto

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un futur où un robot debout dans votre salon n'est pas seulement une machine suivant un script, mais un partenaire de conversation, capable de sourire, de gesticuler et de répondre avec la fluidité d'un être humain. Cette vision repose sur la téléopération, une méthode où une personne se tient à distance et contrôle les mouvements et la voix du robot en temps réel, utilisant ainsi la machine comme un corps distant. Pendant des années, cela a nécessité la présence constante d'un opérateur humain, limitant le nombre de personnes qu'une seule personne pouvait aider ou la durée d'une conversation. Cependant, l'essor rapide de l'intelligence artificielle a introduit une nouvelle possibilité : des systèmes capables de générer de la parole, des expressions faciales et des gestes de manière autonome, imitant si étroitement l'humain que la différence devient difficile à percevoir. Cela crée une question fascinante et légèrement troublante pour quiconque interagit avec ces machines : si un robot joue un rôle, pouvez-vous savoir si une personne réelle tire les ficelles, ou si un algorithme fait le travail ?

Des chercheurs des Sony Computer Science Laboratories et de l'Université de Tokyo ont entrepris de répondre à cette question en construisant un système qu'ils appellent « Ghost-in-the-Loop ». Ce cadre permet à un robot humanoïde de basculer de manière fluide entre un contrôle par un opérateur humain et un pilotage entièrement par intelligence artificielle, tout en conservant exactement la même apparence et le même son. Le robot, un modèle Unitree G1 équipé d'un écran pour le visage et de caméras pour observer son environnement, sert de scène. Lorsqu'un humain est aux commandes, il porte un casque pour voir ce que le robot voit et utilise des capteurs de mouvement pour guider les mains et le visage du robot. Lorsque le système passe en mode IA, le robot écoute la conversation et utilise des modèles génératifs pour créer sa propre voix, ses mouvements faciaux et ses gestes de la main, en s'alignant sur le même style visuel et auditif que la version contrôlée par l'humain. L'objectif n'était pas de déterminer lequel était le meilleur, mais de voir si un observateur humain pouvait même faire la distinction.

Pour tester cela, l'équipe a créé une série de courtes séquences vidéo montrant le robot en pleine conversation. Ils ont enregistré huit interactions différentes, allant de discussions informelles à des échanges orientés vers des tâches, chacune durant entre cinq et quarante secondes. Dans la moitié de ces clips, un téléopérateur humain contrôlait le robot. Dans l'autre moitié, le système d'IA générait le comportement. Crucialement, la voix, le visage et le corps du robot restaient cohérents dans tous les clips, de sorte que la seule variable était la source du contrôle. Les chercheurs ont ensuite invité cinquante personnes à regarder ces vidéos en ligne. Après chaque clip, les participants devaient décider si le robot était piloté par un humain ou par un ordinateur, en évaluant leur certitude sur une échelle allant de moins dix pour une certitude d'IA à plus dix pour une certitude d'humain. On leur demandait également d'expliquer pourquoi ils pensaient cela.

Les résultats suggèrent que, dans ces brefs instants, la frontière entre l'humain et la machine est remarquablement floue. Les participants ont eu beaucoup de mal à distinguer les deux sources de contrôle. En moyenne, leurs évaluations variaient à peine entre les clips contrôlés par l'humain et ceux contrôlés par l'IA, la différence étant si infime qu'elle était statistiquement indiscernable d'un choix aléatoire. L'étude indique que pour des interactions courtes, les gens ne peuvent tout simplement pas dire de manière fiable si un robot est piloté par une personne ou par un algorithme. Lorsque les chercheurs ont examiné ce que les participants pensaient réellement, un schéma clair est apparu dans leurs explications. Ceux qui estimaient pouvoir porter un jugement se sont fortement appuyés sur le caractère naturel global du comportement du robot. Ils ont prêté une attention particulière au rythme de la conversation, au rythme des mouvements, et au fait que la voix, l'expression faciale et les gestes de la main semblaient tous fonctionner en harmonie.

Lorsque les mouvements du robot semblaient rigides, que le rythme était décalé ou que les différentes parties de son corps semblaient désynchronisées avec sa voix, les participants étaient plus enclins à deviner qu'il s'agissait d'une IA. À l'inverse, quand le robot se déplaçait avec un flux cohérent, où les gestes et les expressions s'accordaient parfaitement avec la parole, les gens étaient plus enclins à croire qu'un humain était derrière les commandes. Cela ne signifie pas que l'IA était parfaite, mais plutôt que les défauts de performance de l'IA étaient assez subtils pour passer inaperçus lors d'un coup d'œil rapide. L'étude suggère que notre capacité à détecter l'agentivité dépend moins de la technologie spécifique utilisée que de la cohérence de la performance. Si le robot agit comme un tout unifié, le cerveau l'accepte comme un agent unique, qu'il s'agisse de chair ou de code.

Ce travail préliminaire ouvre un nouveau chapitre dans la manière dont nous pourrions concevoir les robots du futur. Cela implique qu'à court terme, nous n'aurons peut-être pas à nous soucier de voir les utilisateurs constamment se demander si un robot est réel ou faux lors d'échanges courts. Au lieu de cela, l'attention peut se porter sur la manière dont ces systèmes peuvent fusionner l'intelligence humaine et artificielle, en laissant peut-être un humain prendre le relais lorsque la conversation devient complexe, tandis que l'IA gère les parties routinières. Les chercheurs notent que leurs conclusions sont spécifiques à ces clips courts et structurés, et que des interactions plus longues et plus complexes pourraient révéler des schémas différents. Pour l'instant, l'étude confirme que lorsqu'un robot parle, sourit et bouge avec suffisamment de cohérence, l'esprit humain accepte volontiers de le considérer comme un partenaire, laissant la véritable nature de son agentivité comme un mystère silencieux.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →