← Derniers articles
💻 computer science

Human-robot conversation with multiple participants in noisy public spaces

Cet article présente un système audio de réseau de microphones multicanaux conçu pour les espaces publics bruyants qui améliore la parole tant pour l'écoute attentive de l'androïde ERICA que pour les interactions d'avatars distants via les robots Teleco, tout en fournissant également un audio spatial pour améliorer l'immersion dans les conversations multipartites.

Auteurs originaux : Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes, Kazushi Kato, Shota Fujiki, Zihao Chi, Masaya Iwasaki, Taiken Shintani, Megumi Kawata, Kazuki Sakai, Koji Inoue, Yuicihiro Yoshikawa, Tatsuya
Publié 2026-09-02
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes, Kazushi Kato, Shota Fujiki, Zihao Chi, Masaya Iwasaki, Taiken Shintani, Megumi Kawata, Kazuki Sakai, Koji Inoue, Yuicihiro Yoshikawa, Tatsuya Kawahara

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez essayer d'avoir une conversation sérieuse au milieu d'une gare bondée, où le rugissement des moteurs, le bavardage des foules et l'écho de l'architecture se disputent votre attention. Les humains parviennent à accomplir cet exploit sans effort, une compétence que les scientifiques appellent « l'effet cocktail party », où notre cerveau filtre le vacarme ambiant pour se concentre sur une seule voix. Pour un robot, cependant, c'est un défi redoutable. Si l'intelligence artificielle est devenue remarquablement douée pour tenir des conversations textuelles, donner à un robot la capacité d'écouter et de parler naturellement dans un espace public bruyant et bondé reste un obstacle majeur. Cela est particulièrement vrai lorsque plusieurs personnes parlent en même temps, ou lorsque le robot lui-même se déplace dans l'environnement. Sans un moyen d'isoler la parole humaine du chaos, la capacité d'un robot à comprendre et à répondre s'effondre, le laissant sourd aux personnes mêmes qu'il est censé servir.

Des chercheurs de plusieurs universités du Japon et de Singapour ont entrepris de résoudre ce problème en construisant un système qui permet aux robots d'entendre clairement dans le monde réel. Ils ont testé leur travail lors de l'Exposition mondiale de 2025 à Osaka, un cadre choisi spécifiquement parce qu'il est bruyant, imprévisible et rempli de milliers de visiteurs. L'équipe a développé un système audio spécialisé capable de capturer les voix de plusieurs personnes simultanément, même lorsqu'elles se coupent la parole, et de nettoyer le son afin que le robot et un opérateur humain distant puissent les comprendre. Le résultat fut une démonstration où des robots ont réussi à tenir des conversations avec des groupes de personnes dans un pavillon bruyant, prouvant que les machines peuvent apprendre à écouter avec la même concentration qu'un humain dans une pièce bondée.

Le cœur de cette réussite réside dans la manière dont les robots sont équipés pour entendre. Au lieu de s'appuyer sur un seul microphone, qui capterait tous les bruits de la pièce de manière égale, les chercheurs ont utilisé un réseau circulaire de quatre microphones. Ce dispositif agit comme un ensemble d'oreilles qui peuvent être orientées électroniquement pour se concentrer sur des directions spécifiques. Lorsqu'une personne parle, le système identifie son emplacement et amplifie sa voix tout en supprimant le bruit de fond provenant des autres directions. Ce processus crée un signal audio propre qui peut être utilisé à deux fins distinctes : il permet à l'ordinateur interne du robot de reconnaître les mots prononcés, et il envoie une version claire et de haute qualité de la conversation à un opérateur humain qui pourrait contrôler le robot depuis un endroit éloigné.

L'équipe a démontré cette technologie dans deux scénarios différents, chacun présentant ses propres défis uniques. Dans la première configuration, un robot androïde nommé ERICA était assis avec deux participants humains. L'objectif était de montrer que le robot pouvait agir comme un auditeur attentif, suivant la conversation et répondant par des hochements de tête ou de brèves incises verbales. Comme les humains étaient assis en position fixe, le réseau de microphones pouvait être placé sur un trépied entre eux, créant un environnement d'écoute stable. Le système a réussi à séparer les voix des deux personnes, permettant à ERICA de comprendre qui parlait et de générer des réponses appropriées, comme poser des questions de suivi basées sur ce qui venait d'être dit. Ce scénario a prouvé que la technologie pouvait gérer les complexités d'une conversation de groupe où les gens pourraient s'interrompre ou parler en même temps.

Le second scénario était beaucoup plus difficile car il impliquait du mouvement. Ici, les chercheurs ont utilisé de petits robots mobiles appelés Telecos. L'un de ces robots était contrôlé par un opérateur humain assis dans une pièce séparée, agissant comme un avatar virtuel, tandis que l'autre robot se déplaçait de son côté pour soutenir la conversation. Dans ce cas, le réseau de microphones était monté sur la tête du robot contrôlé par l'humain. À mesure que le robot tournait la tête ou se déplaçait sur le sol, la direction de ses « oreilles » changeait constamment. Les chercheurs ont dû programmer le système pour qu'il suive continuellement la position du participant humain et de l'autre robot, en changeant instantanément la focalisation du microphone vers la direction d'où provenait la conversation. Cet ajustement dynamique permettait à l'opérateur distant d'entendre clairement le participant humain, même pendant que le robot se déplaçait, et de ressentir comme s'il était physiquement présent dans la conversation.

Pour que cela fonctionne, le système devait faire plus que simplement amplifier le son ; il devait créer un sentiment d'espace. Lorsque l'opérateur distant écoutait via un casque, l'audio était ajusté de sorte que si le participant humain se trouvait à gauche du robot, la voix proviendrait du côté gauche du casque de l'opérateur. Cet effet audio spatial aide l'opérateur à se sentir immergé dans l'interaction, préservant la relation naturelle entre les interlocuteurs. De plus, le système comprenait une fonction d'annulation d'écho pour empêcher la propre voix de l'opérateur, qui était diffusée par le haut-parleur du robot, d'être captée par le microphone et de confondre le système.

Les résultats de la démonstration ont été encourageants. Pendant six jours à l'Expo, les systèmes ont interagi avec des centaines de visiteurs dans un pavillon rempli du bruit d'autres expositions et du son occasionnel de la pluie. Les robots ont été capables de maintenir des conversations cohérentes, et les opérateurs distants ont rapporté qu'ils pouvaient entendre clairement les personnes avec qui ils parlaient, malgré les niveaux de bruit élevés. Lors de tests contrôlés avant l'événement, la capacité du système à reconnaître la parole était comparable à l'utilisation d'un microphone à main standard, même lorsque le robot était en mouvement ou lorsqu'il y avait un bruit de fond important. Les chercheurs ont noté que si le système n'était pas parfait — manquant parfois des locuteurs discrets ou éprouvant des difficultés lorsqu'une personne tournait le dos au microphone — il représentait une étape importante vers la capacité des robots à fonctionner dans des espaces publics du monde réel.

Ce travail met en lumière un changement crucial dans notre façon de concevoir l'interaction humain-robot. Il dépasse les environnements contrôlés et calmes des laboratoires pour entrer dans la réalité désordonnée et bruyante de la vie quotidienne. En résolvant le problème de l'écoute claire dans une foule, les chercheurs ont ouvert la voie à des robots capables de servir de compagnons, de guides ou d'assistants dans des lieux tels que les aéroports, les musées et les centres commerciaux. La capacité de filtrer le bruit et de se concentrer sur la voix humaine n'est pas seulement une prouesse technique ; c'est le fondement de la création de machines qui peuvent véritablement nous comprendre et se connecter avec nous, même dans les contextes les plus chaotiques.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →