← Últimos artículos
💻 computer science

Human-robot conversation with multiple participants in noisy public spaces

Este artículo presenta un sistema de audio de matriz de micrófonos multicanal diseñado para espacios públicos ruidosos que mejora el habla tanto para la escucha atenta del androide ERICA como para las interacciones de avatares remotos a través de robots Teleco, al tiempo que proporciona audio espacial para mejorar la inmersión en conversaciones multipartitas.

Autores originales: Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes, Kazushi Kato, Shota Fujiki, Zihao Chi, Masaya Iwasaki, Taiken Shintani, Megumi Kawata, Kazuki Sakai, Koji Inoue, Yuicihiro Yoshikawa, Tatsuya
Publicado 2026-09-02
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes, Kazushi Kato, Shota Fujiki, Zihao Chi, Masaya Iwasaki, Taiken Shintani, Megumi Kawata, Kazuki Sakai, Koji Inoue, Yuicihiro Yoshikawa, Tatsuya Kawahara

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina intentar tener una conversación seria en medio de una bulliciosa estación de tren, donde el rugido de los motores, el parloteo de las multitudes y el eco de la arquitectura compiten por tu atención. Los humanos logran esta hazaña sin esfuerzo, una habilidad que los científicos llaman el "efecto de la fiesta de cóctel", donde nuestros cerebros filtran el ruido de fondo para concentrarse en una sola voz. Para un robot, sin embargo, esto es un desafío formidable. Si bien la inteligencia artificial se ha vuelto notablemente buena manteniendo conversaciones basadas en texto, dotar a un robot de la capacidad de escuchar y hablar con naturalidad en un espacio público ruidoso y concurrido sigue siendo un obstáculo significativo. Esto es especialmente cierto cuando varias personas hablan al mismo tiempo, o cuando el propio robot se desplaza a través del entorno. Sin una forma de aislar la voz humana del caos, la capacidad de un robot para comprender y responder colapsa, dejándolo sordo ante las mismas personas a las que debe servir.

Investigadores de varias universidades de Japón y Singapur se propusstedieron resolver este problema construyendo un sistema que permita a los robots oír con claridad en el mundo real. Probaron su trabajo en la Expo Mundial 2025 en Osaka, un escenario elegido específicamente porque es ruidoso, impredecible y está lleno de miles de visitantes. El equipo desarrolló un sistema de audio especializado capaz de capturar las voces de múltiples personas simultáneamente, incluso cuando hablan unas sobre otras, y de limpiar el sonido para que tanto el robot como un operador humano remoto puedan entenderlas. El resultado fue una demostración en la que los robots mantuvieron conversaciones con grupos de personas en un pabellón ruidoso, demostrando que se puede enseñar a las máquinas a escuchar con la misma concentración que un humano utiliza en una habitación concurrida.

El núcleo de este logro reside en cómo están equipados los robots para oír. En lugar de depender de un solo micrófono, que recogería todo el ruido de la sala por igual, los investigadores utilizaron un arreglo circular de cuatro micrófonos. Este dispositivo actúa como un conjunto de oídos que pueden dirigirse electrónicamente para enfocarse en direcciones específicas. Cuando una persona habla, el sistema identifica su ubicación y realza su voz mientras suprime el ruido de fondo proveniente de otras direcciones. Este proceso crea una señal de audio limpia que puede utilizarse para dos propósitos distintos: permite que la computadora interna del robot reconozca las palabras que se están pronunciando, y envía una versión clara y de alta calidad de la conversación a un operador humano que podría estar controlando al robot desde una ubicación distante.

El equipo demostró esta tecnología en dos escenarios diferentes, cada uno con sus propios desafíos únicos. En la primera configuración, un robot androide llamado ERICA estaba sentado con dos participantes humanos. El objetivo era demostrar que el robot podía actuar como un oyente atento, siguiendo la conversación y respondiendo con asentimientos o breves señales verbales. Debido a que los humanos estaban sentados en una posición fija, el arreglo de micrófonos pudo colocarse en un trípode entre ellos, creando un entorno de escucha estable. El sistema separó con éxito las voces de las dos personas, permitiendo que ERICA entendiera quién estaba hablando y generara respuestas apropiadas, como hacer preguntas de seguimiento basadas en lo que se acababa de decir. Este escenario demostró que la tecnología podía manejar las complejidades de una conversación grupal donde las personas podrían interrumpir o hablar al mismo tiempo.

El segundo escenario era mucho más difícil porque implicaba movimiento. Aquí, los investigadores utilizaron pequeños robots móviles llamados Telecos. Uno de estos robots era controlado por un operador humano sentado en una sala separada, actuando como un avatar virtual, mientras que el otro robot se movía por su cuenta para apoyar la conversación. En este caso, el arreglo de micrófonos estaba montado en la cabeza del robot controlado por el humano. A medida que el robot giraba la cabeza o se desplazaba por el suelo, la dirección de sus "oídos" cambiaba constantemente. Los investigadores tuvieron que programar el sistema para rastrear continuamente la posición del participante humano y del otro robot, cambiando instantáneamente el enfoque del micrófono hacia cualquier dirección de donde viniera la conversación. Este ajuste dinámico permitió que el operador remoto escuchara claramente al participante humano, incluso mientras el robot se movía, y sintiera que estaba físicamente presente en la conversación.

Para que esto funcionara, el sistema tuvo que hacer más que solo amplificar el sonido; tuvo que crear una sensación de espacio. Cuando el operador remoto escuchaba a través de auriculares, el audio se ajustaba de modo que, si el participante humano estaba parado a la izquierda del robot, la voz vendría del lado izquierdo de los auriculares del operador. Este efecto de audio espacial ayudaba al operador a sentirse inmerso en la interacción, preservando la relación natural entre los interlocutores. Además, el sistema incluía una función de cancelación de eco para evitar que la propia voz del operador, que se reproducía a través del altavoz del robot, fuera captada por el micrófono y confundiera al sistema.

Los resultados de la demostración fueron alentadores. Durante seis días en la Expo, los sistemas interactuaron con cientos de visitantes en un pabellón lleno del ruido de otros exhibidores y el sonido ocasional de la lluvia. Los robots fueron capaces de mantener conversaciones coherentes, y los operadores remotos informaron que podían escuchar claramente a las personas con las que hablaban, a pesar de los altos niveles de ruido. En pruebas controladas previas al evento, la capacidad del sistema para el reconocimiento de voz fue comparable a la de usar un micrófono de mano estándar, incluso cuando el robot se movía o cuando había un ruido de fondo significativo. Los investigadores señalaron que, si bien el sistema no era perfecto —a veces perdía a los hablantes de voz baja o tenía dificultades cuando una persona le daba la espalda al micrófono—, representaba un paso significativo hacia la capacidad de los robots para funcionar en espacios públicos del mundo real.

Este trabajo destaca un cambio crucial en cómo pensamos sobre la interacción humano-robot. Se mueve más allá de los entornos controlados y silenciosos de un laboratorio y entra en la realidad desordenada y ruidosa de la vida diaria. Al resolver el problema de cómo escuchar claramente en una multitud, los investigadores han allanado el camino para que los robots puedan servir como compañeros, guías o asistentes en lugares como aeropuertos, museos y centros comerciales. La capacidad de filtrar el ruido y enfocarse en la voz humana no es solo una proeza técnica; es la base para construir máquinas que realmente puedan comprendernos y conectar con nosotros, incluso en los entornos más caóticos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →