← Últimos artigos
💻 computer science

Human-robot conversation with multiple participants in noisy public spaces

Este artigo apresenta um sistema de áudio de matriz de microfones multicanal projetado para espaços públicos ruidosos que melhora a fala tanto para a escuta atenta pelo androide ERICA quanto para interações de avatares remotos via robôs Teleco, ao mesmo tempo em que fornece áudio espacial para melhorar a imersão em conversas de múltiplas partes.

Autores originais: Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes, Kazushi Kato, Shota Fujiki, Zihao Chi, Masaya Iwasaki, Taiken Shintani, Megumi Kawata, Kazuki Sakai, Koji Inoue, Yuicihiro Yoshikawa, Tatsuya
Publicado 2026-09-02
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes, Kazushi Kato, Shota Fujiki, Zihao Chi, Masaya Iwasaki, Taiken Shintani, Megumi Kawata, Kazuki Sakai, Koji Inoue, Yuicihiro Yoshikawa, Tatsuya Kawahara

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine tentar ter uma conversa séria no meio de uma estação de trem movimentada, onde o rugido dos motores, o falatório das multidões e o eco da arquitetura competem pela sua atenção. Os seres humanos gerenciam esse feito sem esforço, uma habilidade que os cientistas chamam de "efeito coquetel", onde nossos cérebros filtram o ruído de fundo para focar em uma única voz. Para um robô, no entanto, isso é um desafio formidável. Embora a inteligência artificial tenha se tornado notavelmente boa em manter conversas baseadas em texto, dar a um robô a capacidade de ouvir e falar naturalmente em um espaço público barulhento e lotado continua sendo um obstáculo significativo. Isso é especialmente verdadeiro quando várias pessoas estão falando ao mesmo tempo, ou quando o próprio robô está se movendo pelo ambiente. Sem uma maneira de isolar a fala humana do caos, a capacidade de um robô de compreender e responder colapsa, deixando-o surdo para as próprias pessoas que ele deveria servir.

Pesquisadores de várias universidades no Japão e em Singapura partiram para resolver este problema, construindo um sistema que permite aos robôs ouvirem claramente no mundo real. Eles testaram seu trabalho na Expo 2025 em Osaka, um cenário escolhido especificamente por ser barulhento, imprevisível e repleto de milhares de visitantes. A equipe desenvolveu um sistema de áudio especializado capaz de capturar as vozes de múltiplas pessoas simultaneamente, mesmo quando estão falando umas sobre as outras, e de limpar o som para que tanto o robô quanto um operador humano remoto possam entendê-las. O resultado foi uma demonstração onde robôs conseguiram manter conversas com grupos de pessoas em um pavilhão barulhento, provando que as máquinas podem ser ensinadas a ouvir com o mesmo foco que um humano usa em uma sala lotada.

O cerne desta conquista reside em como os robôs são equipados para ouvir. Em vez de depender de um único microfone, que captaria todo o ruído da sala igualmente, os pesquisadores usaram um arranjo circular de quatro microfones. Este dispositivo atua como um conjunto de ouvidos que pode ser eletronicamente direcionado para focar em direções específicas. Quando uma pessoa fala, o sistema identifica sua localização e realça sua voz enquanto suprime o ruído de fundo vindo de outras direções. Este processo cria um sinal de áudio limpo que pode ser usado para dois propósitos distintos: permite que o computador interno do robô reconheça as palavras que estão sendo ditas e envia uma versão clara e de alta qualidade da conversa para um operador humano que pode estar controlando o robô de um local distante.

A equipe demonstou esta tecnologia em dois cenários diferentes, cada um com seus próprios desafios únicos. No primeiro setup, um robô androide chamado ERICA sentou-se com dois participantes humanos. O objetivo era mostrar que o robô poderia agir como um ouvinte atento, acompanhando a conversa e respondendo com acenos de cabeça ou breves pistas verbais. Como os humanos estavam sentados em uma posição fixa, o arranjo de microfones pôde ser colocado em um tripé entre eles, criando um ambiente de escuta estável. O sistema separou com sucesso as vozes das duas pessoas, permitindo que a ERICA entendesse quem estava falando e gerasse respostas apropriadas, como fazer perguntas de acompanhamento baseadas no que acabou de ser dito. Este cenário provou que a tecnologia poderia lidar com as complexidades de uma conversa em grupo, onde as pessoas podem interromper ou falar ao mesmo tempo.

O segundo cenário era muito mais difícil porque envolvia movimento. Aqui, os pesquisadores usaram pequenos robôs móveis chamados Telecos. Um desses robôs era controlado por um operador humano sentado em uma sala separada, atuando como um avatar virtual, enquanto o outro robô se movia por conta própria para apoiar a conversa. Neste caso, o arranjo de microfones estava montado na cabeça do robô controlado pelo humano. Conforme o robô virava a cabeça ou se movia pelo chão, a direção de seus "ouvidos" mudava constantemente. Os pesquisadores tiveram que programar o sistema para rastrear continuamente a posição do participante humano e do outro robô, alternando instantaneamente o foco do microfone para qualquer direção de onde a conversa viesse. Este ajuste dinâmico permitiu que o operador remoto ouvisse o participante humano claramente, mesmo enquanto o robô se movia, e sentisse como se estivesse fisicamente presente na conversa.

Para fazer isso funcionar, o sistema teve que fazer mais do que apenas amplificar o som; teve que criar uma sensação de espaço. Quando o operador remoto ouvia através de fones de ouvido, o áudio era ajustado para que, se o participante humano estivesse à esquerda do robô, a voz viesse do lado esquerdo dos fones de ouvido do operador. Este efeito de áudio espacial ajudou o operador a se sentir imerso na interação, preservando a relação natural entre os interlocutores. Além disso, o sistema incluía um recurso de cancelamento de eco para evitar que a própria voz do operador, que estava sendo reproduzida através do alto-falante do robô, fosse captada pelo microfone e confundisse o sistema.

Os resultados da demonstração foram encorajadores. Durante seis dias na Expo, os sistemas interagiram com centenas de visitantes em um pavilhão cheio do ruído de outras exposições e do som ocasional de chuva. Os robôs foram capazes de manter conversas coerentes, e os operadores remotos relataram que podiam ouvir claramente as pessoas com quem estavam conversando, apesar dos altos níveis de ruído. Em testes controlados antes do evento, a capacidade de reconhecimento de fala do sistema foi comparável ao uso de um microfone de mão padrão, mesmo quando o robô estava se movendo ou quando havia um ruído de fundo significativo. Os pesquisadores observaram que, embora o sistema não fosse perfeito — às vezes perdia falantes baixos ou tinha dificuldades quando uma pessoa virava as costas para o microfone — ele representava um passo significativo para tornar os robôs capazes de funcionar em espaços públicos do mundo real.

Este trabalho destaca uma mudança crucial na forma como pensamos na interação humano-robô. Ele vai além dos ambientes controlados e silenciosos de um laboratório e entra na realidade barulhenta e desordenada da vida cotidiana. Ao resolver o problema de como ouvir claramente em uma multidão, os pesquisadores pavimentaram o caminho para robôs que podem servir como companheiros, guias ou assistentes em lugares como aeroportos, museus e centros comerciais. A capacidade de filtrar o ruído e focar na voz humana não é apenas um feito técnico; é a base para construir máquinas que podem verdadeiramente nos entender e se conectar conosco, mesmo nos cenários mais caóticos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →