← Últimos artigos
💻 computer science

ReLI: Cross-Lingual Language-to-Action Grounding for Human-Robot Interaction

O LeLI é uma estrutura translinguística que adapta modelos de fundação de larga escala para permitir que agentes autônomos compreendam instruções em linguagem natural, raciocinem semanticamente e executem tarefas de forma eficaz em mais de 140 idiomas diversos, incluindo variedades de baixos recursos e crioulos, superando assim as limitações dos sistemas existentes focados apenas em idiomas de altos recursos.

Autores originais: Linus Nwankwo, Bjoern Ellensohn, Ozan Özdenizci, Elmar Rueckert

Publicado 2026-09-09
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Linus Nwankwo, Bjoern Ellensohn, Ozan Özdenizci, Elmar Rueckert

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde um robô possa compreender um comando dado em qualquer idioma, desde as línguas mais faladas até dialetos raros falados por pequenas comunidades. Durante décadas, o sonho da colaboração natural entre humanos e robôs foi contido por uma barreira simples: a linguagem. Embora os robôs modernos estejam se tornando cada vez mais capazes de ver seus arredores e se mover através deles, eles têm sido amplamente treinados para entender apenas um punhado de grandes idiomas, como o inglês ou o mandarim. Essa limitação exclui bilhões de usuários potenciais que falam outras línguas, dialetos ou crioulos, efetivamente bloqueando-os do futuro da automação. O campo da interação humano-robô depende da capacidade de traduzir um pedido falado ou escrito em uma ação física, um processo conhecido como ancoragem (grounding). Até agora, essa tradução tem sido uma via de mão única, funcionando bem apenas para aqueles com acesso a línguas de alto recurso, deixando o resto do mundo para trás.

Uma equipe de pesquisadores desenvolveu um novo sistema chamado ReLI, projetado para derrubar essas barreiras linguísticas. O ReLI permite que agentes autônomos conversem naturalmente, raciocinem sobre seu ambiente e executem tarefas, independentemente do idioma em que a instrução é dada. O sistema não depende de traduzir a fala do usuário para o inglês primeiro, nem exige que o robô seja retreinado para cada novo idioma. Em vez disso, ele aproveita a habilidade inerente de modelos de computador pré-treinados em larga escala para compreender o significado por trás das palavras em centenas de idiomas diferentes simultaneamente. Ao combinar esses modelos de linguagem com sensores visuais que permitem ao robô "ver" objetos e espaços, o ReLI pode transformar um comando como "encontre a cadeira vermelha" dito em um dialeto raro em um movimento físico preciso, tudo sem que o usuário precise conhecer nenhum código técnico ou falar uma língua dominante global.

Os pesquisadores testaram este sistema tanto em ambientes simulados quanto em configurações do mundo real, utilizando robôs sobre rodas e máquinas de quatro patas equipadas com câjas e sensores de profundidade. Eles desafiaram os robôs com mais de 70.000 conversas de múltiplos turnos em mais de 140 idiomas diferentes. Esses idiomas foram cuidadosamente selecionados para representar um amplo espectro da diversidade linguística do mundo, incluindo línguas de alto recurso com vastos dados digitais, línguas de baixo recurso com dados limitados e línguas vulneráveis ou crioulos que são frequentemente ignorados pela tecnologia. As tarefas variaram de comandos simples de etapa única, como mover-se para frente uma distância específica, até missões complexas de múltiplas etapas que exigiam que o robô navegasse por uma sala, identificasse um objeto com base em uma descrição e relatasse o que encontrou.

Os resultados mostraram que o sistema apresentou uma consistência notável através deste vasto panorama linguístico. Em quase todos os idiomas testados, o robô compreendeu corretamente a intenção do usuário e executou a tarefa com uma taxa de sucesso superior a 83 por cento. Para muitas das línguas mais comuns, a taxa de sucesso subiu acima de 97 por cento. Mesmo para as línguas mais vulneráveis e com poucos recursos, o sistema manteve altos níveis de precisão, analisando com sucesso as instruções e guiando o robô ao seu objetivo. O tempo que o robô levou para processar um comando e começar a se mover permaneceu estável, variando entre 2,1 e 2,6 segundos, independentemente de a instrução ter sido dada em uma língua mundial importante ou em um dialeto raro. Esta velocidade e confiabilidade sugerem que o sistema não é apenas um conceito teórico, mas uma ferramenta prática capaz de funcionar em tempo real.

Para garantir que a tecnologia fosse verdadeiramente inclusiva, os pesquisadores também realizaram um estudo com participantes humanos que interagiram com os robôs em suas línguas nativas. Trinta e quatro avaliadores, fluentes em 13 idiomas diferentes, testaram o sistema em um ambiente de laboratório real. Eles relataram que as interações pareciam naturais e responsivas, com a grande maioria observando que não percebeu nenhuma diferença de desempenho baseada no idioma utilizado. Este achado é crucial, pois indica que o sistema não favorece uma língua sobre outra, nem cria uma lacuna oculta onde usuários de certas línguas recebem uma experiência inferior. O sistema lidou com sucesso com o "code-switching" (alternância de código), onde um usuário pode misturar palavras de dois idiomas diferentes em uma única frase, e gerenciou o raciocínio espacial complexo, como navegar para um local descrito apenas por sua função, como "o lugar onde a comida é cozida".

O cerne desta conquista reside em como o sistema conecta a linguagem à ação. Quando um usuário fala ou digita um comando, o sistema primeiro normaliza a entrada, convertendo a fala em texto, se necessário, e então a passa para um grande modelo de linguagem que atua como o cérebró do robô. Este modelo interpreta a intenção do comando, decompondo-o em uma sequência de etapas lógicas. Em seguida, ele consulta os sensores visuais do robô para identificar os objetos e espaços mencionados no comando. Se um usuário pede ao robô para ir a uma cadeira específica, o sistema usa visão computacional para localizar essa cadeira na sala, determinar sua posição exata no espaço tridimensional e calcular o caminho que o robô precisa percorrer para alcançá-la. Finalmente, o sistema gera um plano e, por segurança, frequentemente pede a confirmação do usuário antes de executar movimentos complexos ou de longa distância. Todo esse processo acontece de forma fluida, preenchendo a lacuna entre o pensamento humano e a ação da máquina sem a necessidade de tradução explícita ou treinamento especializado para cada novo idioma.

O estudo também explorou os limites desta tecnologia, revelando que, embora o sistema seja robusto, não é infalível. Os desafios mais significativos surgiram quando o robô teve que identificar objetos que pareciam muito semelhantes entre si ou quando o ambiente visual estava poluído, dificultando a distinção do alvo. Além disso, tarefas que exigiam navegar através de sequências complexas de múltiplas etapas foram ligeiramente mais propensas a erros do que comandos diretos e simples, simplesmente porque havia mais oportunidades para ocorrer um erro na cadeia de raciocínio. No entanto, mesmo nestes cenários difíceis, o desempenho do sistema permaneceu forte, e os pesquisadores observaram que os erros estavam frequentemente relacionados às limitações físicas dos sensores do robô ou à complexidade do ambiente, e não a uma falha em compreender a linguagem.

Ao demonstrar que um único framework pode lidar com mais de 140 idiomas com alta precisão, este trabalho sugere um novo caminho para a interação humano-robô. Ele se afasta da ideia de que os robôs devem ser ensinados um idioma específico para serem úteis, e caminha para um modelo onde o robô se adapta à língua nativa do usuário. Os pesquisadores disponibilizaram seus dados e código ao público, convidando outros a construir sobre esta base. O objetivo final não é apenas fazer com que os robôs possam falar muitos idiomas, mas criar um futuro onde a capacidade de comandar uma máquina seja um direito universal, acessível a qualquer pessoa, em qualquer lugar, no idioma que ela melhor conhece. Esta mudança promete democratizar o acesso à automação, garantindo que os benefícios da robótica sejam compartilhados por toda a humanidade, e não apenas por aqueles que falam as línguas da elite digital.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →