← Últimos artigos
💻 computer science

Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy

Este artigo investiga a adição de grego a uma política de visão-linguagem-ação de um robô utilizando apenas instruções refraseadas por máquina, revelando que uma avaliação robusta requer benchmarks nulos e replicação de sementes para evitar conclusões falsas, ao mesmo tempo em que demonstra que o treinamento bilíngue produz melhorias consistentes em relação aos controles, apesar do sobreajuste a formulações específicas.

Autores originais: Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos

Publicado 2026-09-09
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Robôs que podem ver, entender e se mover estão se tornando uma realidade, mas atualmente falam apenas uma língua: o inglês. Essas máquinas aprendem assistindo a vídeos de humanos realizando tarefas, onde as instruções são escritas em inglês. O software que as ajuda a entender essas palavras é treinado em quantidades massivas de texto em inglês, tornando-o incrivelmente bom nesse idioma específico. Para qualquer pessoa que fale grego, ou qualquer outro idioma, isso cria uma barreira difícil. Não existem bibliotecas de vídeo de robôs movendo objetos com instruções em grego, e construir uma do zero exigiria meses de orientação manual de um braço robótico para cada ação. A questão que os pesquisadores fizeram foi simples: poderiam eles pegar os dados existentes em inglês, traduzir as instruções para o grego usando um computador e ensinar o robô a entender o novo idioma sem reconstruir todo o sistema?

A resposta revelou-se mais complicada do que uma simples tradução. Uma equipe de pesquisadores da Sophea AI e da KIEFER SA, em Atenas, pegou um sistema robótico de código aberto e alimentou-o com milhares de instruções em grego geradas por uma máquina. Eles não alteraram o cérebro do robô ou sua estrutura física; eles simplesmente trocaram o texto em inglês pelo texto em grego. O processo de tradução foi rápido e fácil, levando apenas algumas horas. No entanto, o trabalho real começou quando tentaram medir se o robô realmente entendia o que lhe era dito. No mundo da robótica, é surpreendentemente fácil enganar um sistema para que ele pareça bem-sucedido quando, na verdade, está apenas adivinhando. Os pesquisadores descobriram que testes padrão, que geralmente dão um passar ou falhar claro, foram completamente enganados. Eles descobriram que um robô poderia seguir um comando em grego com altas taxas de sucesso mesmo quando o comando era um absurdo, ou mesmo quando o robô nunca havia sido ensinado grego. Isso aconteceu porque o robô estava aprendendo a reconhecer a cena e os objetos, em vez de ler as palavras.

Para resolver isso, a equipe teve que inventar novas maneiras de testar o robô. Eles construíram um grupo de controle onde deram deliberadamente instruções erradas ao robô em grego para ver se ele ainda tentaria realizar a tarefa. Descobriram que, em um pequeno conjunto de dez tarefas, um robio treinado com instruções em grego traduzidas por máquina parecia ter sucesso cerca de oitenta e quatro por cento das vezes. Mas quando testaram com as instruções erradas, ele ainda teve sucesso cerca de oitenta e dois por cento das vezes. Isso provou que o robô não estava lendo o grego; ele estava apenas reagindo à configuração visual. O robô estava ignorando o idioma inteiramente.

Os pesquisadores então tentaram uma abordagem diferente. Utilizaram um conjunto maior de noventa tarefas onde o robô tinha que escolher entre múltiplos objetivos possíveis na mesma cena. Aqui, a linguagem tornou-se o único sinal para dizer ao robô o que fazer. Descobriram que um robô treinado tanto com instruções em inglês quanto em grego conseguia seguir os comandos em grego cerca de vinte e sete por cento das vezes, o que era significativamente melhor do que o acaso. No entanto, um robô treinado apenas com instruções em grego, sem qualquer dado em inglês para apoiá-lo, mal melhorou em relação ao acaso. Embora o treinamento bilíngue tenha tido um desempenho médio melhor do que o treinamento apenas em grego, as faixas estatísticas de seu desempenho se sobrepuseram significativamente, o que significa que os dados não puderam confirmar definitivamente se o treinamento em inglês atuava como um andaime necessário para o aprendizado do grego. O achado mais robusto foi que demonstrações no idioma alvo são necessárias, mas, por si só, são frequentemente insuficientes; uma política treinada apenas em grego mal segue a linguagem, permanecendo a três pontos de seu próprio limite de falha em múltiplas execuções de teste.

O estudo também revelou que o robô não estava aprendendo a língua grega da maneira que um humano faria. Em vez disso, estava memorizando o fraseado específico usado pelo tradutor de máquina. Quando os pesquisadores testaram o robô com frases em grego escritas por um programa de computador diferente, o desempenho do robô caiu drasticamente. Ele havia aprendido o estilo do primeiro tradutor, não o idioma em si. Para corrigir isso, eles ensinaram ao robô a mesma tarefa usando sete fraseados diferentes em grego. Essa mudança simples tornou o robô muito mais robusto, reduzindo a queda de desempenho pela metade quando testado com novos fraseados. Isso mostrou que a variedade nos dados de treinamento é essencial para que o robô consiga generalizar além do estilo de escrita de uma única máquina.

Talvez a descoberta mais surpreendente seja que algumas melhorias de senso comum na verdade pioraram o robô. A equipe tentou iniciar o treinamento do robô com um modelo que já havia sido adaptado para o grego, pensando que isso lhe daria uma vantagem inicial. Em vez disso, o robô teve um desempenho pior tanto em inglês quanto em grego. Eles também tentaram deixar a parte do cérebro do robô que processa a linguagem aprender livremente, em vez de mantê-la congelada. Isso também degradou o desempenho. Os resultados sugerem que, para esses sistemas específicos, a melhor estratégia é manter a parte de compreensão da linguagem exatamente como foi treinada, e apenas ensinar o robô como se mover usando as novas instruções de linguagem.

Os pesquisadores também tentaram testar esses métodos em uma coleção massiva de dados reais de robôs, muito maior do que seus testes simulados. Eles traduziram mais de cinquenta mil episódios de robôs reais para o grego. No entanto, não puderam medir o sucesso desses dados porque careciam do hardware físico do robô necessário para executar os testes. Isso destacou um grande gargalo no campo: traduzir os dados é barato e rápido, mas verificar se o robô realmente aprendeu é lento, caro e exige equipamentos físicos.

Em última análise, o artigo conclui que adicionar um novo idioma a um robô é possível, mas não é tão simples quanto uma tradução. Requer um tipo específico de modelo base que já entenda o idioma, uma mistura de dados de treinamento tanto no novo idioma quanto em inglês, e um processo de teste muito cuidadoso que inclua falhas deliberadas para garantir que o robô está realmente ouvindo. O robô não aprende o idioma de uma forma profunda e humana; ele aprende a associar padrões específicos de palavras com ações, e precisa da estabilidade do treinamento em inglês para fazê-lo, embora o mecanismo exato de como o inglês apoia o grego permaneça uma questão aberta em vez de uma regra confirmada. O trabalho serve como um aviso para outros na área: não confie na taxa de sucesso de um robô apenas pelo valor de face e sempre teste com um grupo de controle que prove que o robô não está apenas adivinhando. O caminho para um robô multilíngue é pavimentado não apenas com dados, mas com a disciplina rigorosa de provar que os dados foram realmente compreendidos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →