← Últimos artigos
💻 computer science

DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA

O DeicticVLA unifica os modos de linguagem, visão-linguagem e instrução visual em um único modelo de Visão-Linguagem-Ação ao canonicizá-los em prompts de texto e máscaras dêiticas, demonstrando uma generalização superior para objetos e expressões não vistos em comparação com baselines apenas de linguagem.

Autores originais: Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

Publicado 2026-08-31
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um braço robótico parado em uma cozinha, pronto para ajudar. Para dizer a ele o que fazer, um humano pode dizer: "Pegue o copo vermelho à esquerda". Isso parece simples, mas para uma máquina, o mundo costuma estar repleto de muitos copos vermelhos, ou copos que parecem quase idênticos. Se o humano tentar ser mais específico, dizendo: "Pegue o terceiro copo vermelho da esquerda, aquele ao lado do guardanapo azul", o robô ainda pode se confundir. Os robôs modernos estão se tornando melhores em entender a linguagem, mas frequentemente têm dificuldade quando as instruções são detalhadas demais ou quando os objetos à sua frente não correspondem exatamente às imagens que aprenderam durante o treinamento. Eles podem pegar o item errado simplesmente porque ele parece um pouco mais familiar, ignorando as palavras específicas que o humano acabou de proferir.

Para resolver isso, pesquisadores têm explorado uma maneira diferente de falar com máquinas: o uso de um gesto de apontar. Assim como um humano pode dizer: "Pegue este aqui", enquanto aponta o dedo para o objeto, um robô pode ser ensinado a entender um clique na tela como um comando direto. Essa abordagem, conhecida como gesto dêitico, corta a confusão da linguagem ao mostrar ao robô exatamente o que se pretende. No entanto, até agora, os robôs geralmente eram treinados para ouvir apenas palavras, ou para ouvir palavras enquanto se aponta para algo, mas raramente para lidar com todas essas formas de comunicação ao mesmo tempo. Um novo estudo introduz um sistema que unifica esses métodos, permitindo que um único "cérebro" robótico alterne perfeitamente entre ouvir uma frase, ouvir uma frase enquanto se aponta para algo ou simplesmente seguir um ponto sem quaisquer palavras.

Os pesquisadores, trabalhando com um tipo de inteligência artificial chamada modelo Visão-Linguagem-Ação, desenvolveram um sistema que chamam de DeicticVLA. Esses modelos são como o cérebro de um robô que leu milhões de livros e viu milhões de imagens, aprendendo como conectar o que vê com o que deve fazer. O desafio era tornar esse cérebro flexível o suficiente para aceitar três tipos diferentes de entrada: um comando de texto, um comando de texto combinado com um gesto de apontar ou apenas um gesto de apontar. No primeiro modo, o usuário digita uma frase completa. No segundo, o usuário digita uma frase que inclui uma palavra como "este" ou "ali" e clica na tela para definir a que essa palavra se refere. No terceiro, o usuário clica no objeto que deseja mover e no lugar para onde deseja levá-lo, sem dizer nada.

Para fazer isso funcionar, a equipe criou uma etapa de tradução que transforma todas essas três entradas diferentes no mesmo formato interno. Quando um usuário clica em uma tela, o sistema usa uma poderosa ferramenta de análise de imagem para transformar aquele único clique em um contorno preciso do objeto, uma máscara que destaca exatamente o que o humano está tocando. Essa máscara é então combinada com um comando de texto. Se o usuário falou, o comando de texto são suas palavras. Se ele apenas clicou, o sistema usa uma frase padrão como "siga a instrução visual". Dessa forma, o cérebro do robô sempre recebe um pacote consistente: uma instrução de texto e um destaque visual do alvo. Os pesquisadores então testaram diferentes maneiras de alimentar esse destaque visual no cérebro do robô. Eles tentaram pintar uma caixa ao redor do objeto na imagem da câmera, suavizar o restante da cena para fazer o objeto se destacar ou fornecer o contorno como uma camada separada de informação que o robô processa junto com a imagem.

A equipe primeiro testou essas ideias em um ambiente simulado, um mundo digital onde os robôs podem praticar milhares de vezes sem quebrar nada. Eles descobriram que o sistema conseguia aprender a lidar com todos os três modos de instrução simultaneamente. Quando o robô era solicitado a realizar tarefas que nunca tinha visto antes, como pegar um objeto em um novo arranjo de móveis ou identificar um objeto por uma nova descrição espacial, os métodos de apontar funcionaram significativamente melhor do que apenas as palavras. Em um teste envolvendo tigelas pretas idênticas, onde o robô tinha que pegar aquela ao lado de um objeto de referência específico, a abordagem baseada apenas em linguagem falhou na maioria das vezes. No entanto, quando o usuário apontava para a tigela correta, o robô tinha sucesso quase todas as vezes. O estudo mostrou que o método de treinamento em duas etapas foi crucial: o robô primeiro aprendeu a seguir comandos de texto e, em seguida, aprendeu a combinar esses comandos com gestos de apontar. Essa ordem ajudou o robô a manter sua capacidade de entender a linguagem enquanto adquiria a nova habilidade de seguir um ponto.

Para ver se isso funcionava no mundo real, os pesquisadores construíram uma configuração física com um braço robótico, uma câmera e um tablet. Eles ensinaram o robô a pegar blocos, colocá-los em tigelas e organizar brinquedos de pelúcia. Eles testaram o robô com instruções que ele nunca tinha ouvido antes, como pedir para pegar o bloco "mais à esquerda" quando só havia sido treinado em instruções de "mais à direita", ou pedir para mover um tipo específico de brinquedo que ele nunca vira. Nesses cenários difíceis, o robô que dependia apenas da linguagem lutava, muitas vezes errando a escolha ou falhando em agir. Mas quando o usuário apontava para o alvo, a taxa de sucesso do robô disparava. Em um teste com categorias completamente novas de brinquedos de pelúcia, o robô baseado apenas em linguagem teve sucesso apenas cerca de um sexto das vezes. Os métodos baseados em apontar, no entanto, alcançaram uma taxa de sucesso perfeita. O robô não precisava saber o nome do brinquedo ou a qual categoria ele pertencia; ele precisava apenas ver para onde o humano apontava.

Os resultados sugerem que o futuro da interação humano-robô pode não ser sobre escolher entre falar e apontar, mas sobre ter ambos disponíveis ao mesmo tempo. O sistema permite que um usuário comece com uma frase e, se o robô parecer confuso, simplesmente aponte para esclarecer. Ou, para uma tarefa rápida e rotineira, o usuário pode apenas apontar sem dizer uma palavra. A pesquisa indica que, embora a linguagem seja poderosa para descrever ideias complexas, o ato de apontar é uma maneira mais confiável de identificar objetos específicos em um mundo bagunçado e mutável. Ao unificar esses métodos em um único sistema, os pesquisadores criaram uma maneira mais flexível e robusta para os humanos guiarem as máquinas, garantindo que o robô entenda não apenas o que dizemos, mas o que queremos dizer.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →