← Últimos artigos
💻 computer science

Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies

Este artigo propõe um método de consistência de ação entre vistas que regulariza políticas de Visão-Linguagem-Ação baseadas em fluxo para alcançar robustez contra mudanças de perspectiva da câmera na cena usando apenas imagens RGB e propriocepção, melhorando significativamente o desempenho em tarefas robóticas simuladas e do mundo real sem exigir rótulos de câmera ou entradas de profundidade.

Autores originais: Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

Publicado 2026-09-15
📖 4 min de leitura☕ Leitura rápida

Autores originais: Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Robôs que aprendem com demonstrações humanas estão se tornando cada vez mais capazes, mas frequentemente sofrem de uma fragilidade peculiar: eles estão presos ao ponto de vista específico a partir do qual foram ensinados. Imagine um robô treinado para pegar uma xícara enquanto uma câmera está situada em uma prateleira acima da mesa. Se essa câmera for esbarrada, movida para o lado ou elevada, o robô pode subitamente falhar, mesmo que a xícara, a mesa e o próprio corpo do robô não tenham se movido. Isso acontece porque o "cérebro" do robô, um tipo de inteligência artificial que conecta o que ele vê com o que ele deve fazer, aprendeu a reconhecer a tarefa com base no ângulo exato da câmera original. No mundo real, câmeras são esbarradas, robôs se movem e a iluminação muda, portanto, um sistema que não consegue se adaptar a uma mudança de ponto de vista não é verdadeiramente útil. Pesquisadores tentaram resolver isso fornecendo aos robôs sensores mais complexos, como câmeras de profundidade que veem em 3D, ou ensinando-os a compreender a geometria da sala, mas essas soluções geralmente exigem hardware caro ou calibrações complexas que são difíceis de manter.

Uma equipe de pesquisadores da Universidade Tsinghua e da Universidade de Amsterdã encontrou uma maneira de tornar essas políticas robóticas robustas ao movimento da câmera sem adicionar novos sensores ou alterar como o robô opera no mundo real. Eles focaram em um tipo específico de controlador robótico que aprende ao prever um "fluxo" de ações, semelhante à forma como a água flui em direção a um destino, em vez de apenas adivinhar o próximo movimento. O cerne de sua descoberta é um método de treinamento que força o robô a concordar consigo mesmo. Eles criaram pares de imagens de treinamento mostrando exatamente a mesma cena física de dois ângulos diferentes: uma da posição original da câmera e outra de uma posição ligeiramente deslocada. Crucialmente, eles garantiram que o robô fosse instruído a realizar exatamente a mesma ação para ambas as imagens. Ao treinar o rob em prever o mesmo fluxo de movimento para ambos os visuais, eles o ensinaram a ignorar a mudança na posição da câmera e focar apenas na tarefa em questão.

Os pesquisadores testaram essa ideia em um ambiente simulado usando um benchmark chamado LIBERO-Plus, que foi projetado especificamente para verificar o quão bem os robôs lidam com deslocamentos de câmera. Eles compararam seu novo método com técnicas de treinamento padrão. Quando a câmera era movida, um robô treinado com métodos padrão tinha sucesso em apenas cerca de 17% das tentativas. Um robô treinado em muitos ângulos de câmera diferentes sem a sua regra especial de consistência melhorou para cerca de 75% de sucesso. No entanto, o robô treinado com a nova regra de consistência entre visões atingiu uma taxa de sucesso de 87,2%. Essa melhoria foi significativa e consistente em diferentes pontos iniciais aleatórios do treinamento. Os pesquisadores também provaram que o sucesso dependia inteiramente do fato de que as duas imagens mostravam o mesmo estado físico. Quando eles embaralharam os dados de treinamento para que o robô tentasse combinar uma visão de uma xícara com uma ação destinada a um estado diferente, o desempenho desabou para apenas 25,8%, mostrando que o robô não estava apenas suavizando suas respostas, mas estava verdadeiramente aprendendo a ligar diferentes visões da mesma realidade à mesma ação.

Para garantir que isso não fosse apenas um resultado da simulação computacional, a equipe levou seu método para um braço robótico real em um laboratório. Eles coletaram dados de treinamento usando três câmeras sincronizadas observando a mesma mesa, permitindo-lhes criar os pares de visões necessários a partir do mundo real. Eles então testaram o robô usando uma única câmera colocada em uma posição que ele nunca havia visto durante o treinamento. O robô treinado com o novo método obteve sucesso em 74,4% desses testes de câmera não vistos, enquanto o método padrão obteve sucesso em apenas 53,3%. A melhoria foi mais dramática em tarefas difíceis, como remover fones de ouvido de um suporte, onde o método padrão falhou completamente nas novas posições de câmera, mas o novo método obteve sucesso em quase metade das tentativas. O estudo confirma que, ao ensinar um robô a perceber a consistência de suas próprias ações através de diferentes ângulos, ele pode se tornar muito mais confiável no mundo real, tudo isso sem precisar de câmeras extras, sensores de profundidade ou mapas geométricos complexos. O robô simplesmente aprende que a tarefa permanece a mesma, mesmo que a imagem mude.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →