← Últimos artigos
💻 computer science

AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization

O artigo apresenta o AnyWorld, um framework de modelagem de mundo fatorizado que sintetiza experiências robóticas diversas e cross-embodiment a partir de vídeos egocêntricos humanos únicos, ao desacoplar os fatores de ação, câmera e embodiment, permitindo assim a geração de dados controlável que melhora significativamente as políticas de manipulação em robôs humanoides tanto simulados quanto reais.

Autores originais: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

Publicado 2026-09-02
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os robôs estão aprendendo a fazer mais do que apenas se mover em linha reta; eles estão aprendendo a manipular o mundo ao seu redor, pegando objetos, abrindo portas e montando peças. Para aprender essas habilidades, um robô precisa de experiência. Ele deve ver milhares de exemplos de como uma mão alcança uma xícara, como uma pinça aperta uma esponja e como uma ferramenta desliza sobre uma mesa. Por muito tempo, a única maneira de obter essa experiência era fazer o robô realizar a tarefa por si mesmo, repetidas vezes. Isso é lento, caro e limitado pelo número de robôs que um laboratório pode se dar ao luxo de construir e pelas horas que podem operar sem quebrar.

Uma alternativa promissora surgiu de uma fonte inesperada: vídeos humanos. Todos os dias, as pessoas gravam a si mesmas cozinhando, limpando e construindo coisas. Esses vídeos são repletos de interações físicas ricas das quais os robôs poderiam aprender. No entanto, há um grande problema. Um vídeo de um humano cozinhando mostra uma mão humana, um corpo humano e o ponto de vista de um humano. Um robô não possui um corpo humano e não vê o mundo a partir de uma cabeça humana. Se um robô tentar copiar um vídeo humano diretamente, ele pode falhar porque o braço do humano é mais longo, a câmera do robô está em um lugar diferente ou o gripper do robô funciona de forma diferente. O desafio para os cientistas é descobrir como pegar a "história" útil do que está acontecendo em um vídeo humano e recontá-la de uma forma que faça sentido para um robô.

Uma equipe de pesquisadores desenvolveu um novo sistema chamado AnyWorld para resolver esse problema. Em vez de tentar copiar um vídeo humano exatamente, o sistema decompõe o vídeo em três ingredientes separados: a ação sendo realizada, a maneira como a câmera se move e o corpo e a cena realizando o trabalho. Pense na ação como o roteiro do que está acontecendo, o movimento da câmera como a direção da cena e o corpo e a cena como os atores e o cenário. Ao separar esses elementos, os pesquisadores podem pegar um único vídeo de um humano realizando uma tarefa e recombinar esses ingredientes para criar um vídeo totalmente novo. Neste novo vídeo, o "ator" é um robô, o "cenário" é o ambiente de um robô e a "câmera" é o olho de um robô, mas o "roteiro" da ação permanece o mesmo.

Os pesquisadores treinaram seu sistema usando uma vasta coleção de vídeos humanos onde pessoas interagiam com objetos. Eles ensinaram o modelo a entender a diferença entre o movimento da tarefa e o corpo específico que a realiza. Uma vez que o modelo aprendeu isso, eles o testaram alimentando-o com um vídeo humano e pedindo que gerasse uma versão daquela mesma tarefa realizada por um robô. Eles não precisaram de nenhum vídeo que mostrasse um humano e um robô realizando a mesma tarefa lado a lado. O sistema simplesmente pegou os movimentos do humano e o caminho da câmera, e então substituiu por um corpo de robô e uma cena de robô. O resultado foi um vídeo que parecia um robô realizando a tarefa, completo com a perspectiva e as restrições físicas daquela máquina específica.

A equipe testou essa capacidade de alterar o corpo, o ângulo da câmera e a cena. Eles mostraram que o sistema poderia pegar um vídeo humano e gerar uma versão onde um robô chamado RoboCasa GR1 realizava a tarefa, e outra versão onde um robô diferente chamado IRON a realizava. Eles também mostraram que poderiam manter o robô e a tarefa iguais, mas mudar o ângulo da câmera, criando uma visão a partir de uma perspectiva diferente. Crucialmente, o sistema preservou a lógica da interação. Se um humano no vídeo original pegou uma xícara e a moveu para uma prateleira, o vídeo do robô gerado mostrou o robô fazendo exatamente a mesma sequência de movimentos, apenas adaptada ao seu próprio formato de corpo e posição de câmera.

Para provar que esses vídeos gerados eram realmente úteis, os pesquisadores os usaram para treinar robôs reais. Eles pegaram um sistema padrão de aprendizado de robôs e deram a ele treinamento extra usando os vídeos criados pelo AnyWorld. Eles testaram isso em uma simulação de um braço robótico e em um robô humanoide físico real. Na simulação, a taxa de sucesso do robô em pegar e colocar objetos melhorou significamente após o treinamento com os dados gerados. No robô real, a melhoria foi ainda mais dramática. Um robô que era capaz de agarrar uma banana com sucesso em apenas 20 por cento das tentativas saltou para uma taxa de sucesso de 55 por cento após ser treinado com os vídeos de humano para robô. Isso mostrou que o sistema não estava apenas criando imagens bonitas; estava criando dados de treinamento válidos que ajudavam o robô a aprender melhor.

Os pesquisadores também investigaram exatamente por que isso funcionou. Eles queriam saber se simplesmente dizer ao robô qual ação tomar era suficiente, ou se ver a cena visual também era necessário. Eles realizaram um teste onde deram ao robô os comandos de ação corretos, mas mantiveram os dados visuais de treinamento do vídeo original não modificado do robô. Essa abordagem falhou em ensinar o robô a seguir instruções específicas, como escolher a banana da esquerda em vez da direita. No entanto, quando usaram o sistema completo para gerar tanto a nova cena visual quanto a ação correta, o robô aprendeu a seguir as instruções de forma confiável. Isso provou que a recomposição visual era essencial. O robô precisava ver o mundo a partir de sua própria perspectiva para entender como aplicar a ação.

O estudo sugere que este método de decompor interações em fatores separados permite que uma única experiência humana seja reutilizada muitas vezes. Um vídeo humano que antes era limitado a um corpo humano e uma câmera humana pode se tornar uma fonte de dados de treinamento para muitos tipos diferentes de robôs, em muitos ambientes diferentes. Os pesquisadores observaram que, embora o sistema seja poderoso, ele tem limites. Ele ainda não consegue capturar a sensação do toque ou a força exata necessária para apertar um objeto macio, pois isso requer sensores físicos que a geração de vídeo não fornece. Além disso, o sistema depende da capacidade de rastrear os movimentos humanos claramente; se o vídeo for muito instável ou se a pessoa estiver escondida atrás de um objeto, o sistema terá dificuldades.

Apesar dessas limitações, este trabalho oferece um novo caminho para o aprendizado de robôs. Sugere que a vasta biblioteca de vídeos humanos na internet, que tem sido difícil de usar para robôs devido às diferenças de corpos e pontos de vista, pode agora ser explorada. Ao usar um modelo que entende como separar a ação do ator, os cientistas podem transformar experiências humanas em experiências robóticas sem a necessidade de gravar cada tarefa com cada robô. Isso poderia permitir que os robôs aprendam habilidades complexas muito mais rápido, usando a abundante base de dados da vida cotidiana humana como fundamento para suas próprias capacidades.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →