WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors
O artigo apresenta o WholeBodyWAM, um modelo de mundo-ação humanoide que aproveita um corpus de movimento heterogêneo de larga escala (UniMotion-4K) para pré-treinar um prior de movimento transferível, o qual aumenta significativamente a eficiência de dados e o desempenho de manipulação em tarefas subsequentes quando integrado com especialistas de vídeo e ação via atenção de Mistura de Transformers assimétrica.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Para fazer um robô que se mova como um humano, engenheiros enfrentam um problema fundamental: ensinar uma máquina a coordenar todo o seu corpo é incrivelmente difícil. Um humano não pensa em mover cada músculo individual ao alcançar uma xícara ou caminhar por uma sala; o corpo se move como uma unidade única e fluida. Para os robôs, no entanto, cada articulação e membro deve ser comandado separadamente, e coletar as milhões de horas de dados de prática necessárias para ensinar esse conhecimento específico a um robô determinado é lento, caro e, muitas vezes, impossível. Embora cientistas tenham construído modelos poderosos que podem entender a linguagem e ver o mundo, esses sistemas frequentemente lutam para prever como o próprio corpo de um robô se moverá no futuro, baseando-se, em vez disso, em reagir ao que está acontecendo agora. Essa limitação torna difícil para os robôs realizarem tarefas complexas que exigem planejamento prévio, como carregar uma caixa pesada enquanto navegam por um terreno irregular ou ajoelhar para pegar um objeto sem perder o equilíbrio.
Uma equipe de pesquisadores abordou esse desafio ensinando um robô a aprender com a vasta e gratuita biblioteca de movimento humano disponível na internet, em vez de depender apenas de demonstrações caras do próprio robô. Eles criaram um novo sistema chamado WHOLEBODYWAM, que atua como um motor preditivo para o corpo do robô. Em vez de apenas assistir a um vídeo e adivinhar o que fazer a seguir, este sistema aprende a física subjacente de como os corpos se movem ao longo do tempo. Foi treinado em uma coleção massiva de dados de movimento chamada UniMotion-4K, que inclui mais de 4.100 horas de movimentos registrados de vídeos humanos, conjuntos de dados especializados de captura de movimento 3D e outros robôs humanoides. Ao converter todas essas diferentes fontes em uma única linguagem compartilhada de movimento, o sistema aprendeu uma "intuição" geral de como um corpo deve transitar de uma pose para outra. Essa intuição foi então transferida para um robô humanoide real, permitindo que ele antecipe seus próprios movimentos futuros e execute tarefas complexas de corpo inteiro com muito mais habilidade e eficiência do que os métodos anteriores.
O cerne deste trabalho reside em um processo de treinamento de duas etapas que separa o aprendizado das regras gerais de movimento do aprendizado de como aplicá-las a uma máquina específica. Na primeira etapa, o sistema estudou o enorme conjunto de dados de movimento humano e robótico sem nunca ter visto um único exemplo dos comandos reais do robô alvo. Ele aprendeu a prever o que um corpo faria a seguir com base em uma descrição textual simples de uma tarefa, como "pegar o brinquedo" ou "ajoelhar". Isso criou uma base poderosa, um prior preditivo que entendia a dança coordenada de membros e o equilíbrio necessários para um movimento humano. Na segunda etapa, esse conhecimento pré-treinado foi combinado com um módulo de compreensão de vídeo e um gerador de ações. O sistema foi então mostrado um pequeno número de demonstrações do robô específico, o TianGong 3.0, para aprender a traduzir sua compreensão geral de movimento nos comandos motores específicos que as articulações desse robô precisam executar. Crucialmente, o sistema não apenas reage à cena atual; ele usa seu conhecimento aprendido para imaginar o estado futuro de seu próprio corpo, usando essa previsão para guiar suas ações em tempo real.
Quando testado em seis tarefas difíceis do mundo real, os resultados foram impressionantes. O robô foi solicitado a realizar ações como pegar brinquedos, carregar roupa em uma máquina de lavar, transferir um travesseiro para um sofá e carregar uma caixa para uma mesa. Essas tarefas exigiam que o robô se curvasse, caminhasse, se ajoelhasse e manipulasse objetos tudo ao mesmo tempo. O novo sistema superou os melhores métodos existentes, alcançando uma taxa de sucesso significativamente maior em todas as tarefas. Por exemplo, na tarefa de transferência de caixa, onde o robô tinha que levantar uma caixa, caminhar até uma mesa lateral e colocá-la no lugar, o novo sistema teve sucesso 73,3% das vezes, comparado a taxas muito menores para outras abordagens. Os pesquisadores descobriram que, quanto mais dados de movimento utilizavam para treinar o "especialista em movimento" inicial, melhor o robô performava, sugerindo que o sistema genuinamente aprendeu uma habilidade escalável, em vez de apenas memorizar exemplos específicos. Mais importante ainda, o sistema provou ser altamente eficiente com dados; quando os pesquisadores reduziram pela metade a quantidade de demonstrações do robô específico disponíveis para treinamento, o robô que havia sido pré-treinado no massivo conjunto de dados de movimento ainda apresentou um desempenho superior a outros robôs treinados com o conjunto completo de demonstrações.
Esta abordagem também demonstrou uma capacidade notável de lidar com mudanças no ambiente. Quando os pesquisadores moveram levemente o cesto alvo ou mudaram a cor e a forma dos brinquedos que o robô deveria pegar, o sistema se adaptou rapidamente, mantendo o alto desempenho onde outros modelos tiveram dificuldades. O sistema alcançou isso sem precisar gerar um vídeo do futuro, o que seria computacionalmente caro e lento. Em vez disso, ele previu as posições futuras de suas próprias articulações diretamente, permitindo que tomasse decisões em cerca de 363 milissegundos, uma velocidade rápida o suficiente para o controle em tempo real. O estudo confirma que, embora um robô não possa simplesmente copiar movimentos humanos porque seu corpo é diferente, ele pode aprender com os vastos padrões de movimento humano para desenvolver uma compreensão preditiva e robusta de como mover seu próprio corpo. Ao aproveitar a abundância de dados de movimento humano disponíveis no mundo, este método oferece um novo caminho para a criação de robôs humanoides que não são apenas capazes de tarefas complexas, mas que também podem aprendê-las com muito menos demonstrações do que o anteriormente pensado possível.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.