← Últimos artigos
🤖 machine learning

Motus2: A Self-Evolving General World Model for Dexterous Manipulation

O Motus2 é um modelo de mundo geral autoevolutivo para manipulação destreza que unifica política, simulação e avaliação em um ciclo fechado de decisão e aprendizado, aproveitando arquiteturas de modelos escalonados e conjuntos de dados multimodais progressivamente expandidos para permitir a melhoria contínua por meio de demonstrações de especialistas e dados de interação autogerados.

Autores originais: Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiab
Publicado 2026-09-01
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiabao Liu, Min Zhao, Fan Bao, Jun Zhu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Para construir um robô que possa realmente lidar com o mundo desordenado e imprevisível das tarefas humanas, cientistas há muito buscam um sistema que faça mais do que apenas seguir uma lista de instruções. O objetivo é criar uma máquina que possa perceber seus arredores, imaginar o que pode acontecer a seguir, realizar uma ação e, então, aprender com o resultado para fazer melhor na próxima vez. Esse conceito, conhecido como um "modelo de mundo", atua como um simulador interno para o robô. Em vez de apenas reagir ao que vê agora, o robô executa simulações mentais para adivinhar o resultado de seus movimentos antes mesmo de realizá-los de fato. Embora versões anteriores desses sistemas pudessem prever o futuro ou sugerir um movimento, elas frequentemente operavam em linha reta: ver, adivinhar, agir e parar. Elas careciam de uma maneira de olhar para trás para suas próprias previsões, julgar se eram boas ou ruins e usar esse julgamento para melhorar suas próprias habilidades de tomada de decisão sem precisar que um humano as mostrasse o caminho certo todas as vezes.

Uma equipe de pesquisadores introduziu agora um sistema chamado Motus2, um cérebro robótico autoevolutivo projetado especificamente para tarefas delicadas e complexas, como usar ferramentas ou manipular objetos com mãos humanas. Este sistema representa um passo significativo à frente porque fecha o ciclo entre pensar e aprender. Em vez de ser apenas um observador passivo ou um simples seguidor, o Motus2 atua como seu próprio professor. Ele propõe uma série de movimentos possíveis, simula como esses movimentos pareceriam no futuro e, então, avalia se esses resultados imaginados levariam ao sucesso. Se a simulação mostrar uma falha, o robô aprende com esse erro. Se mostrar sucesso, ele reforça esse caminho. Esse ciclo permite que o robô melhore sua própria política, ou seu conjunto de regras para agir, testando e refinando constantemente suas próprias ideias, mesmo quando não tem um humano para guiá-lo em cada etapa.

A base deste sistema é construída sobre uma quantidade massiva de dados coletados de mãos humanas. Os pesquisadores começaram ensinando o robô a entender como os humanos interagem com o mundo usando vídeos gravados de uma perspectiva de primeira pessoa, como se a câmera estivesse montada na cabeça da pessoa. Eles começaram com vídeos simples de lente única mostrando uma grande variedade de tarefas, desde cozinhar até organizar, e depois passaram para vídeos estéreo sincronizados mais avançados que fornecem uma sensação de profundidade, muito parecido com a visão binocular humana. Isso permitiu ao robô aprender a física sutil de como as mãos agarram, levantam e manipulam objetos. No entanto, apenas observar humanos não é suficiente para um robô com um corpo diferente. Os pesquisadores então guiaram o sistema através de um estágio intermediário de treinamento onde ele aprendeu a traduzir esses movimentos humanos para a mecânica específica de seus próprios braços e mãos robóticos. Esse processo envolveu mostrar ao robô milhares de horas de dados humanos, seguido por exemplos específicos de como humanos e robôs podem trabalhar juntos, efetivamente preenchendo a lacuna entre a intuição humana e a execução robótica.

O que torna o Motus2 único é como ele usa esse conhecimento. O sistema é construído em torno de um modelo único e unificado que usa três chapéus diferentes simultaneamente. Primeiro, ele atua como uma política, sugerindo qual ação tomar a seguir. Segundo, ele atua como um simulador, prevendo como o mundo será após essa ação ser tomada. Terceiro, ele atua como um avaliador, julgando se esse futuro previsto é bom ou ruim. Em sistemas tradicionais, essas funções são frequentemente separadas ou desconectadas, mas aqui elas estão intimamente entrelaçadas. Quando o robô considera um movimento, ele executa instantaneamente uma simulação mental para ver as consequências. Ele então se pergunta se essa consequência é desejável. Se a resposta for não, ele descarta esse caminho e tenta outro. Se a resposta for sim, ele se compromete com a ação. Esse diálogo interno acontece tão rapidamente que o robô pode planejar vários passos à frente, escolhendo o melhor caminho antes mesmo de mover um músculo.

Os pesquisadores testaram este sistema em uma plataforma totalmente robótica equipada com dois braços, duas mãos destras e sensores que podem sentir o toque, semelhantes às pontas dos dedos humanos. Eles desafiaram o robô com uma série de tarefas difíceis, como colocar uma bola em um local específico, parafusar uma lâmpada em um soquete ou prender uma borracha a uma caneta. Nesses testes, a capacidade do robô de aprender com suas próprias simulações provou ser crucial. Quando o sistema foi permitido usar seu avaliador interno para selecionar as melhores opções durante uma tarefa, sua taxa de sucesso melhorou significativamente. Ainda mais impressionante, quando o sistema foi permitido usar suas próprias previsões para atualizar suas próprias regras de aprendizado, ele tornou-se ainda melhor na tarefa. O robô não teve apenas sorte; ele genuinamente aprendeu a evitar erros que simulou e a repetir ações que simulou serem bem-sucedidas.

Uma parte fundamental desse sucesso foi a capacidade do robô de lembrar o que aconteceu anteriormente em uma tarefa, mesmo que essa informação estivesse temporariamente oculta da visão. Em muitos trabalhos complexos, uma mão pode bloquear a visão de um objeto, ou uma etapa crítica pode acontecer muito antes do resultado final ser visto. Para lidar com isso, os pesquisadores deram ao robô uma forma de memória de trabalho que poderia manter detalhes visuais importantes do passado. Eles testaram diferentes maneiras de gerenciar essa memória, desde manter uma janela curta e rotativa de eventos recentes até manter um histórico mais longo e detalhado. Os resultados mostraram que ter acesso a esse histórico mais longo permitiu ao robô resolver tarefas que exigiam lembrar de uma sequência de eventos ao longo de um período mais longo, provando que a capacidade de recordar o passado é tão importante quanto prever o futuro.

O sistema também incorporou um módulo especializado para o tato. Embora a visão seja poderosa, ela nem sempre pode dizer se uma pegada está escorregando ou se uma superfície é muito macia. O robô foi equipado com um sistema especialista leve dedicado a processar o feedback tátil. Isso permitiu que ele refinasse seus movimentos em tempo real, ajustando sua pegada no momento em que sentisse um deslizamento ou uma mudança de pressão. Essa combinação de ver, sentir, pensar e aprender criou um sistema robusto capaz de lidar com a incerteza do mundo real.

As descobertas sugerem que o caminho para robôs verdadeiramente capazes reside não apenas na coleta de mais dados, mas na construção de sistemas que possam questionar e melhorar a si mesmos usando esses dados. Ao combinar dados de interação humana em larga escala com um loop de autocorreção de previsão e avaliação, o Motus2 demonstrou que os robôs podem aprender a manipular o mundo físico com um nível de adaptabilidade que era anteriormente inalcançável. Os pesquisadores descobriram que, conforme aumentavam a quantidade de dados de vídeo estéreo usados para o treinamento, a capacidade do robô de prever ações humanas melhorava de uma forma consistente e previsível. Essa escalabilidade sugere que, com ainda mais dados, esses sistemas poderiam se tornar ainda mais proficientes. Em última análise, o trabalho mostra que um robô não precisa ser programado com todas as soluções possíveis para todos os problemas possíveis. Em vez disso, se ele puder simular o futuro, julgar o resultado e aprender com a diferença, ele pode evoluir suas próprias habilidades para enfrentar os desafios de um mundo complexo e destre.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →