← Últimos artigos
💻 computer science

FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

O artigo apresenta o FetchMan, um pipeline de sim-to-real de ponta a ponta que supera as limitações de desempenho da clonagem de comportamento sintética ao refinar políticas com o aprendizado por reforço Flow-GRPO, permitindo que um humanoide Unitree G1 alcance 73,3% de sucesso zero-shot em tarefas de loco-manipulação através de cenas não vistas.

Autores originais: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

Publicado 2026-09-01
📖 4 min de leitura☕ Leitura rápida

Autores originais: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O sonho de um robô que possa entrar em uma sala, identificar um objeto específico e pegá-lo tem sido, há muito tempo, um objetivo central na robótica. Por décadas, pesquisadores lutaram para ensinar às máquinas esse tipo de comportamento complexo porque ele exige que dois tipos de habilidades difíceis trabalhem juntas ao mesmo tempo: mover o corpo pelo espaço e usar as mãos para interagir com o mundo. Embora os robôs tenham se tornado muito bons em caminhar por conta própria, adicionar a capacidade de alcançar e agarrar coisas enquanto se equilibram em duas pernas cria uma mistura caótica de física que é incrivelmente difícil de programar manualmente. Coletar os dados necessários para ensinar um robô dessa maneira também é um enorme obstáculo; ter um humano demonstrando cada maneira possível de caminhar até uma tigela e pegá-la em cada sala possível levaria anos e correria o risco de quebrar o robô. Para resolver isso, cientistas recorreram a simulações de computador, criando mundos digitais onde os robôs podem praticar milhões de vezes sem medo de danos. No entanto, uma grande questão permanecia: um robô treinado inteiramente em um mundo digital conseguiria realmente aprender a lidar com a realidade desordenada e imprevisível de uma casa real?

Uma equipe de pesquisadores da Universidade da Califórnia, Los Angeles, juntamente com colaboradores do Allen Institute for AI e da Universidade de Washington, abordou esse desafio com um novo sistema que chamam de FetchMan. O trabalho deles foca em um robô humanoide, o Unitree G1, que se parece e se move muito como uma pessoa. A equipe queria saber se poderiam ensinar este robô a navegar em uma sala e agarrar um objeto alvo apenas mostrando a ele milhares de exemplos em uma simulação de computador e, depois, fazer com que ele executasse a tarefa perfeitamente no mundo real sem qualquer treinamento adicional. Eles descobriram que simplesmente mostrar ao robô mais e mais exemplos da tarefa não era suficiente. Mesmo após o treinamento em mais de 150.000 cenas diferentes, o desempenho do robô atingiu um teto rígido. Ele conseguia imitar o professor digital, mas não conseguia aprender o tempo sutil necessário para transitar suavemente do caminhar para o alcançar. O robô frequentemente tentava agarrar o objeto cedo demais ou parava de caminhar cedo demais, falhando porque estava tentando copiar um professor que estava usando informações secretas que o robô não podia ver.

Para romper essa barreira, os pesquisadores adicionaram uma segunda etapa ao processo de treinamento. Em vez de apenas copiar o professor digital, eles deixaram o robô praticar por conta própria na simulação e o recompensaram apenas quando ele completava com sucesso toda a tarefa de caminhar até o objeto e pegá-lo. Este método, que utiliza uma técnica chamada aprendizado por reforço, permitiu que o robô descobrisse o tempo e o movimento corretos por conta própria. Ele aprendeu a caminhar mais perto do objeto antes de estender a mão, corrigindo os erros que cometia quando estava apenas imitando. Quando a equipe testou este robô refinado no mundo real, os resultados foram impressionantes. O robô, que nunca tinha visto uma sala real ou um objeto real durante seu treinamento, foi capaz de entrar em espaços desconhecidos, identificar uma tigela alvo e agarrá-la com uma taxa de sucesso superior a 73 por cento. Isso representou uma melhoria significativa em relação ao método de treinamento inicial, que conseguiu ter sucesso em cerca de 57 por cento das vezes nos testes no mundo real.

Os pesquisadores também exploraram se essa abordagem poderia funcionar para muitos tipos diferentes de objetos, não apenas tigelas. Eles treinaram uma versão do sistema para reconhecer e pegar itens como pães, garrafas e livros, dando ao robô o nome do objeto como uma pista. Embora essa versão multi-objeto não tenha sido tão bem-sucedida quanto a versão de objeto único, ela ainda conseguiu realizar a tarefa em uma variedade de situações, provando que o método pode ser escalonado. O estudo destaca que, embora copiar um professor seja um bom ponto de partida, não é suficiente para dominar tarefas físicas complexas. O robô precisa da liberdade para explorar e aprender com seus próprios sucessos e falhas para verdadeiramente entender como se mover pelo mundo. Ao combinar uma quantidade massiva de prática simulada com uma etapa final de autocorreção, a equipe mostrou um caminho claro para criar robôs que possam se adaptar a novos ambientes sem precisar que um humano segure sua mão em cada passo do caminho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →