← Últimos artigos
💻 computer science

GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation

O GE-Act 2.0 é um novo modelo de mundo-ação treinado do zero em dados de manipulação que integra um autoencoder orientado ao controle, um planejador visual de etapa única e um modelo de dinâmica inversa com otimização seletiva alinhada ao conhecimento, alcançando um sucesso zero-shot significativo através de diversas tarefas e corporificações por meio de escalonamento extensivo e transferência entre diferentes corporificações.

Autores originais: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xion
Publicado 2026-09-09
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xiong, Linqing Zhong, Yifei Wei, Feng Han, Long Zhang, Da Huang, Nanshu Zhao, Chenghao Yin, Mo Wu, Zhaodong Yan, Kongtao Hu, Yuxiang Yan, Aogelijiang Niyazi, Yu Fang, Jia Zeng, Lizhu Meng, Daizhen Lv, Haoyu Cao, Zhiwen Hou, Lianjin Ye, Yuehan Niu, Zhikai Cai, Xuan Hu, Hui Min, Xiongfeng Cai, Yue Liao, Jing Wu, Soujanya Poria, Ye Li, Sanping Zhou, Maoqing Yao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os robôs há muito tempo são mestres no chão de fábrica, repetindo o mesmo movimento preciso milhares de vezes sem erro. Mas coloque-os em uma cozinha, em uma sala de estar ou em uma oficina desordenada, e eles frequentemente travam. O desafio não é apenas mover uma mão; é entender como o mundo muda quando essa mão toca algo. Para navegar por isso, uma nova geração de inteligência artificial está aprendendo a imaginar o futuro. Em vez de simplesmente reagir ao que vê agora, esses sistemas tentam prever o que acontecerá a seguir se tomarem uma ação específica. Essa abordagem, conhecida como um modelo de mundo-ação, permite que um robô simule uma sequência de eventos em sua mente antes de mover um músculo, verificando se o resultado corresponde ao seu objetivo. Por anos, pesquisadores tentaram construir esses sistemas pegando geradores de vídeo existentes — programas treinados para criar filmes falsos — e forçando-os a entender movimentos robóticos. No entanto, esse método frequentemente deixa o robô com uma compreensão vaga da física, pois o gerador de vídeo nunca foi verdadeiramente projetado para controlar um corpo físico.

Uma equipe da AgiBot introduziu agora uma abordagem diferente, uma que constró a imaginação do robô desde o zero usando apenas dados de interação do mundo real. Eles criaram um sistema chamado GE-Act 2.0, que aprende a prever o futuro e decidir ações simultaneamente, mas com uma reviravolta crucial: cada parte do sistema é treinada do zero com dados coletados de robôs e humanos manipulando objetos. Os pesquisadores não dependeram de modelos de vídeo pré-fabricados. Em vez disso, ensinaram ao sistema uma linguagem comprimida de movimento, uma forma de ver o mundo que remove detalhes desnecessários para focar no que importa para o controle. Isso permitiu que o robô aprendesse com uma biblioteca vasta e variada de dados, incluindo horas de demonstrações bem-sucedidas, tentativas falhas e até vídeos de humanos trabalhando sem quaisquer instruções registradas. Ao combinar esses diferentes tipos de aprendizagem, o sistema aprendeu a generalizar, o que significa que ele podia aplicar o que aprendeu em uma situação a uma situação completamente nova que nunca tinha visto antes.

O cerne desta conquista reside em como os pesquisadores lidaram com a realidade caótica do mundo físico. Quando um robô tenta aprender, ele frequentemente enfrenta um problema confuso: a mesma instrução pode ser concluída de muitas maneiras diferentes. Um robô pode ser instruído a "pegar a xícara vermelha" e pode se aproximar pela esquerda, pela direita, ou agarrá-la pela alça ou pela borda. Se os dados de treinamento mostram apenas uma maneira, mas a imaginação do robô prevê outra, as duas partes do sistema podem ficar dessincronizadas. Os pesquisadores identificaram esse descompasso como um "gap de validade", onde a previsão do futuro do robô não se alinha com a ação que ele deve realizar. Para corrigir isso, eles desenvolveram um processo de seleção que atua como um filtro. Antes que o robô aprenda com um futuro previsto, ele verifica se esse futuro é compatível com a ação que ele precisa realizar. Ele gera vários futuros possíveis, testa-os contra a ação necessária e aprende apenas com aqueles que fazem sentido juntos. Isso garante que o robô não confunda sua compreensão de como diferentes ações levam a diferentes resultados.

Os resultados deste treinamento são impressionantes, particularmente quando testados em tarefas que o robô nunca praticou. Os pesquisadores avaliaram o sistema em cem tarefas de manipulação distintas, variando de empilhar blocos e despejar líquidos a dobrar toalhas e inserir plugues. Esses testes foram conduzidos em robôs reais em ambientes com diferentes iluminações, fundos e arranjos de objetos do que os usados durante o treinamento. Quando o sistema foi treinado em um pequeno conjunto de dados de 300 horas, obteve sucesso em apenas 17,1% das tarefas em um modelo de robô. No entanto, conforme os pesquisadores aumentaram a escala dos dados de treinamento para 30.000 horas, a taxa de sucesso subiu constantemente para 44,1%. Essa melhoria aconteceu sem qualquer ajuste fino específico para as tarefas individuais; o robô simplesmente aplicou as habilidades gerais que havia aprendido aos novos desafios. Ainda mais surpreendente, o sistema mostrou fortes habilidades em um segundo modelo de robô diferente, que representava menos de 2% dos dados de treinamento, sugerindo que as habilidades aprendidas do conjunto de dados maior foram transferidas efetivamente para uma nova forma física.

A capacidade do sistema de seguir instruções também foi testada sob condições difíceis. Em muitos ensaios, o robô foi solicitado a realizar uma ação que poderia entrar em conflito com o que ele poderia esperar com base na cena ou em um hábito anterior. Por exemplo, se um robô estivesse no meio de um movimento, ele ainda poderia parar e seguir um novo comando explícito para mudar seu caminho. Em mais de 90% desses ensaios, o robô identificou corretamente o objeto específico, cor, forma ou posição mencionada na instrução, mesmo quando esses detalhes eram sutis ou o contexto era confuso. Os pesquisadores encontraram uma forte ligação entre a variedade de habilidades que o robô aprendeu durante o treinamento e sua capacidade de ter sucesso em novas tarefas. Quanto mais diversos eram os dados de treinamento, mais provável era que o robô lidasse com uma situação inédita. Isso sugere que o caminho para robôs mais capazes não reside apenas em melhores algoritmos, mas no volume e na variedade pura dos dados que eles consomem.

Este trabalho marca um passo significativo em direção a robôs que podem aprender com os mesmos dados ricos e não estruturados que os humanos usam para entender o mundo. Ao construir um sistema que prevê o futuro e planeja ações de uma forma unificada, e ao ensinar o sistema a selecionar a previsão correta entre muitas possibilidades, os pesquisadores criaram um modelo que é robusto e adaptável. As descobertas sugerem que, com experiência diversificada suficiente, um robô pode desenvolver uma compreensão profunda e intuitiva de como os objetos se comportam e de como interagir com eles, indo além da programação rígida em direção a uma forma de inteligência mais flexível. O sucesso desta abordagem em hardware real, sem a necessidade de retreinar para cada novo trabalho, aponta para um futuro onde os robôs podem ser implantados em ambientes dinâmicos e imprevisíveis e aprender a prosperar neles.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →