GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation
O GE-Act 2.0 é um novo modelo de mundo-ação treinado do zero em dados de manipulação que integra um autoencoder orientado ao controle, um planejador visual de etapa única e um modelo de dinâmica inversa com otimização seletiva alinhada ao conhecimento, alcançando um sucesso zero-shot significativo através de diversas tarefas e corporificações por meio de escalonamento extensivo e transferência entre diferentes corporificações.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Os robôs há muito tempo são mestres no chão de fábrica, repetindo o mesmo movimento preciso milhares de vezes sem erro. Mas coloque-os em uma cozinha, em uma sala de estar ou em uma oficina desordenada, e eles frequentemente travam. O desafio não é apenas mover uma mão; é entender como o mundo muda quando essa mão toca algo. Para navegar por isso, uma nova geração de inteligência artificial está aprendendo a imaginar o futuro. Em vez de simplesmente reagir ao que vê agora, esses sistemas tentam prever o que acontecerá a seguir se tomarem uma ação específica. Essa abordagem, conhecida como um modelo de mundo-ação, permite que um robô simule uma sequência de eventos em sua mente antes de mover um músculo, verificando se o resultado corresponde ao seu objetivo. Por anos, pesquisadores tentaram construir esses sistemas pegando geradores de vídeo existentes — programas treinados para criar filmes falsos — e forçando-os a entender movimentos robóticos. No entanto, esse método frequentemente deixa o robô com uma compreensão vaga da física, pois o gerador de vídeo nunca foi verdadeiramente projetado para controlar um corpo físico.
Uma equipe da AgiBot introduziu agora uma abordagem diferente, uma que constró a imaginação do robô desde o zero usando apenas dados de interação do mundo real. Eles criaram um sistema chamado GE-Act 2.0, que aprende a prever o futuro e decidir ações simultaneamente, mas com uma reviravolta crucial: cada parte do sistema é treinada do zero com dados coletados de robôs e humanos manipulando objetos. Os pesquisadores não dependeram de modelos de vídeo pré-fabricados. Em vez disso, ensinaram ao sistema uma linguagem comprimida de movimento, uma forma de ver o mundo que remove detalhes desnecessários para focar no que importa para o controle. Isso permitiu que o robô aprendesse com uma biblioteca vasta e variada de dados, incluindo horas de demonstrações bem-sucedidas, tentativas falhas e até vídeos de humanos trabalhando sem quaisquer instruções registradas. Ao combinar esses diferentes tipos de aprendizagem, o sistema aprendeu a generalizar, o que significa que ele podia aplicar o que aprendeu em uma situação a uma situação completamente nova que nunca tinha visto antes.
O cerne desta conquista reside em como os pesquisadores lidaram com a realidade caótica do mundo físico. Quando um robô tenta aprender, ele frequentemente enfrenta um problema confuso: a mesma instrução pode ser concluída de muitas maneiras diferentes. Um robô pode ser instruído a "pegar a xícara vermelha" e pode se aproximar pela esquerda, pela direita, ou agarrá-la pela alça ou pela borda. Se os dados de treinamento mostram apenas uma maneira, mas a imaginação do robô prevê outra, as duas partes do sistema podem ficar dessincronizadas. Os pesquisadores identificaram esse descompasso como um "gap de validade", onde a previsão do futuro do robô não se alinha com a ação que ele deve realizar. Para corrigir isso, eles desenvolveram um processo de seleção que atua como um filtro. Antes que o robô aprenda com um futuro previsto, ele verifica se esse futuro é compatível com a ação que ele precisa realizar. Ele gera vários futuros possíveis, testa-os contra a ação necessária e aprende apenas com aqueles que fazem sentido juntos. Isso garante que o robô não confunda sua compreensão de como diferentes ações levam a diferentes resultados.
Os resultados deste treinamento são impressionantes, particularmente quando testados em tarefas que o robô nunca praticou. Os pesquisadores avaliaram o sistema em cem tarefas de manipulação distintas, variando de empilhar blocos e despejar líquidos a dobrar toalhas e inserir plugues. Esses testes foram conduzidos em robôs reais em ambientes com diferentes iluminações, fundos e arranjos de objetos do que os usados durante o treinamento. Quando o sistema foi treinado em um pequeno conjunto de dados de 300 horas, obteve sucesso em apenas 17,1% das tarefas em um modelo de robô. No entanto, conforme os pesquisadores aumentaram a escala dos dados de treinamento para 30.000 horas, a taxa de sucesso subiu constantemente para 44,1%. Essa melhoria aconteceu sem qualquer ajuste fino específico para as tarefas individuais; o robô simplesmente aplicou as habilidades gerais que havia aprendido aos novos desafios. Ainda mais surpreendente, o sistema mostrou fortes habilidades em um segundo modelo de robô diferente, que representava menos de 2% dos dados de treinamento, sugerindo que as habilidades aprendidas do conjunto de dados maior foram transferidas efetivamente para uma nova forma física.
A capacidade do sistema de seguir instruções também foi testada sob condições difíceis. Em muitos ensaios, o robô foi solicitado a realizar uma ação que poderia entrar em conflito com o que ele poderia esperar com base na cena ou em um hábito anterior. Por exemplo, se um robô estivesse no meio de um movimento, ele ainda poderia parar e seguir um novo comando explícito para mudar seu caminho. Em mais de 90% desses ensaios, o robô identificou corretamente o objeto específico, cor, forma ou posição mencionada na instrução, mesmo quando esses detalhes eram sutis ou o contexto era confuso. Os pesquisadores encontraram uma forte ligação entre a variedade de habilidades que o robô aprendeu durante o treinamento e sua capacidade de ter sucesso em novas tarefas. Quanto mais diversos eram os dados de treinamento, mais provável era que o robô lidasse com uma situação inédita. Isso sugere que o caminho para robôs mais capazes não reside apenas em melhores algoritmos, mas no volume e na variedade pura dos dados que eles consomem.
Este trabalho marca um passo significativo em direção a robôs que podem aprender com os mesmos dados ricos e não estruturados que os humanos usam para entender o mundo. Ao construir um sistema que prevê o futuro e planeja ações de uma forma unificada, e ao ensinar o sistema a selecionar a previsão correta entre muitas possibilidades, os pesquisadores criaram um modelo que é robusto e adaptável. As descobertas sugerem que, com experiência diversificada suficiente, um robô pode desenvolver uma compreensão profunda e intuitiva de como os objetos se comportam e de como interagir com eles, indo além da programação rígida em direção a uma forma de inteligência mais flexível. O sucesso desta abordagem em hardware real, sem a necessidade de retreinar para cada novo trabalho, aponta para um futuro onde os robôs podem ser implantados em ambientes dinâmicos e imprevisíveis e aprender a prosperar neles.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.