Riemann-1.0: An Embodied World Action Model for Physical AI
O Riemann-1.0 é um Modelo de Ação de Mundo autorregressivo causal unificado que integra observações de múltiplas visões, estados de robôs e ações em um único framework, aproveitando uma estratégia de pré-treinamento progressivo em mais de 200.000 horas de dados incorporados diversos para alcançar o estado da arte em tarefas de manipulação de longo horizonte tanto em simulação quanto no mundo real.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A inteligência artificial tem sido, há muito tempo, uma mestra do reino digital, lendo textos, reconhecendo imagens e resolvendo quebra-cabeças dentro dos limites de uma tela de computador. Mas para que as máquinas realmente se juntem a nós no mundo físico, elas devem fazer mais do que apenas entender o que veem; elas devem aprender a agir dentro dele. Este é o desafio da inteligência incorporada: ensinar robôs a perceber seus arredores, raciocinar sobre causa e efeito e executar movimentos físicos com a mesma fluidez que um humano usa para pegar uma xícara ou dobrar uma camisa. Para que uma máquina tenha sucesso, ela precisa de um modelo do mundo que entenda não apenas como os objetos parecem, mas como eles se movem e mudam quando tocados. Ela deve aprender que empurrar um bloco faz com que ele deslize, e que levantar uma tampa revela o que está dentro. Até agora, criar um único sistema que pudesse tanto planejar essas ações físicas quanto prever as consequências visuais dessas ações era um obstáculo difícil, muitas vezes exigindo sistemas separados para pensar e para mover.
Uma equipe de pesquisadores introduziu um novo sistema chamado Riemann-1.0, projetado para preencher essa lacuna ao tratar as ações de um robô e as mudanças resultantes no mundo como uma história única e contínua. Em vez de construir ferramentas separadas para decidir o que fazer e ferramentas para imaginar o que acontecerá a seguir, este modelo aprende a fazer ambos ao mesmo tempo. Ele opera sob um princípio simples, mas poderoso: no mundo real, uma ação sempre acontece antes que o resultado seja visto. Se um robô alcança uma colher, o movimento ocorre primeiro, e a mudança visual — a colação da colher se movendo — segue-se. O Riemann-1.0 é construído para respeitar essa ordem, aprendendo a partir de uma coleção massiva de dados de vídeo e movimento para prever exatamente o que o robô deve fazer a seguir e como o mundo parecerá depois que ele o fizer.
Para ensinar este sistema, os pesquisadores reuniram uma vasta biblioteca de experiência, totalizando mais de 200.000 horas de interação. Esta coleção não era apenas um amontoado de vídeos de robôs; era uma mistura cuidadosamente selecionada de três tipos diferentes de material de aprendizagem. Primeiro, eles incluíram milhares de horas de vídeos gravados do ponto de vista de um humano, mostrando pessoas realizando tarefas cotidianas como cozinhar ou limpar. Esses vídeos forneceram uma compreensão ampla de como os objetos interagem e como as tarefas se desenrolam ao longo do tempo, embora carecessem dos dados mecânicos específicos de um robô. Segundo, eles adicionaram demonstrações de garras robóticas manuais e dispositivos vestíveis, que servem como uma ponte, mostrando como os movimentos das mãos humanas se traduzem em controles semelhantes aos de uma máquina. Finalmente, incluíram gravações precisas de movimentos reais de robôs, que forneceram as instruções exatas e executáveis necessárias para ensinar a máquina a mover seus próprios membros. Ao combinar essas fontes, os pesquisadores criaram um conjunto de dados unificado que permitiu ao modelo aprender com a sabedédoria ampla da experiência humana, enquanto fundamentava esse conhecimento na mecânica precisa do controle robótico.
O processo de treinamento para o Riemann-1.0 foi estruturado como um currículo escolar, movendo-se da observação geral para a execução específica. Na primeira fase, o modelo estudou a vasta biblioteca de vídeos humanos. Como esses vídeos não possuíam dados de movimento robótico, o sistema utilizou uma ferramenta auxiliar para estimar as "ações" invisíveis que devem ter causado as mudanças visuais vistas na tela. Isso permitiu que o modelo aprendesse a dinâmica básica de como o mundo se move sem precisar de dados perfeitos de robôs. Na segunda fase, o modelo foi introduzido aos dados mistos de mãos humanas e garras robóticas, aprendendo a alinhar sua compreensão de movimento com controles físicos reais. Finalmente, na terceira fase, o modelo concentrou-se exclusivamente em gravações de alta qualidade de robôs realizando tarefas. Esta fase final refinou sua habilidade de gerar comandos precisos e executáveis, garantindo que as ações que ele planejava fossem não apenas visualmente plausíveis, mas fisicamente possíveis para uma máquina real realizar.
Os resultados desta abordagem foram impressionantes. Quando testado em uma ampla variedade de tarefas, tanto em simulações de computador quanto em robôs reais, o Riemann-1.0 superou os métodos anteriores por uma margem significativa. Em uma simulação projetada para testar tarefas longas e complexas envolvendo muitos passos, o modelo teve sucesso em 62,6% das vezes, uma melhoria notável em relação aos melhores sistemas existentes. Em outra simulação focada em robôs de dois braços, ele alcançou uma taxa de sucesso de 94,3%. Talvez o mais impressionante seja que, quando implantado em robôs do mundo real para realizar tarefas como empilhar blocos coloridos, dobrar roupas, organizar uma mesa bagunçada ou organizar itens de cozinha, o sistema completou as tarefas com sucesso 85% das vezes. Também mostrou uma capacidade notável de se adaptar a novas situações que não havia visto antes, como colocar um Cubo Mágico em uma caixa ou colocar uma toalha em uma bacia, obtendo sucesso em 85% desses testes inéditos.
Além de simplesmente atuar como um controlador de robô, o Riemann-1.0 também pode funcionar como um simulador. Como ele entende o elo causal entre uma ação e o resultado visual, os pesquisadores podem pedir que ele imagine o que aconteceria se um robô realizasse um movimento específico. O modelo pode gerar um vídeo do futuro, mostrando exatamente como os objetos se moveriam e onde terminariam, com base na ação fornecida. Essa capacidade dupla significa que o sistema pode servir tanto como o cérebro que decide o que fazer quanto como a imaginação que verifica se o plano funcionará antes que o robô sequer se mova. Essa habilidade de prever o futuro do mundo físico, fundamentada na realidade de como as ações causam mudanças, representa um passo significativo para tornar a inteligência artificial uma parceira confiável no mundo físico. O trabalho sugere que, ao unificar o aprendizado de como agir com o aprendizado de como o mundo responde, as máquinas podem desenvolver uma compreensão mais robusta e generalizável das tarefas que realizamos todos os dias.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.