← Últimos artigos
💻 computer science

OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

Este artigo apresenta o OpenWAM, uma pilha de pesquisa aberta e modular que investiga sistematicamente o pré-treinamento de Modelos de Mundo-Ação por meio de experimentos controlados para derivar princípios de design fundamentais, culminando no lançamento do modelo de alto desempenho OpenWAM-α\alpha, treinado em 6.400 horas de dados incorporados diversos.

Autores originais: Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu
Publicado 2026-09-09
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu, Zijie Zhu, Ning Gao, Xiaowei Chi, Guanqi He, Shanghang Zhang, Hao Dong, Lin Shao, Hang Zhao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A inteligência não se trata apenas de ver o mundo; trata-se de saber como mudá-lo. Durante décadas, cientistas construíram sistemas de computador que podem reconhecer objetos em uma fotografia ou descrever uma cena em uma frase. Mais recentemente, criaram modelos que podem imaginar como uma cena pode evoluir ao longo do tempo, prevendo o próximo quadro de um vídeo com base no anterior. Esses sistemas aprendem a física do mundo — como um copo cai, como uma porta balança — ao observar vastas quantidades de vídeo. No entanto, existe uma lacuna entre observar o mundo e agir dentro dele. Um robô precisa de mais do que apenas uma previsão do que acontecerá; ele precisa saber quais movimentos específicos farão com que essa previsão se torne realidade. Este é o desafio do aprendizado incorporado (embodied learning): construir a ponte entre a compreensão de um futuro visual e a geração das ações físicas para alcançá-lo.

Uma equipe de pesquisadores introduziu uma nova abordagem chamada OpenWAM para resolver este problema. Em vez de construir um cére-robô único e rígido, que é difícil de mudar ou compreender, eles criaram um sistema aberto e modular que trata o design de um controlador de robô como um conjunto de peças intercambiáveis. Eles dividiram a tarefa complexa de ensinar um robô a agir em três perguntas distintas: que conhecimento o robô deve herdar ao assistir vídeos, como o entendimento do robô sobre o mundo e sua capacidade de se mover devem trabalhar juntos e como esse aprendizado pode ser escalonado para diferentes tipos de robôs e ambientes? Ao responder a essas perguntas por meio de experimentos controlados, eles destilaram um conjunto de princípios que levaram à criação do OpenWAM-α, um novo e poderoso modelo que pode aprender a manipular objetos tanto em ambientes simulados quanto no mundo real.

Os pesquisadores começaram perguntando que tipo de "conhecimento de mundo" um robô deveria ter inicialmente. Eles testaram se o robô deveria aprender a partir de um gerador de vídeo massivo que viu milhões de horas de filmagens ou se deveria confiar em um codificador visual mais simples. Eles descobriram que os melhores resultados vieram do uso de um grande gerador de vídeo pré-treinado como base. Este modelo já entende como os objetos se movem e interagem, proporcionando um ponto de partida rico. No entanto, simplesmente anexar um braço robótico a este modelo de vídeo não foi suficiente. Os pesquisadores descobriram que o robô também precisava de uma forma compacta e eficiente de representar o que vê. Eles testaram vários métodos para comprimir a informação visual em uma forma menor e mais gerenciável, descobrindo que um tipo específico de compressão, que mantinha os detalhes essenciais do mundo enquanto descartava o ruído, funcionava melhor. Isso permitiu que o robô se concentrasse nas partes importantes de uma cena sem ficar sobrecarregado por dados.

Em seguida, a equipe investigou como o "cérebro" do robô deveria ser estruturado para conectar seu entendimento do mundo com sua capacidade de se mover. Eles compararam diferentes designs arquitetônicos, variando de modelos onde o vídeo e a ação eram completamente separados até aqueles onde estavam profundamente entrelaçados. Seus experimentos mostraram que o design mais eficaz era uma abordagem de sistema duplo. Nesta configuração, uma parte do modelo foca em prever o estado visual futuro do mundo, enquanto uma parte dedicada foca em gerar a sequência de movimentos. Crucialmente, essas duas partes podiam conversar constantemente uma com a outra. O gerador de ação podia olhar para o futuro previsto para decidir o que fazer, e o preditor de mundo podia usar as ações planejadas para refinar sua visão do que aconteceria a seguir. Essa conversa constante e de duas vias permitiu que o modelo aprendesse uma verdadeira sinergia entre ver e agir, em vez de apenas aprendê-los lado a lado.

Os pesquisadores também exploraram como treinar esses modelos usando diferentes tipos de dados. Eles tinham acesso a duas fontes principais: vídeos de humanos realizando tarefas sob uma perspectiva de primeira pessoa, que ofereciam uma grande variedade de cenas visuais, mas nenhum dado de ação robótica, e gravações de robôs reais realizando tarefas, que forneciam instruções de movimento precisas, mas cobriam menos tipos de cenas. Eles testaram se era melhor treinar apenas com dados de robôs, apenas com dados humanos ou uma mistura de ambos. Descobriram que combinar as duas fontes em uma única sessão de treinamento era a estratégia mais poderosa. Os vídeos humanos ensinaram o modelo sobre a ampla diversidade do mundo, enquanto os dados de robôs ancoraram esse conhecimento na realidade física. Essa combinação permitiu que o modelo generalizasse muito melhor para novas situações não vistas do que se tivesse sido treinado em apenas um tipo de dado.

Usando esses princípios, a equipe construiu o OpenWAM-α, um modelo treinado em mais de 500 milhões de quadros de vídeo e dados de robôs. Eles testaram este modelo através de oito diferentes benchmarks de simulação e em robôs reais com braços únicos, dois braços e até mãos destras. Os resultados foram consistentes e impressionantes. Nas simulações, o modelo apresentou um nível de desempenho elevado em uma ampla gama de tarefas, desde empilhar blocos até manipular objetos complexos. Quando movido para o mundo real, manteve esse alto desempenho, completando com sucesso tarefas em robôs físicos que nunca havia visto antes. O modelo mostrou uma força particular em se adaptar a novos ambientes, sugerindo que a combinação do conhecimento de mundo baseado em vídeo e o ancoramento baseado em ação criou uma base robusta para a inteligência geral.

Uma das descobertas mais significativas foi como essa abordagem se comparou a outros métodos populares. Alguns sistemas dependem fortemente de linguagem e compreensão visual, mas não modelam explicitamente o futuro, enquanto outros focam puramente na mecânica do movimento. Os pesquisadores descobriram que sua abordagem baseada em vídeo se destacava ao ajustar os dados de treinamento e ao desempenhar bem em cenários familiares, enquanto outros métodos às vezes generalizavam melhor para ambientes completamente novos e caóticos. No entanto, eles concluíram que nenhum dos dois métodos era perfeito por si só. A chave para o progresso futuro reside em combinar as forças de ambos: usar os ricos vieses visuais e físicos da geração de vídeo para guiar a ação, garantindo que o sistema seja treinado em dados diversos e de alta qualidade que cubram toda a gama de desafios do mundo real.

O projeto OpenWAM faz mais do que apenas apresentar um novo controlador de robô; ele fornece um kit de ferramentas completo para a comunidade científica. Ao liberar a infraestrutura, os dados de treinamento e os protocolos de avaliação, os pesquisadores transformaram o desenvolvimento de modelos de mundo-ação em uma ciência transparente e reproduzível. Isso permite que outros cientistas testem ideias específicas, substituam componentes e entendam exatamente por que certos designs funcionam melhor do que outros. O trabalho sugere que o caminho para robôs mais capazes não é através da construção de sistemas maiores e mais opacos, mas através da compreensão cuidadosa de como diferentes partes do conhecimento e do aprendizado interagem. Ao tratar a mente do robô como uma coleção de partes compostáveis, os pesquisadores abriram as portas para uma nova era de exploração sistemática na inteligência artificial, onde cada escolha de design pode ser testada, medida e aprimorada.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →