← Últimos artigos
🤖 AI

CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators

O CLAP é um novo framework que possibilita a simulação física zero-shot através de diversas formas corporais de robôs e humanos ao treinar em vídeos heterogêneos de escala de internet, reconciliando espaços de ação díspares por meio de uma receita de aprendizado baseada em currículo para alcançar o desempenho de estado da arte em adaptação few-shot e compreensão física generalizável.

Autores originais: Kechen Liu, Ola Shorinwa

Publicado 2026-08-28
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Kechen Liu, Ola Shorinwa

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os robôs há muito lutam para compreender o mundo físico da mesma forma que os humanos. Enquanto uma criança aprende que uma xícara cairá se for empurrada para fora de uma mesa ou que uma toalha pode ser dobrada ao puxar seus cantos, os robôs frequentemente requerem milhares de exemplos específicos para aprender até mesmo uma dessas regras simples. Essa dificuldade decorre do fato de que a maioria dos sistemas de aprendizado robótico é treinada com dados de um único tipo de máquina. Um robô com um braço longo e fino aprende a física de forma diferente de um robô com uma garra ou uma mão humana, criando uma barreira onde o conhecimento adquirido por um não pode ser facilmente compartilhado com outro. Para superar isso, cientistas começaram a olhar para modelos de geração de vídeo, que são programas de computador capazes de imaginar o que acontece em seguida em uma cena. Se um robô pudesse assistir a um vídeo e prever o movimento futuro dos objetos, ele poderia planejar suas ações sem precisar testá-las fisicamente primeiro. No entanto, esses modelos preditivos têm sido historicamente limitados a tipos únicos de robôs, impedindo que aprendam com a vasta e diversificada biblioteca de vídeos de humanos e robôs disponível na internet.

Uma equipe de pesquisadores da Universidade de Princeton desenvolveu um novo framework chamado CLAP para preencher essa lacuna. O trabalho deles demonstra que um único modelo de vídeo pode aprender as leis universais da física ao ser treinado em uma mistura massiva de vídeos apresentando tanto humanos quanto muitos tipos diferentes de robôs. A ideia central é que, embora uma mão humana, um braço robótico e uma garra pareçam diferentes, todos obedecem às mesmas regras físicas ao mover objetos. Ao ensinar um computador a prever o futuro de uma cena, independentemente de quem ou o que está realizando a ação, os pesquisadores criaram um sistema que entende a mecânica subjacente do mundo, em vez de apenas os movimentos específicos de uma única máquina. Essa abordagem permite que o modelo aprenda com vídeos não rotulados da internet, onde não são fornecidas instruções, bem como com dados detalhados de robôs, criando uma compreensão muito mais rica de como as coisas se movem e interagem.

Os pesquisadores enfrentaram um obstáculo significativo porque os dados que queriam usar eram desordenados e inconsistentes. Vídeos de humanos não trazem instruções sobre como suas mãos se moveram, e diferentes robôs utilizam diferentes formas de descrever seus movimentos. Para resolver isso, a equipe criou um método para traduzir todas essas diferentes linguagens de movimento para um formato comum. Eles utilizaram três ferramentas principais: a posição precisa da mão de um robô, descrições textuais simples do movimento e uma representação de ação aprendida e oculta que o computador descobre por conta própria. A estratégia mais eficaz envolveu um processo de aprendizado passo a passo. Primeiro, o modelo aprendeu as regras básicas da física assistindo a vídeos não rotulados usando as representações de ação ocultas. Uma vez que compreendeu a dinâmica fundamental, os pesquisadores refinaram seu conhecimento usando dados precisos de robôs com movimentos rotulados. Essa abordagem de dois estágios permitiu que o sistema escalasse usando a vasta quantidade de vídeos da internet, mantendo-se ao mesmo tempo preciso o suficiente para controlar robôs reais.

Os resultados deste trabalho mostram que o novo sistema tem o desempenho tão bom quanto, e muitas vezes melhor do que, os melhores modelos existentes que foram treinados apenas em um único tipo de robô. Em ambientes de teste desafiadores, o modelo conseguiu prever os quadros futuros de um vídeo com alta precisão, simulando corretamente como objetos cairiam, deslizariam ou seriam manipulados. Crucialmente, o sistema foi capaz de generalizar esse conhecimento para tarefas do mundo real sem a necessidade de ser retreinado para cada novo robô. Quando testado em um robô de braço único, o sistema ajudou com sucesso um rob em planejar suas ações para pegar vários objetos, como fita, peixe ou lagosta, superando políticas robóticas padrão. Ainda mais impressionante, o sistema pôde ser aplicado a um robô de dois braços e a um robô humanoide com uma estrutura corporal diferente, apesar de nunca ter sido treinado com dados dessas máquinas específicas. Simplesmente ajustando a camada final do modelo para corresponder aos movimentos do novo robô, o sistema manteve sua compreensão profunda da física e continuou a fazer previsões precisas.

Esta pesquisa sugere que o caminho para robôs mais capazes não exige a construção de um cérebro único para cada nova máquina. Em vez disso, ao treinar em uma mistura diversificada de dados, um único modelo pode aprender um conjunto geral de princípios físicos que se aplicam a quase qualquer agente. Os pesquisadores descobriram que, enquanto movimentos relativos, que descrevem a mudança em vez da posição, funcionaram bem para instruções baseadas em texto, posições absolutas eram necessárias para o controle preciso de braços robóticos. Eles também descobriram que, embora os vídeos humanos fossem excelentes para ensinar ao modelo o básico da física, os dados de robôs reais eram essenciais para traduzir esse conhecimento em ações bem-sucedidas no mundo real. O trabalho estabelece uma nova maneira de treinar robôs, afastando-se de sistemas isolados e de propósito único em direção a uma abordagem mais unificada, onde o aprendizado de uma corporeidade pode beneficiar diretamente outra. Embora o sistema não seja perfeito e possa ocasionalmente cometer erros em suas previsões, ele representa um passo significativo no ensino de máquinas para compreender o mundo físico através da observação e da imaginação.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →