← Últimos artigos
💻 computer science

HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy

O artigo propõe o HaWMPO, um framework de otimização de política baseado em modelo de mundo consciente de alucinações que aprimora políticas robóticas generalistas ao estimar e suprimir alucinações de predição durante rollouts imaginados, melhorando significativamente as taxas de sucesso em tarefas de manipulação complexas de longo horizonte tanto em benchmarks quanto em robôs do mundo real.

Autores originais: Zengjue Chen, Peidong Liu, Jiawei Li, Qi Wang

Publicado 2026-09-10
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zengjue Chen, Peidong Liu, Jiawei Li, Qi Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Robôs que podem aprender a realizar uma grande variedade de tarefas, desde empilhar blocos até dobrar roupas, têm sido há muito tempo um objetivo da inteligência artificial. Para alcançar isso, pesquisadores desenvolveram políticas "generalistas", que são essencialmente sistemas semelhantes ao cérebro treinados para compreender linguagem e visão para decidir como um robô deve se mover. No entanto, ensinar esses sistemas no mundo real é lento, caro e arriscado. Cada vez que um robô tenta uma nova ação, ele pode quebrar algo ou danificar a si mesmo, tornando o processo de tentativa e erro perigoso. Para resolver isso, cientistas recorreram a "modelos de mundo", que são simuladores digitais que permitem que os robôs pratiquem dentro de um computador. Esses modelos preveem o que acontecerá em seguida com base nas ações atuais, criando um espaço seguro para o aprendizado. No entanto, esses simuladores digitais não são perfeitos; à medida que preveem mais adiante no futuro, eles frequentemente começam a inventar detalhes que nunca aconteceram, um fenômeno conhecido como "alucinação". Se um robô aprende com esses cenários falsos, ele pode aprender a realizar ações que funcionam no computador, mas falham completamente no mundo real.

Uma equipe de pesquisadores desenvolveu um novo método para ajudar os robôs a aprenderem efetivamente a partir dessas simulações digitais imperfeitas sem serem enganados por seus erros. Eles chamam sua abordagem de HaWMPO, um sistema projetado para tornar os robôs conscientes de quando seu campo de treinamento digital está mentindo para eles. Em vez de tratar cada cenário imaginado como igualmente valioso, o novo sistema inclui um componente especial que atua como um inspetor de controle de qualidade. Este inspetor observa a sequência de imagens que o simulador gera e atribui uma pontuação indicando o quão confiável é essa sequência. Se o simulador começar a derivar para a fantasia, criando imagens que não correspondem às leis da física ou ao resultado esperado, o inspetor sinaliza o erro. O sistema então usa essa informação para ajustar o processo de aprendizado, efetivamente dizendo ao robô para ignorar as partes da simulação que parecem excessivamente pouco confiáveis e focar nas partes que parecem realistas.

Os pesquisadores testaram este método usando um conjunto padrão de tarefas robóticas em um ambiente de computador chamado LIBERO, que envolve mover objetos para locais específicos. Eles compararam seu novo sistema com outros métodos que utilizam modelos de mundo, mas carecem desse recurso de controle de qualidade. Os resultados mostraram uma vantagem clara para a nova abordagem. Na simulação, o robô usando o sistema consciente de alucinações alcançou uma taxa de sucesso de 63,7 por cento, o que é significativamente maior do que o próximo melhor método. A melhoria foi particularmente perceptível em tarefas que exigem raciocínio espacial e manipulação de objetos, onde a capacidade do robô de distinguir entre cenários reais e falsos o ajudou a aprender estratégias mais robustas. Os pesquisadores descobriram que, ao penalizar o robô quando ele dependia de cenários altamente alucinados, o sistema evitou que o robô aprendesse maus hábitos que só funcionariam em uma simulação quebrada.

Para garantir que este método funcionasse fora do computador, a equipe também o testou em um robô físico em um ambiente do mundo real. Eles incumbiram o robô de dois desafios específicos: colocar um lenço de papel em uma caixa e colocar fones de ouvido em um suporte. Sem o novo sistema, o robô teve sucesso nessas tarefas cerca de 60 por cento das vezes na tarefa dos fones de ouvido. Após aplicar o treinamento consciente de alucinação, a taxa de sucesso subiu para um AUC de 0,8 em média, com o robô alcançando 85% na tarefa do lenço e 75% na tarefa dos fones de ouvido. Esse salto de desempenho demonstra que as lições aprendidas no mundo digital foram de fato transferíveis para o mundo físico, porque o robô aprendeu a ignorar o ruído digital que costuma confundir esses sistemas. Os pesquisadores observaram que o sistema funciona verificando constantemente a consistência do futuro simulado, garantindo que o robô aprenda apenas com trajetórias que pareçam fisicamente plausíveis.

O estudo destaca que a chave para um melhor aprendizado robótico não é apenas ter um simulador, mas ter uma maneira de confiar nele. Ao construir um sistema que pode detectar quando uma simulação está perdendo o contato com a realidade, os pesquisadores criaram um caminho mais estável para os robôs melhorarem. Embora os testes atuais tenham sido conduzidos em tarefas relativamente curtas, o sucesso sugere que esta abordagem pode ser vital para missões mais complexas e de longo prazo, onde um robô deve planejar muitos passos à frente. O trabalho confirma que, para que os robôs se tornem verdadeiramente ajudantes de uso geral, eles devem aprender a distinguir entre uma previsão útil e uma mentira convincente, uma habilidade que este novo método proporciona ao tornar o próprio processo de aprendizado consciente de suas próprias limitações.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →