← Últimos artigos
💻 computer science

Zetta ζ\zeta: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

O artigo apresenta o Zetta, um arnês incorporado de malha fechada que permite a inteligência física autoevolutiva ao atualizar dinamicamente críticos baseados em código e habilidades de recuperação online através de três loops separados por escalas de tempo, alcançando desempenho de estado da arte e acelerações significativas de inferência em tarefas de benchmark, enquanto demonstra transferência zero-shot e "Momentos Aha" emergentes.

Autores originais: Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

Publicado 2026-08-18
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os robôs há muito tempo conseguem realizar tarefas simples e repetitivas em fábricas, mas dar a eles a flexibilidade para lidar com a natureza desordenada e imprevisível de uma casa ou oficina real permaneceu um dos maiores desafios da inteligência artificial. Durante anos, pesquisadores tentaram ensinar robôs alimentando-os com quantidades massivas de dados de vídeo, esperando que a máquina aprendesse um conjunto único e perfeito de instruções para cada situação possível. Essa abordagem, embora poderosa, frequentemente falha quando o mundo real se desvia mesmo que ligeiramente dos vídeos de treinamento; um pequeno deslize de uma pinça ou uma mudança na iluminação pode fazer o robô congelar ou colidir. Um caminho alternativo surgiu, tratando os robôs não como programas estáticos, mas como agentes que podem pensar, planejar e usar ferramentas. No entanto, mesmo esses agentes mais inteligentes tiveram dificuldade em aprender com seus próprios erros em tempo real. A maioria dos sistemas opera em um ciclo onde tentam uma tarefa, falham e, então, apenas refletem sobre o que deu errado após toda a tentativa terminar. Quando analisam o erro, o momento de corrigi-lo já passou, e a interação física já está quebrada.

Uma equipe de pesquisadores da Universidade de Tsinghua e da Z-Trans AI introduziu um novo sistema chamado Zetta, que muda a forma como os robôs aprendem ao fechar a lacuna entre o pensar e o agir. Em vez de esperar até que uma tarefa seja concluída para aprender, o Zetta permite que um robô monitore seu próprio estado físico continuamente enquanto se move, detectando erros no instante em que acontecem e corrigindo-os imediatamente. O sistema não tenta retreinar o cérebro central do robô, que permanece fixo e estável. Em vez disso, ele constrói uma camada de "críticos de tempo de execução" (runtime critics) — monitores especializados e pequenos que observam as mãos do robô e os objetos que ele toca. Se um crítico notar que uma pegada está deslizando ou que um objeto está prestes a cair, ele aciona uma habilidade de recuperação pré-programada para salvar a situação antes que o robô perca o controle. Isso cria um ciclo de autoevolução onde o robô melhora em uma tarefa específica quanto mais tenta, não mudando sua compreensão fundamental do mundo, mas acumulando uma biblioteca de formas comprovadas de lidar com falhas físicas.

Os pesquisadores testaram essa abordagem em dois grandes marcos de manipulação robótica: um conjunto de tarefas envolvendo o movimento de objetos entre diferentes locais e um conjunto mais complexo de tarefas doméstárias, como abrir gavetas ou ligar aparelhos. Nessas simulações, o sistema começou com uma política de robô base que tinha uma taxa de sucesso de aproximadamente 35 por cento nas tarefas mais difíceis. À medida que o sistema executava milhares de tentativas, ele começou a identificar os momentos específicos onde as coisas davam errado. Ele agrupou essas falhas, descobriu a causa raiz e escreveu um novo código para corrigi-las. Em apenas algumas rodadas de autocorreção, a taxa de sucesso nas tarefas difíceis saltou para mais de 90 por cento. O sistema não teve apenas sorte; ele demonstrou um padrão claro de melhoria onde lutava por um tempo e, de repente, descobria um princípio físico fundamental — como a necessidade de estabilizar uma pegada antes de levantar — e seu desempenho dava um salto à frente. Os pesquisadores chamam esses avanços repentinos de "momentos aha", onde o robô finalmente entende a restrição física que lhe faltava.

O que torna essa descoberta particularmente significativa é que as habilidades que o robô aprendeu não estavam presas a um objeto específico ou a uma sala específica. Quando os pesquisadores levaram as habilidades que o robô aprendeu para manipular uma garrafa de vinho em uma tarefa e as aplicaram a uma tarefa completamente diferente envolvendo um recipiente de cream cheese, o robô teve sucesso sem qualquer novo treinamento. O sistema havia aprendido princípios gerais de como segurar, mover e posicionar objetos que funcionavam em diferentes cenários. Isso sugere que o robô não estava apenas memorizando um caminho para um objetivo, mas estava aprendendo uma compreensão mais profunda de como interagir com o mundo físico. O sistema também provou ser incrivelmente rápido, executando simulações em um cluster de computadores para gerar a experiência necessária para o aprendizado. Ao desacoplar a lógica do robô do hardware que executa a simulação, os pesquisadores foram capazes de rodar o processo de aprendizado mais de vinte vezes mais rápido do que métodos anteriores, permitindo que o robô evoluísse suas habilidades em questão de horas, em vez de dias.

Os pesquisadores argumentam que essa abordagem resolve um problema fundamental na robótica: a incapacidade dos modelos atuais de reagir às mudanças rápidas do mundo físico. Grandes modelos de inteligência artificial são lentos demais para tomar decisões na velocidade necessária para pegar um objeto que cai ou ajustar uma pegada que desliza. Ao manter o céreach principal congelado e adicionar uma camada rápida e reativa de críticos e habilidades de recuperação, o Zetta preenche a lacuna entre o planejamento de alto nível e o controle físico de baixo nível. O sistema mostrou que podia lidar com sequências complexas de ações, como navegar em uma cozinha, abrir um armário e colocar um item dentro, decompondo a tarefa em etapas gerenciáveis e tendo uma rede de segurança pronta para cada falha potencial. Em um estudo de caso, um robô tentando mover uma garrafa para uma tigela falhou repetidamente porque derrubava a garrafa durante o transporte. Após algumas rodadas de autocorreção, o sistema adicionou uma verificação específica para garantir que a pegada estava segura antes de mover, e a taxa de sucesso para essa tarefa disparou de 15 por cento para 95 por cento.

O trabalho também destaca a importância da infraestrutura para tornar esse tipo de aprendizado possível. Para evoluir as habilidades de um robô, o sistema precisa executar milhares de tentativas para encontrar os momentos raros em que ele falha e, então, analisar essas falhas. Os pesquisadores construíram um sistema especializado para gerenciar essa carga de trabalho, permitindo que executassem muitas simulações ao mesmo tempo sem desacelerar. Essa infraestrutura foi crucial para a velocidade do projeto, permitindo que a equipe coletasse os dados necessários para treinar os críticos e as habilidades de recuperação de forma eficiente. Sem essa capacidade de escalar o processo de aprendizado, o ciclo de autoevolução seria lento demais para ser prático. Os resultados sugerem um novo caminho para a inteligência física, um onde os robôs não precisam ser perfeitos desde o início, mas podem aprender a ser confiáveis através da experiência, refinando constantemente sua capacidade de lidar com o inesperado.

As implicações desta pesquisa estendem-se além de apenas tornar os robôs melhores em mover objetos. Ela oferece um modelo de como a inteligência artificial pode interagir com o mundo físico de uma forma robusta e adaptável. Ao focar na capacidade de detectar e recuperar-se de erros em tempo real, o sistema evita a fragilidade que assolou abordagens anteriores. Os pesquisadores observam que, embora seu trabalho atual tenha sido conduzido em simulação, os princípios desenvolvidos foram projetados para serem transferidos para robôs reais. O próximo passo para a equipe é levar este arnês de autoevolução e testá-lo em máquinas físicas, unindo a lacuna entre a simulação digital e o mundo real. Se bem-sucedido, isso poderá levar a robôs que não estão apenas programados para realizar uma tarefa, mas que são capazes de aprender e melhorar seu desempenho cada vez que a tentam, tornando-os parceiros mais úteis e confiáveis em ambientes humanos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →