← Últimos artigos
💻 computer science

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

Este artigo introduz os Programas SUN (Semantically UNified) e o sistema Kuafu, que unem o controle baseado em modelos e políticas aprendidas ao sintetizar automaticamente executáveis tipados e fundamentados em linguagem que unificam a verificação de MPC e o treinamento de RL, permitindo, assim, a manipulação robusta de longo horizonte sem recompensas densas manuais ou demonstrações humanas.

Autores originais: Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

Publicado 2026-09-01
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os robôs há muito tempo são mestres no chão de fábrica, repetindo o mesmo movimento preciso milhares de vezes sem erro. Mas quando solicitados a realizar uma tarefa complexa e de múltiplas etapas em uma casa desordenada e imprevisível — como abrir uma gaveta, retirar uma garrafa e colocá-la sobre uma mesa — eles frequentemente falham. A dificuldade reside em preencher a lacuna entre duas formas diferentes de pensar sobre o movimento. Uma abordagem baseia-se em regras matemáticas rígidas para calcular cada ângulo de junta e força, garantindo que o robô não colida, mas este método é frágil e falha se o mundo mudar ligeiramente. A outra abordagem utiliza o aprendizado por tentativa e erro, onde um robô pratica até dominar uma tarefa, mas isso geralmente requer milhares de horas de demonstração humana ou recompensas cuidadosamente elaboradas que são difíceis de projetar. Por anos, esses dois métodos operaram em silos separados, com os planejadores rígidos incapazes de se adaptar e os aprendizes incapazes de compreender a lógica profunda da tarefa.

Pesquisadores da Universidade da Califórnia, Los Angeles, e seus colegas introduziram um novo sistema chamado Kuafu, que tenta tecer essas duas abordagens. Em vez de tratar as instruções do robô como um conjunto passageiro de objetivos ou um roteiro rígido, eles criaram um programa tipado persistente que atua como uma única fonte de verdade para todo o processo. Este programa, que chamam de Programa "Semanticamente Unificado" ou Programa SUN, é escrito de uma forma que o computador possa entender as relações físicas entre os objetos, como para que lado uma maçaneta de gaveta está voltada ou o quanto uma garrafa deve ser levantada. Crucialmente, este mesmo programa é usado para verificar as ações do robô, para ensiná-lo a se mover e para gerar os dados necessários para que ele aprenda do zero. Ao manter o significado central da tarefa constante desde a fase inicial de planejamento até a fase final de aprendizado, o sistema evita que o robô se desvie do que ele realmente deveria fazer.

O sistema começa pegando uma instrução de linguagem simples de um humano, como "abra a gaveta e coloque o copo dentro". Um agente de inteligência artificial lê essa instrução e constrói o Programa SUN selecionando blocos de construção pré-definidos que descrevem ações físicas e restrições. Ele então testa esse programa em uma simulação de alta fidelidade, usando um método de controle sofisticado para ver se a tarefa é fisicamente possível. Se a simulação revelar que as instruções são falhas ou impossíveis de executar, o sistema repara automaticamente o programa antes que qualquer aprendizado comece. Este processo de triagem é vital porque garante que o robô nunca seja solicitado a aprender uma tarefa que não pode ser realizada, filtrando ideias ruins antes que elas desperdicem tempo e poder computacional.

Uma vez que o programa é validado, o sistema o utiliza para gerar milhares de exemplos bem-sucedidos do robô realizando a tarefa. Esses exemplos não são apenas movimentos aleatórios; eles são guiados pelo programa persistente, que monitora cada etapa da tarefa, desde o momento em que a garra toca a maçaneta até o momento em que a gaveta está totalmente aberta. O robô então aprende com esses exemplos, primeiro imitando os movimentos bem-sucedidos e depois refinando-os através de um processo de tentativa e erro que é estritamente limitado pelo programa original. Isso garante que, embora o robô aprenda a ser flexível e reativo, ele nunca perca de vista o objetivo final. O resultado é uma política que pode executar tarefas complexas de múltiplas etapas com um nível de confiabilidade que métodos anteriores não conseguiam alcançar.

Em uma série de testes envolvendo nove diferentes tarefas de manipulação, variando de empilhar cubos a reorientar garrafas e abrir gavetas, o sistema demonstrou uma melhoria significativa em relação aos métodos existentes. Enquanto outras abordagens que dependem de recompensas esparsas ou planejamento online tiveram dificuldade em ter sucesso mais de um terço das vezes, este novo sistema alcançou uma taxa de sucesso superior a 82 por cento. Os pesquisadores descobriram que o sistema foi particularmente eficaz ao lidar com tarefas que exigiam muitos passos, mantendo seu desempenho à medida que a complexidade da sequência aumentava. Além disso, os dados gerados por este sistema foram de tal qualidade que permitiram que um modelo de aprendizado visual tivesse sucesso em 46 por cento dos testes, um número que é mais do que o dobro da taxa de sucesso de modelos treinados em dados de outros métodos de geração.

O verdadeiro teste de qualquer sistema robótico é se ele consegue passar da segurança de uma simulação de computador para o mundo real. Para verificar isso, os pesquisadores implementaram as políticas treinadas em robôs físicos fabricados pela Franka e Kinova, usando câmeras para guiar as ações do robô sem qualquer conhecimento prévio da estrutura específica da tarefa. Sem qualquer ajuste adicional ou prática no mundo real, os robôs completaram com sucesso 34,7 por cento dos testes físicos em várias configurações. Essa transferência zero-shot (zero-shot transfer), onde um robô treinado inteiramente em simulação funciona imediatamente em uma máquina real, sugere que o programa persistente capturou com sucesso a lógica essencial da tarefa, permitindo que o comportamento aprendido se generalize para o mundo físico.

Os pesquisadores reconhecem que esta abordagem tem limites. Ela depende atualmente de uma biblioteca pré-definida de ações físicas e requer uma compreensão clara dos objetos na cena, o que significa que ainda não pode lidar com objetos deformáveis como tecidos ou fluidos sem uma nova programação significativa. Além disso, o sistema avança pelas tarefas em uma única direção e não pode retroceder se ocorrer um erro físico, o que limita sua capacidade de recuperar-se de certos tipos de erros. No entanto, os resultados estabelecem um novo princípio para o aprendizado robótico: que manter o significado semântico de uma tarefa consistente através do planejamento, verificação e aprendizado cria uma base robusta para a automação. Ao garantir que a compreensão do robô sobre a tarefa não se desvie, o sistema preenche a lacuna entre o controle rígido e o aprendizado flexível, oferecendo um caminho para robôs que podem realizar tarefas complexas de forma confiável no mundo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →