← Últimos artigos
🤖 machine learning

Learning to build covering structures with continuous adjustments

Este artigo apresenta o HSAC, um framework de aprendizado por reforço que permite que robôs construam estruturas complexas de forma adaptativa ao gerar sequências em tempo real sem planos predefinidos, utilizando redes neurais de grafos e um algoritmo Soft Actor-Critic estendido para lidar com espaços de ação híbridos discretos-contínuos e transferir com sucesso da simulação para o hardware físico.

Autores originais: Gabriel Vallat, Maryam Kamgarpour, Stefana Parascho

Publicado 2026-09-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Gabriel Vallat, Maryam Kamgarpour, Stefana Parascho

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde robôs pudessem construir estruturas complexas não seguindo um projeto rígido e pré-desenhado, mas sentindo o caminho através do processo, ajustando-se a cada pequena oscilação e imperfeição conforme avançam. Esta é a promessa da construção robótica, um campo que visa utilizar materiais de forma mais eficiente e criar formas que são difíceis demais para as mãos humanas ou máquinas tradicionais alcançarem. No entanto, um grande obstáculo sempre esteve no caminho: o mundo real é caótico. Não importa quão preciso seja um plano, os materiais físicos possuem pequenas variações, e as máquinas cometem pequenos erros. Na construção tradicional, se um bloco for colocado mesmo uma fração de milímetro fora do lugar, todo o plano pode precisar ser descartado e reiniciado ou, pior, a estrutura pode colapsar. Os métodos atuais têm dificuldade em se adaptar a esses erros inevitáveis porque dependem de instruções fixas que não conseguem dar conta da natureza imprevisível da realidade física.

Uma equipe de pesquisadores desenvolveu uma nova maneira para os robôs aprenderem a construir, uma que abandona a ideia de um plano mestre inteiramente. Em vez de seguir um roteiro, seus robôs aprendem a construir por tentativa e erro, usando um tipo de inteligência artificial conhecido como aprendizagem por reforço. Nesta abordagem, o robô age como um aluno que aprende fazendo: ele tenta colocar um bloco, vê o que acontece e, se a estrutura permanecer estável, recebe uma recompensa; se ela oscilar ou cair, ele aprende com o erro. Os pesquisadores focaram em um desafio específico: construir um arco de sustentação usando dois robôs trabalhando juntos. Um robô coloca os blocos, enquanto o outro segura a extremidade livre para evitar que a estrutura tombe. Esta configuração é delicada; a estrutura está sempre no limite da instabilidade, exigindo ajustes constantes e sutis para permanecer de pé.

O cerne de sua descoberta é um novo algoritmo que permite ao robô tomar dois tipos de decisões ao mesmo tempo: escolher qual tipo de bloco usar e decidir exatamente onde colocá-lo. Este é um problema difícil porque a escolha do bloco e o posicionamento estão profundamente conectados; o melhor lugar para um tipo de bloco pode ser terrível para outro. Métodos anteriores tentaram lidar com isso simplificando o problema ou aderindo a planos rígidos, mas os pesquisadores descobriram que essas abordagens frequentemente ficavam presas em soluções locais, incapazes de encontrar a melhor maneira de construir. O novo método deles, que chamam de algoritmo híbrido de ator-crítico suave (soft actor-critic), trata o processo de construção como uma conversa contínua entre o robô e a estrutura. Isso permite que o robô explore diferentes possibilidades, aprendendo não apenas o que funciona, mas como se recuperar quando as coisas saem ligeiramente do controle.

Para fazer isso funcionar, os pesquisadores representaram a estrutura não como uma lista de coordenadas, mas como uma rede de conexões, semelhante a como um mapa mostra como as cidades estão ligadas por estradas. Essa visão baseada em grafos ajuda o robô a entender a forma da construção, independentemente de como ela seja rotacionada ou deslocada no espaço. Uma inovação fundamental em seu sistema foi uma forma específica de organizar essa informação para garantir que as decisões do robô sobre qual bloco escolher não fossem confundidas com suas decisões sobre onde colocá-lo. Ao estruturar a informação cuidadosamente, o robô pôde aprender a explorar um vasto número de possibilidades sem ficar sobrecarregado, eventualmente encontrando um caminho para um arco estável que outros métodos perderam.

A equipe testou seu sistema em um ambiente simulado primeiro, onde puderam executar milhares de tentativas rapidamente. Eles compararam seu novo algoritmo com um método existente e descobriram que a abordagem deles era significativamente melhor no aprendizado. Enquanto o método antigo frequentemente ficava preso em um ciclo de soluções subótimas, nunca chegando ao arco perfeito, o novo sistema deles consistentemente encontrava melhores maneiras de construir. Também foi robusto, o que significa que funcionou bem mesmo quando os pesquisadores alteraram as configurações ou tornaram a tarefa mais difícil ao adicionar mais tipos de blocos para escolher, mostrando que poderia escalar para tarefas mais complexas.

Para provar que esse aprendizado poderia se traduzir para o mundo real, os pesquisadores construíram uma configuração física usando dois robôs industriais e um conjunto de blocos de plástico impressos em 3D. Eles colocaram uma câmera acima do espaço de trabalho para rastrear a posição de cada bloco conforme era colocado. O robô usou os dados da câmera para atualizar sua compreensão da estrutura e decidiu onde colocar o próximo bloco com base no que havia aprendido na simulação. O resultado foi um arco construído com sucesso em tempo real, com os robôs ajustando suas ações conforme a estrutura crescia. Quando compararam esse processo de construção adaptativo do mundo real com um método tradicional onde todo o plano era calculado previamente, a abordagem adaptativa teve um desempenho muito superior. A estrutura construída pelo robô que aprendeu manteve-se fiel à sua forma pretendida, enquanto a versão pré-planejada desviou-se do curso devido a erros pequenos e inevitáveis.

Este trabalho demonstra que os robôs podem aprender a construir estruturas complexas ao se adaptarem ao mundo físico em tempo real, em vez de tentar forçar o mundo a se ajustar a um plano perfeito. Ao deixar o robô aprender com seus próprios erros e sucessos, os pesquisadores mostraram um caminho para uma construção que é mais resiliente, eficiente e capaz de lidar com a realidade caótica do mundo físico. O sucesso de seu experimento físico sugere que esta abordagem poderia eventualmente ser usada para construir com uma ampla variedade de materiais, do plástico à pedra, criando estruturas que são tanto belas quanto fortes, construídas por máquinas que compreendem a arte sutil do equilíbrio.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →