← Últimos artigos
💻 computer science

DeformSmith: Physics Harness-Guided Hierarchical Generation of Deformable Assets for Robot Manipulation

O DeformSmith é um framework hierárquico guiado por restrições físicas que automatiza a geração de ativos deformáveis de alta qualidade e fisicamente plausíveis para manipulação robótica através da construção e refinamento iterativo de propriedades de geometria, material e interação por meio de entradas de texto ou imagem.

Autores originais: Can Li, Jie Gu, Zishun Deng, Jingmin Chen, Lei Sun

Publicado 2026-09-17
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Can Li, Jie Gu, Zishun Deng, Jingmin Chen, Lei Sun

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Nos mundos virtuais onde os robôs aprendem a se mover, os objetos com os quais eles interagem são frequentemente perfeitos demais. Uma maçã digital é uma esfera rígida que nunca amassa; uma toalha digital é uma folha plana que nunca dobra. Para um robô aprender como agarrar, levantar ou carregar algo em uma simulação, esse objeto deve se comportar como o objeto real. Ele deve amassar ao ser apertado, cair de forma fluida ao ser solto e manter sua forma ao ser levantado. Criar esses objetos digitais do zero é difícil porque a aparência visual de um objeto — o que ele parece ser — é apenas metade da história. A outra metade é sua natureza física oculta: quão pesado ele é, quão macio ou rígido é seu material e como ele reage ao toque. Sem conhecer essas propriedades invisíveis, um robô pode tentar pegar uma banana digital apenas para descobrir que ela se estilhaça como vidro ou escorrega por seus dedos como água, simplesmente porque o computador não soube como fazê-la dobrar.

Pesquisadores há muito tentam gerar esses objetos 3D usando descrições de texto ou fotografias únicas, mas até agora, os resultados têm sido frequentemente visualmente convincentes, porém fisicamente quebrados. Eles podem parecer um brinquedo de pelúcia, mas, em uma simulação, colapsariam sob o próprio peso ou falhariam em reagir à pegada de um robô. O desafio reside no fato de que uma imagem ou uma frase não contém informações suficientes para dizer ao computador exatamente como um objeto deve se deformar. Para resolver isso, uma equipe de pesquisadores desenvolveu um novo sistema chamado DeformSmith. Este framework não apenas adivinha como um objeto deve parecer; ele constrói o objeto em camadas, testando seu comportamento físico em cada etapa, e usa um robô simulado para tentar manipular o objeto antes que o processo seja concluído.

O cerne desta nova abordagem é um processo de construção passo a passo que imita como um engenheiro humano construiria um protótipo, mas com o computador realizando o trabalho pesado. O sistema começa com uma descrição simples ou uma única foto e primeiro constrói a forma 3D do objeto. Uma vez que a forma existe, o sistema atribui a ela uma identidade física, decidindo quanto ela pesa e como interage com o chão. Em seguida, adiciona as propriedades do material, determinando se o objeto é macio como uma esponja ou firme como uma bola de borracha. Crucialmente, o sistema não apenas define esses valores e espera pelo melhor. Ele execeuta uma série de testes físicos, deixando o objeto cair ou pressionando-o, para ver se ele se comporta corretamente. Se o objeto colapsar com muita facilidade ou quicar de uma maneira errada, o sistema ajusta automaticamente suas configurações internas e tenta novamente.

O que torna este método único é como ele traz um robô para o ciclo. Após o objeto passar nos testes físicos básicos, um braço robótico simulado tenta pegá-lo, carregá-lo e colocá-lo no lugar. É aqui que o sistema mais aprende. O robô tenta agarrar o objeto, e o sistema observa atentamente para ver se o objeto mantém sua forma, se escorrega ou se se deforma de uma maneira que torne impossível movê-lo. Se o robô falhar, o sistema usa essa falha como uma pista. Ele pode perceber que o objeto é muito escorregadio, ou que a pegada foi muito fraca, ou que o material é muito macio para a tarefa. O sistema então volta e refina as propriedades do objeto ou altera como o robô se move, repetindo o ciclo até que o robô consiga completar a tarefa com sucesso. Isso cria um ciclo de feedback onde o objeto é constantemente melhorado com base em quão bem ele funciona em um cenário do mundo real.

Os pesquisadores testaram este sistema criando dezenas de objetos diferentes, desde uma bola de rugby até uma foca de pelúcia, usando tanto descrições de texto quanto imagens únicas. Eles compararam seus resultados com outros métodos avançados que tentam fazer a mesma coisa. Nessas comparações, os objetos criados pelo DeformSmith foram significativamente mais realistas. Ao serem deixados cair, eles mantiveram sua forma e quicaram ou amassaram de uma maneira que parecia natural, enquanto objetos de outros sistemas frequentemente achatavam como uma panqueca ou se desintegravam. Em testes cegos onde pessoas julgaram qual objeto parecia e se comportava melhor, o novo sistema venceu na maioria das vezes. Foi particularmente bem-sucedido na criação de objetos que podiam ser manipulados com sucesso por um robô, com a taxa de sucesso para pegar e mover objetos saltando de menos da metade para mais de dois terços quando o refinamento guiado pelo robô foi utilizado.

O sistema funciona decompondo o problema em estágios gerenciáveis, garantindo que a forma esteja correta antes de se preocupar com o peso, e que o peso esteja correto antes de se preocupar com o material. Isso evita que o computador fique confuso ao tentar consertar tudo de uma vez. Um "harness" central atua como um supervisor, acompanhando todas as regras e garantindo que as mudanças feitas em uma etapa não quebrem o trabalho feito em uma etapa anterior. Por exemplo, se o sistema decide tornar um objeto mais macio, ele verifica se essa mudança não torna o objeto pesado demais ou faz com que ele afunde no chão. Essa abordagem hierárquica cuidadosa permite que o sistema construa objetos complexos e interativos que estão prontos para uso em simulações de treinamento de robôs.

Embora o sistema seja poderoso, os pesquisadores observam que ele atualmente funciona melhor com objetos sólidos que podem ser espremidos ou esticados, em vez de líquidos ou materiais granulares como areia. As propriedades físicas que ele infere também são estimativas baseadas em pistas visuais e simulação, o que significa que ainda precisariam ser verificadas com medições do mundo real se fossem usadas para robôs físicos reais. No entanto, a capacidade de gerar uma grande variedade de objetos fisicamente credíveis a partir de entradas simples abre uma nova porta para a robótica. Em vez de modelar manualmente cada objeto que um robô possa encontrar, os engenheiros agora podem descrever um objeto ou mostrar uma foto, e o sistema construirá um gêmeo digital que está pronto para ser testado, manipulado e aprendido. Essa capacidade sugere um futuro onde os robôs podem aprender a lidar com o mundo desordenado e deformável dos objetos cotidianos muito mais rápido, simplesmente praticando com uma vasta biblioteca de ativos digitais gerados automaticamente e fisicamente precisos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →