← Últimos artigos
🤖 AI

DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

DeCAL é um modelo de visão-linguagem-ação destre de base física que aproveita uma arquitetura de Mistura de Transformers com fusão visuo-tátil adaptativa e co-imaginação latente para alcançar o estado da arte em tarefas de manipulação ricas em contato, integrando dinamicamente a sensação tátil e a modelagem de dinâmica física.

Autores originais: Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

Publicado 2026-09-09
📖 8 min de leitura🧠 Leitura aprofundada

Autores originais: Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os robôs há muito são mestres no chão de fábrica, movendo objetos pesados ao longo de caminhos previsíveis com precisão rígida. No entanto, quando lhes pedimos para entrar em nossas casas e realizar as tarefas delicadas e desordenadas da vida cotidiana — parafusar uma lâmpada, limpar um vaso ou girar uma tampa de garrafa — eles frequentemente falham. O mundo não é uma grade limpa e estática; é um lugar de fricção constante e sutil. Para ter sucesso, uma máquina deve fazer mais do que apenas ver; ela deve sentir. Ela precisa entender a física invisível do contato: o momento em que um dedo escorrega, a pressão necessária para girar um botão ou a maneira como um objeto macio se deforma sob o toque. Por décadas, cientistas tentaram preencher essa lacuna dando aos robôs tanto olhos quanto pele, mas ensinar uma máquina a combinar esses sentidos em uma intuição única e fluida permaneceu um dos desafios mais persistentes da inteligência artificial.

Uma equipe de pesquisadores deu agora um passo significativo com um novo sistema chamado DeCAL. Este não é meramente um robô que pode ver e tocar; é um sistema projetado para imaginar o futuro de uma interação física antes que ela aconteça. Ao construir um modelo que unifica compreensão, imaginação e ação, os pesquisadores criaram uma política robótica que pode navegar no mundo complexo e rico em contatos da manipulação humana com um nível de destreza anteriormente não visto. O sistema foi testado em seis tarefas distintas, variando de limpar um vaso a montar pequenas peças, e superou consistentemente os métodos existentes mais avançados. Nesses testes do mundo real, o DeCAL alcançou uma taxa de sucesso de até 100 por cento em tarefas mais simples e manteve uma taxa média robusta de 7 sucesso de 71 por cento em todos os seis desafios, mesmo quando o ambiente mudava de formas inesperadas.

O problema central que os pesquisadores enfrentaram é que a visão sozinha é frequentemente cega para os momentos mais críticos da manipulação. Quando uma mão robótica alcança um objeto, os dedos frequentemente bloqueiam a visão da câmera, criando um "ponto cego" exatamente quando o robô mais precisa saber. Além disso, os dados visuais não podem dizer a um robô o quão forte ele está pressionando ou se um objeto está prestes a escorregar. Embora tentativas anteriores de adicionar sensores de toque aos robôs frequentemente tratassem eles como simples complementos, o DeCAL integra a informação tátil como uma parte fundamental de seu processo de pensamento. O sistema utiliza sensores de alta resolução em cada ponta de dedo que podem detectar a forma da superfície de um objeto conforme ele se deforma sob pressão, bem como as forças precisas sendo aplicadas. Isso permite que o robô "sinta" o mundo de uma forma que é tão rica e detalhada quanto aquilo que ele vê.

O que torna o DeCAL verdadeiramente único é como ele processa essa informação. Em vez de simplesmente reagir ao que vê ou sente no momento presente, o sistema é treinado para imaginar o que acontecerá a seguir. Ele opera com três capacidades distintas, mas conectadas. Primeiro, ele entende a situação atual observando a cena visual, lendo uma instrução de linguagem e sentindo os pontos de contato. Segundo, ele se envolve em uma forma de "co-imaginação", onde prevê como a cena visual e as sensações táteis evoluirão nos próximos segundos. Ele essencialmente se pergunta: "Se eu girar a tampa agora, como a força mudará e como o objeto parecerá um momento depois?". Finalmente, ele usa esse futuro imaginado para decidir os movimentos precisos necessários para completar a tarefa. Essa abordagem voltada para o futuro permite que o robô planeje suas ações baseando-se na física da interação, em vez de apenas adivinhar com base em padrões passados.

Para fazer isso funcionar, os pesquisadores desenvolveram um método especial para decidir quando confiar no sentido do tato. Em muitas tarefas, um robô pode estar se movendo pelo ar onde o toque é irrelevante, e então subitamente fazer contato com um objeto. Se o robô prestasse igual atenção aos sinais táteis o tempo todo, ele ficaria confuso com o ruído do ar ou a falta de contato. O DeCAL usa um mecanismo de controle inteligente que atua como um botão de volume para o sentido do tato. Quando o robô não está tocando em nada, o sistema abaixa o volume nos sinais táteis, confiando principalmente na visão. No momento em que o contato é feito, o sistema aumenta instantaneamente o volume, permitindo que os dados táteis guiem o movimento com alta precisidade. Esse ajuste dinâmico garante que o robô use o sentido certo na hora certa, evitando que as entradas sensoriais entrem em conflito umas com as outras.

O sistema foi colocado à prova em uma série de experimentos rigorosos envolvendo um par de braços robóticos equipados com mãos de vinte e dois dedos. Os pesquisadores incumbiram o robô de seis atividades diferentes: limpar um vaso, apagar um quadro branco, montar peças, girar uma tampa, pipetar líquido e parafusar uma lâmpada. Essas tarefas foram escolhidas porque todas exigem controle fino e contato físico constante. O robô foi comparado contra vários outros modelos de última geração, incluindo aqueles que dependiam apenas de visão e outros que usavam o tato, mas careciam da capacidade de imaginar estados futuros. Os resultados foram claros: o DeCAL teve sucesso em completar as tarefas com muito mais frequência do que qualquer um dos outros sistemas. Por exemplo, na tarefa de parafusar uma lâmpada, onde a visão é frequentemente bloqueada pela mão e a tarefa exige torque preciso, o DeCAL teve sucesso 40 por cento das vezes, enquanto o próximo melhor modelo conseguiu apenas 35 por cento. Na tarefa de limpar um vaso, o DeCAL alcançou uma taxa de sucesso perfeita de 100 por cento, enquanto o melhor modelo concorrente baseado apenas em visão teve sucesso em apenas 30 por cento das vezes.

Talvez ainda mais impressionante fosse a capacidade do sistema de lidar com situações que ele nunca tinha visto antes. Os pesquisadores testaram o DeCAL em ambientes com fundos diferentes, repletos de objetos aleatórios, sob iluminação fraca e com objetos inteiramente novos que possuíam formas e tamanhos diferentes. Nesses cenários "fora da distribuição", onde o robô não poderia confiar em padrões memorizados, o DeCAL continuou a desempenhar fortemente. Ao ser solicitado a girar uma tampa em um copo novo e não visto, o sistema teve sucesso 75 por cento das vezes, superando significativamente seus competidores. Isso sugere que o robô não está apenas memorizando um conjunto específico de movimentos, mas está realmente aprendendo os princípios físicos subjacentes de como os objetos interagem, permitindo que ele se adapie a novos desafios sobre a marcha.

Os pesquisadores também observaram de perto como o sistema aprendeu a prever o futuro. Ao analisar as previsões internas do robô, descobriram que ele conseguia prever com precisão as forças e deformações que ocorreriam durante uma interação. Quando o robô previa quanta força seria necessária para girar uma tampa ou como uma superfície macia se deformaria, essas previsões alinhavam-se de perto com a realidade física real. Essa capacidade de simular a física do mundo internamente é o que confere ao robô seu "senso comum". Permite que o sistema entenda que, se ele pressionar demais, o objeto pode escorregar, ou se ele girar muito devagar, a tarefa levará tempo demais. Esse conhecimento implícito de física, derivado da combinação de visão e tato, é o que permite ao robóba agir com tal fluidez e confiança.

Apesar desses sucessos, os autores tomam o cuidado de notar as limitações de seu trabalho. O sistema depende fortemente da precisão de seus sensores táteis e, se esses sensores se tornarem ruidosos ou descalibrados, o desempenho do robô poderá degradar-se. Adicionalmente, a configuração atual requer um operador humano para demonstrar as tarefas usando um sistema de teleoperação, o qual não fornece ao operador um senso de tato. Isso significa que os dados de treinamento podem não capturar perfeitamente os ajustes sutis que um humano faria se pudesse sentir o objeto por si mesmo. Os pesquisadores também apontam que seu modelo ainda não foi treinado em uma escala massiva de dados táteis diversos, sugerindo que melhorias futuras poderiam vir da exposição do sistema a uma variedade ainda maior de interações físicas.

O trabalho representa uma mudança na forma como pensamos a inteligência robótica. Em vez de construir robôs que sejam simplesmente mais rápidos ou mais fortes, esta abordagem foca em construir máquinas que possam entender o mundo físico como um lugar dinâmico e interativo. Ao dar ao robô a capacidade de imaginar as consequências de suas ações e de adaptar seus sentidos à situação, os pesquisadores criaram um sistema que parece menos uma máquina seguindo um roteiro e mais um agente capaz de interação genuína. À medida que a tecnologia amadurece, a esperança é que estes sistemas possam eventualmente realizar as tarefas complexas e ricas em contato que definem tanto da vida humana, desde cozinhar e limpar até cuidar de idosos, com uma destreza que corresponda à nossa. O caminho a seguir envolve o refinamento destes sensores, a expansão dos dados de treinamento e a continuação da ponte entre ver, sentir e fazer.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →