← Últimos artigos
🤖 machine learning

Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

A Dynin-Robotics introduz um modelo de difusão unificado omnimodal que trata linguagem, visão e ações como tokens discretos para aprender conjuntamente a predição de objetivos, modelagem de dinâmica e geração de ações, alcançando um desempenho competitivo em múltiplos benchmarks através de modelagem de trajetória compartilhada e escalonamento em tempo de teste.

Autores originais: Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi, Hyeonggeun Kim, Jaeyoung Do

Publicado 2026-09-14
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi, Hyeonggeun Kim, Jaeyoung Do

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os robôs há muito tempo lutam para entender o mundo da mesma forma que os humanos. Embora uma máquina possa ser programada para mover seu braço para uma coordenada específica, ela frequentemente falha quando a tarefa exige a compreensão de uma instrução vaga como "passe-me algo para cortar o pacote". Para resolver isso, pesquisadores estão construindo sistemas que conectam linguagem, visão e movimento físico em um único cérebro. Esses sistemas, conhecidos como modelos de visão-linguagem-ação, tentam aprender não apenas o que um objeto é, mas como ele se comporta e como manipulá-lo. O desafio tem sido que a maioria das abordagens atuais trata essas habilidades separadamente: uma parte do sistema pode entender as palavras, outra pode reconhecer a imagem e uma terceira pode calcular os comandos motores. Essa separação frequentemente deixa o robô confuso quando o mundo real muda ou quando as instruções são formuladas de maneiras inesperadas.

Uma equipe de pesquisadores da Universidade Nacional de Seul introduziu uma nova abordagem chamada Dynin-Robotics, que unifica essas habilidades separadas em um modelo coeso. Em vez de construir um cérebro de robô com diferentes módulos para diferentes tarefas, eles criaram um sistema único que aprende a prever o futuro de várias maneiras ao mesmo tempo. Imagine um robô que, ao receber uma tarefa, não apenas calcula o próximo movimento, mas também imagina como a cena será após esse movimento, qual deve ser o estado final do objetivo e como descrever a tarefa em palavras. Ao treinar um único modelo para lidar com todas essas previsões simultaneamente, os pesquisadores descobriram que o robô torna-se muito melhor em seguir instruções, mesmo quando essas instruções são formuladas de maneira diferente de como foi treinado.

O núcleo deste sistema é um método chamado difusão mascarada (masked diffusion). Em termos simples, este é um processo de aprendizagem onde o modelo é mostrado uma sequência de informações — como um vídeo de uma tarefa, uma instrução escrita e os movimentos do robô — mas algumas partes dessa sequência são ocultadas ou "mascaradas". O trabalho do modelo é olhar para as partes visíveis e adivinhar quais devem ser as partes ocultas. Por exemplo, ele pode ver a imagem de uma xícara e as palavras "pegue a xícara", mas os dados de movimento estão ocultos, então ele deve prever o movimento correto. Em outro cenário, ele pode ver o movimento e a instrução, mas a imagem final da xícara na mão está oculta, então ele deve prever o resultado. Ao praticar esses diferentes tipos de jogos de adivinhação em um conjunto massivo de dados de mais de 1,3 milhão de trajetórias de robôs, o modelo aprende uma compreensão profunda de como a linguagem, a visão e a ação estão conectadas.

O que torna esta abordagem única é que o mesmo modelo pode alternar entre esses diferentes papéis instantaneamente. Ele pode agir como uma política, decidindo qual ação tomar a seguir; como um modelo de mundo, prevendo o que a câmera verá após uma ação; como um preditor de objetivos, visualizando o estado de sucesso final de uma tarefa; ou como um professor, reconstruindo a instrução original a partir de um vídeo do robô trabalhando. Essa flexibilidade permite que o sistema use suas próprias previsões para melhorar seu desempenho. Por exemplo, antes de o robô decidir como mover seu braço, ele pode primeiro prever como o estado do objetivo se parece. Ele então usa esse objetivo previsto como um guia para refinar seu plano de ação. Esse processo de olhar adiante e ajustar o plano em tempo real ajuda o robô a lidar com tarefas complexas que exigem alinhamento preciso, como inserir uma flor em um vaso ou empilhar blocos em uma ordem específica.

Os pesquisadores testaram este sistema em uma variedade de benchmarks para ver o quão bem ele se saiu em comparação com outros modelos de robótica líderes. Em tarefas de simulação padrão, o modelo alcançou uma taxa de sucesso de 98,1%, colocando-o entre os melhores do campo. Mais importante ainda, quando testado em tarefas onde as instruções foram alteradas para serem mais indiretas ou abstratas, o sistema mostrou uma capacidade significativa de adaptação. Em um conjunto de experimentos, o modelo foi testado em uma tarefa onde deveria selecionar uma fruta com base em uma descrição como "algo naturalmente doce e suculento", em vez de um comando direto como "pegue a maçã". Enquanto outros modelos tiveram dificuldades com essas mudanças de linguagem, o Dynin-Robotics manteve uma alta taxa de sucesso, demonstrando que havia aprendido o conceito subjacente da tarefa, em vez de apenas memorizar frases específicas.

O sistema também se mostrou eficaz no mundo real. Os pesquisadores implantaram o modelo em um braço robótico físico conhecido como Franka Research 3. Em uma série de testes no mundo real envolvendo a coleta de frutas, a classificação de cubos coloridos e o empilhamento deles em ordens específicas, o robô alcançou uma taxa média de sucesso de 78,4% em quatro diferentes condições de manipulação. Este desempenho foi particularmente forte em tarefas que exigiam seguir uma sequência de etapas, como empilhar cubos em uma ordem de cores especificada pelo usuário. A capacidade de visualizar o objetivo e as etapas intermediárias permitiu que o robô corrigisse seu curso se cometesse um erro, uma capacidade que muitas vezes falta em sistemas mais simples.

Além de sua capacidade de controlar um robô, o modelo demonstrou uma capacidade surpreendente de compreender e gerar descrições. Ao ser mostrado um vídeo de um robô realizando uma tarefa, o sistema podia descrever com precisão o que estava acontecendo, usando verbos como "pegar", "colocar" e "dobrar", e identificando objetos por sua cor e localização. Inversamente, ao receber uma descrição de tarefa, ele podia gerar uma previsão visual de como a cena final ficaria. Essas capacidades sugerem que o modelo construiu uma representação interna rica do mundo físico que vai além do simples controle motor.

Para tornar este sistema rápido o suficiente para uso em tempo real, os pesquisadores também desenvolveram um método especializado para executar o modelo. Como o modelo trabalha refinando iterativamente suas suposições, ele pode ser lento se tiver que processar cada etapa uma por uma. A equipe criou uma técnica que permite ao modelo prever e comprometer-se com múltiplos passos de movimento ao mesmo tempo. Esta otimização acelerou o processo de tomada de decisão do robô em quase 30 vezes em comparação com o método padrão, tornando viável a execução do modelo complexo em um hardware que consiga acompanhar a velocidade de um robô físico.

As descobertas deste trabalho sugerem que tratar o aprendizado de robôs como um problema de previsão unificado é uma estratégia poderosa. Ao combinar a capacidade de entender a linguagem, prever mudanças visuais e gerar ações em um único framework, os pesquisadores criaram um sistema que é mais robusto e adaptável do que modelos anteriores. O sucesso do Dynin-Robotics indica que, quando um robô consegue imaginar o futuro e entender o contexto de uma tarefa, ele se torna muito mais capaz de lidar com a natureza imprevisível do mundo real. Embora ainda haja trabalho a ser feito, particularmente na extensão dessas capacidades para sequências de ações mais longas e complexas, esta abordagem oferece um caminho promissor para robôs que possam verdadeiramente entender e interagir com seu ambiente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →