← Últimos artigos
💻 computer science

DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting

O DriftingVLA é um modelo nativo de visão-linguagem-ação de etapa única que utiliza um objetivo de deriva de distribuição com Deriva Temporal por Dimensão para gerar blocos de ação completos em uma única passagem direta, alcançando o estado da arte em tarefas de benchmark ao mesmo tempo em que oferece uma aceleração de 3,36 vezes em relação aos métodos convencionais baseados em fluxo de múltiplas etapas.

Autores originais: Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

Publicado 2026-09-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Robôs que podem ver, compreender a linguagem e mover-se com fluidez humana têm sido o sonho da inteligência artificial há muito tempo. Durante anos, pesquisadores construíram sistemas que combinam uma poderosa compreensão visual e linguística com a capacidade de controlar braços robóticos. Esses sistemas, conhecidos como modelos de visão-linguagem-ação, atuam como o cérebro do robô, processando o que a câmera vê e as palavras que um humano diz, para então decidir como mover as articulações do robô para completar uma tarefa. No entanto, um gargalo significativo tem impedido essas máquinas de alcançar uma verdadeira responsividade em tempo real. Para gerar uma sequência suave de movimentos, esses modelos tradicionalmente dependem de um processo complexo de múltiplas etapas. Imagine tentar desenhar um círculo perfeito fazendo pequenas correções hesitantes em cada ponto ao longo da linha; o robô tem que calcular um caminho, dar um passo, verificar seu trabalho e, então, dar outro passo, repetindo este ciclo muitas vezes para cada movimento que faz. Embora este método produza resultados de alta qualidade, ele é lento, introduzindo um atraso que faz o robô parecer lento e pouco responsivo em um mundo dinâmico.

Uma equipe de pesquisadores apresentou agora uma nova abordagem que muda fundamentalmente a forma como esses robôs planejam seus movimentos, permitindo que gerem uma sequência completa de ações em um único instante. O trabalho deles, centrado em um sistema que chamam de DriftingVLA, substitui o lento processo de correção iterativa por um método que aprende a prever todo o movimento futuro de uma só vez. Em vez de calcular um caminho passo a passo durante a tarefa real, o sistema aprende uma conexão direta entre um ponto de partida aleatório e o movimento final desejado durante sua fase de treinamento. Essa mudança permite que o robô ignore completamente os cálculos repetitivos durante a execução, saltando diretamente para a ação correta. Em testes envolvendo tarefas de manipulação complexas, este novo método não apenas igualou a precisão dos sistemas antigos e mais lentos, mas também tornou o robô mais de três vezes mais rápido, reduzindo o tempo necessário para decidir sobre um movimento de mais de duzentos milissegundos para menos de setenta.

O cerne desta descoberta reside em como os pesquisadores ensinaram o robô a compreender a relação entre suas diferentes partes móveis. Um braço robótico não se move apenas em uma única linha; ele possui múltiplos membros e graus de liberdade que devem trabalhar juntos, como mover-se para frente, rotacionar e abrir uma garra. Tentativas anteriores de acelerar esses sistemas frequentemente tratavam todo o movimento como um grande bloco ou o dividiam em momentos minúsculos e desconectados no tempo. A nova abordagem, no entanto, reconheceu que cada direção específica de movimento — como o levantamento vertical de uma garra ou a rotação de um pulso — possui seu próprio ritmo e padrão estatístico único. Os pesquisadores desenvolveram uma técnica chamada Per-Dimension Temporal Drifting (Desvio Temporal por Dimensão), que trata o histórico completo de cada direção de movimento individual como uma unidade separada a ser aprendida. Isso permite que o sistema compreenda as nuances específicas de como uma garra deve abrir ou como um pulso deve girar, sem forçar esses diferentes movimentos a se conformarem a uma regra matemática única e rígida.

Crucialmente, este método não sacrifica a capacidade do robô de coordenar seus membros. Mesmo que o sistema aprenda os padrões de cada direção de movimento separadamente, ele ainda gera todo o plano de ação como um todo unificado. O cérebro do robô, que compreende linguagem e visão, permanece intacto e continua a guiar o especialista em ação que produz os movimentos. Ao treinar o sistema para refinar suas previsões através de muitos cenários de "e se" simultaneamente, os pesquisadores garantiram que a decisão de etapa única final fosse tão precisa quanto o resultado de um cálculo lento de múltiplamente etapas. Isso significa que o robô ainda pode realizar tarefas delicadas, como despejar líquido de um recipiente para outro ou empilhar blocos com dois braços trabalhando em sincronia, sem a hesitação que assolava os modelos anteriores.

Os pesquisadores testaram este novo sistema tanto em ambientes simulados quanto no mundo real para ver se a velocidade vinha ao custo da confiabilidade. Em uma série de simulações desafiadoras envolvendo tarefas como pegar objetos e rearranjá-los, o novo sistema alcançou uma taxa de sucesso de quase 98,3%, superando ligeiramente os melhores modelos de múltiplas etapas existentes. Quando transferido para um cenário do mundo real com braços robóticos físicos, o sistema manteve sua vantagem, obtendo sucesso em 77,67% dos testes em seis tarefas diferentes, incluindo desafios de coordenação de braço único e de braços duplos. Este desempenho foi notavelmente superior a outros métodos de etapa única que tentaram acelerar os sistemas antigos simplesmente encurtando seu processo de cálculo, o que frequentemente resultava em uma queda significativa na precisão. O novo método provou que, ao mudar a forma como o sistema aprende, em vez de apenas como ele calcula, é possível alcançar tanto velocidade quanto precisão.

Além dos números brutos, o estudo destacou os ganhos de eficiência decorrentes da remoção do loop de cálculo repetitivo. No mundo real, onde cada fração de segundo conta, o novo sistema reduziu o tempo necessário para gerar um bloco de movimento de 227,61 milissegundos para 67,67 milissegundos. Isso representa uma aceleração de mais de três vezes, eliminando efetivamente o lag que faz os robôs parecerem desconectados de seu ambiente. Embora o processo de treinamento tenha exigido um pouco mais de poder computacional para lidar com os múltiplos cenários de "e se" durante a fase de aprendizado, este custo é um investimento único. Uma vez treinado, o robô opera com uma eficiência de etapa única e enxuta que não demanda recursos extras. O trabalho demonstra que o futuro da robótica responsiva pode não residir na construção de computadores mais rápidos para rodar algoritmos mais lentos, mas sim no redesenho dos próprios algoritmos para que sejam inerentemente diretos e imediatos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →