← Últimos artigos
💬 NLP

M2{M}^2Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models

O artigo propõe o M2\mathcal{M}^2Tok, um novo tokenizador de ação multi-head multi-codebook que reduz significativamente o erro de reconstrução e melhora o desempenho de modelos Vision-Language-Action ao decompor características latentes em cabeças especializadas com codebooks independentes para capturar melhor a dinâmica fina das ações.

Autores originais: Chunpu Xu, Zhixuan Liang, Yuhao Zhang, Chi-Min Chan, Jessie Wang, Yang Xiao, Mengkang Hu, Xiaokang Yang, Yao Mu

Publicado 2026-09-17
📖 8 min de leitura🧠 Leitura aprofundada

Autores originais: Chunpu Xu, Zhixuan Liang, Yuhao Zhang, Chi-Min Chan, Jessie Wang, Yang Xiao, Mengkang Hu, Xiaokang Yang, Yao Mu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os robôs há muito lutam para se mover com a graça fluida de uma mão humana. Embora a inteligência artificial moderna possa agora escrever poesia, diagnosticar doenças e gerar imagens deslumbrantes, dar a uma máquina a capacidade de manipular fisicamente o mundo continua sendo um desafio persistente. O cerne do problema reside em como os computadores entendem o movimento. Diferente do texto, que é feito de letras distintas, ou de imagens, que são feitas de pixels, as ações físicas de um braço robótico são fluxos contínuos de dados. Um braço robótico não simplesmente salta de uma posição para outra; ele flui através de um número infinito de pequenas posições intermediárias. Para ensinar um robô usando as poderosas modelos de linguagem que impulsionam a IA atual, os engenheiros devem primeiro traduzir esse movimento suave e contínuo em uma série de etapas discretas, de forma muito semelhante a transformar um rio caudaloso em um cordão de contas individuais. Esse processo de tradução é conhecido como tokenização. Se a tradução for muito grosseira, o robô perde os detalhes finos de seu movimento, resultando em ações bruscas e imprecisas que falham em tarefas delicadas. Se a tradução for muito complexa, o computador não consegue processá-la rápido o suficiente para reagir em tempo real.

Por anos, pesquisadores tentaram resolver esse problema de tradução, mas os métodos existentes frequentemente tentam forçar uma peça quadrada em um buraco redondo. Algumas abordagens tratam cada movimento como uma lista simples de categorias fixas, o que ignora o tempo sutil e as relações entre as etapas. Outras tentam comprimir os dados agrupando movimentos, mas frequentemente perdem os detalhes específicos necessários para o controle preciso, como o ângulo exato de um pulso ou o aperto suave de uma pinça. Essa perda de detalhe cria um gargalo, impedindo que os robôs aprendam habilidades complexas como empilhar objetos frágeis ou montar partes intrincadas. O resultado é um robô que pode realizar tarefas amplas e simples, mas tropeça diante das demandas matizadas do mundo real.

Uma equipe de pesquisadores propôs agora uma nova maneira de lidar com essa tradução, oferecendo um método que preserva a riqueza do movimento enquanto mantém os dados compactos o suficiente para serem processados pela IA moderna. Eles chamam seu sistema de M2Tok, uma ferramenta projetada para decompor o fluxo contínuo de ações robóticas em um formato que os modelos de linguagem possam entender sem perder a dinâmica de grão fino necessária para o sucesso. Em vez de tratar todo o corpo do robô como um único bloco monolítico de dados, sua abordagem divide o movimento em canais separados e especializados. Imagine um braço robótico que precisa mover seu ombro, cotovelo, pulso e pinça todos ao mesmo tempo. Métodos antigos tentariam comprimir todos esses diferentes movimentos em um único código, muitas vezes forçando o sistema a escolher entre a precisão para o braço e a precisão para a pinça. O novo método, no entanto, separa esses movimentos em grupos distintos, permitindo que a IA foque nas nuances específicas de cada parte de forma independente.

Os pesquisadores alcançaram isso dividindo os dados de movimento do robô em múltiplas cabeças, onde cada cabeça é responsável por um aspecto diferente do movimento. Uma cabeça pode rastrear a posição do braço, enquanto outra rastreia a abertura e o fechamento da pinça. Crucialmente, cada uma dessas cabeças usa seu próprio dicionário independente de códigos de movimento. Ao usar múltiplos dicionários trabalhando em paralelo, o sistema cria um número vasto de combinações possíveis, muito mais do que um único dicionário poderia oferecer. Esse poder combinatório permite que o sistema represente uma variedade muito maior de movimentos com alta precisão. É semelhante a como um músico pode criar um número infinito de melodias combinando um conjunto limitado de notas através de diferentes instrumentos; o novo sistema combina conjuntos limitados de códigos de movimento através de diferentes "instrumentos" do corpo do robô para recriar ações complexas com uma fidelidade notável.

Para testar essa ideia, os pesquisadores treinaram seu sistema em uma grande coleção de tarefas robóticas simuladas, variando desde martelar um bloco até pegar diversas garrafas e colocar recipientes sobre pratos. Eles compararam seu novo método contra várias técnicas existentes que têm sido usadas na área. Os resultados mostraram uma vantagem clara para a nova abordagem. Em uma série de doze tarefas de simulação, o robô usando o novo método teve sucesso em 51 por cento de suas tentativas, superando significativamente o próximo melhor método, que teve sucesso em apenas 45 por cento dos casos. A melhoria foi ainda mais dramática em tarefas difíceis que exigiam alta precisão. Por exemplo, em uma tarefa envolvendo o movimento de uma lata para uma panela, o novo método teve sucesso quase duas vezes mais frequentemente do que a abordagem anterior mais bem sucedida. Em outra tarefa envolvendo a colocação de uma caixa de hambúrguer e batata frita sobre uma bandeja, o novo método alcançou uma taxa de sucesso de 64 por cento, enquanto o método anterior mais bem sucedido conseguiu apenas 52 por cento.

Os pesquisadores também testaram o sistema em um conjunto diferente de ambientes simulados para ver se as habilidades poderiam ser transferidas para novas situações. Aqui, o novo método demonstrou novamente desempenho superior, alcançando uma taxa de sucesso de 28 por cento em comparação aos 21 por cento da principal alternativa. A diferença mais marcante apareceu em uma tarefa que exigia que o robô pegasse uma berinjela e a colocasse em um cesto. A berinjela é um objeto de formato irregular que é difícil de agarrar, e os métodos anteriores falharam totalmente em resolver essa tarefa. O novo método, no entanto, teve sucesso 33 por cento das vezes, sugerindo que sua capacidade de capturar detalhes finos permitiu que ele lidasse com a geometria complexa do objeto onde outros não conseguiram.

Para garantir que esses resultados não fossem apenas um produto da simulação, a equipe pegou seus modelos treinados e os testou em robôs do mundo real. Eles usaram uma plataforma móvel equipada com quatro braços robóticos e uma câmera, pedindo aos robôs que realizassem três tarefas diferentes: tocar um sino, colocar um recipiente em um prato e pegar diferentes garrafas. Estes foram testes zero-shot, o que significa que os robôs nunca tinham visto esses objetos ou ambientes específicos no mundo real; eles tiveram que confiar inteiramente no que aprenderam na simulação. O novo método superou novamente os outros, alcançando uma taxa de sucesso média de 33 por cento nas três tarefas, comparado ao máximo de 28 por cento da melhor alternativa. A evidência visual desses testes mostrou os robôs identificando com sucesso as posições dos objetos e executando operações de preensão precisas, confirmando que a tradução de alta qualidade dos dados de movimento se manteve quando os robôs deixaram o computador e entraram no mundo físico.

Além da precisão, os pesquisadores também observaram quão rápido o sistema poderia rodar. Para um robô ser útil, ele deve tomar decisões rapidamente o suficiente para reagir ao seu ambiente. O novo método permitiu que o robô operasse em uma frequência de mais de 8 hertz, o que significa que ele podia tomar mais de oito decisões a cada segundo. Esta é uma melhoria significativa em relação aos métodos antigos que operavam a apenas 2 hertz. Além disso, quando os pesquisadores otimizaram o sistema para velocidade usando um motor de processamento especializado, o robô pôde atingir uma frequência de 56 hertz, excedendo em muito a velocidade necessária para a maioria das tarefas de manipulação em tempo real. Essa combinação de alta precisão e alta velocidade sugere que o novo método pode ser uma solução prática para implantar robôs avançados em ambientes dinâmicos.

O sucesso deste trabalho baseia-se em uma mudança fundamental na forma como os dados de movimento são processados. Ao rejeitar a ideia de que todo movimento deve ser comprimido em um código único e uniforme, os pesquisadores permitiram que o sistema respeitasse a natureza única de diferentes partes do corpo do robô. A separação do movimento em canais independentes, combinada com o uso de múltiplos dicionários especializados, criou um sistema que podia capturar os detalhes sutis e de alta frequência do movimento que os métodos anteriores perderam. Essa abordagem não exigiu a mudança da arquitetura subjacente dos modelos de linguagem que impulsionam os robôs; em vez disso, forneceu uma maneira melhor de alimentar os dados neles. O resultado é um robô que pode entender e executar tarefas físicas complexas com um nível de destreza que era anteriormente inalcançável, preenchendo a lacuna entre a inteligência digital dos modelos de linguagem e a realidade física do mundo que eles devem navegar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →