← Últimos artigos
🤖 AI

PACT-WAM: Predicting Actions and Visual Foresight with Compact Temporal Encoding for Robot Manipulation

O PACT-WAM é um modelo de ação-mundo compacto que prevê eficientemente trajetórias de ação de 16 passos e previsões visuais multivisão correspondentes usando codificação temporal hierárquica e amostragem de fluxo condicional, alcançando altas taxas de sucesso em tarefas de manipulação robótica ao mesmo tempo em que permite a revisão de propostas baseada em visão-linguagem para maior aumento de desempenho.

Autores originais: Yushan Liu, Jingjing Fan, Shoujie Li, Yifan Xie, Xiao-Ping Zhang, Wenbo Ding

Publicado 2026-09-17
📖 1 min de leitura☕ Leitura rápida

Autores originais: Yushan Liu, Jingjing Fan, Shoujie Li, Yifan Xie, Xiao-Ping Zhang, Wenbo Ding

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: PACT-WAM

Definição do Problema

Políticas de manipulação robótica requerem duas formas de informação temporal: histórico para fornecer contexto para o movimento e interações prévias, e previsão visual para prever mudanças de estado e avaliar ações propostas. Embora os Modelos de Mundo-Ação (WAMs) conectem efetivamente histórico, ações e observações futuras, eles enfrentam um gargalo computacional significativo. Representações densas de observações passadas e futuras incorrem em custos de processamento substanciais; por exemplo, codificar 16 quadros de histórico com 64 tokens cada exige 1.024 tokens por visão, e previsões de múltiplos passos adicionam sequências de latentes visuais separadas. Métodos existentes frequentemente abordam esses desafios isoladamente — seja comprimindo o histórico, usando previsão visual modular com controladores separados, ou omitindo a geração de futuro durante a inferência. O desafio central é projetar representações compactas que preservem a cobertura histórica e forneçam estados decodificáveis de forma independente em cada transição, estabelecendo um protocolo para usar essas previsões para guiar a execução sem um overhead computacional proibitivo.

Metodologia: PACT-WAM

Os autores propõem o PACT-WAM (Predicting Actions and Visual Foresight with Compact Temporal Encoding), um modelo de mundo-ação que gera conjuntamente uma trajetória de ação de 16 passos e sua correspondente previsão visual temporalmente através de amostragem de fluxo condicional. A arquitetura baseia-se em três escolhas de design fundamentais:

1. Codificação de Histórico Hierárquica

Em vez de uma codificação uniforme, o PACT-WAM utiliza uma alocação de histórico baseada na recência. Ele atribui representações espaciais grosseiras às observações mais antigas e representações mais finas às mais recentes.

  • Mecanismo: Usando um backbone DINOv3 ViT-B/16 congelado, o modelo processa 16 quadros de histórico. Os 8 quadros mais antigos são comprimidos para 4 tokens por visão, os 6 intermediários para 16 tokens, e os 2 mais recentes para 64 tokens.
  • Eficiência: Isso retém todas as 16 observações usando apenas 256 tokens por visão, uma redução de 75% em comparação com a codificação densa (1.024 tokens), mantendo uma alta cobertura temporal.
  • Integração: Essas características comprimidas são fundidas e projetadas no modelo de linguagem Qwen3-VL-4B para formar um contexto compartilhado hth_t junto com a instrução da tarefa.

2. Geração Conjunta de Fluxo de Ação-Visual

O PACT-WAM utiliza um transformer de fluxo compartilhado com atenção causal por transição para atualizar conjuntamente a ação contínua e os estados visuais.

  • Latentes Visuais: Imagens futuras são representadas por latentes TiTok-VAE contínuos (K=32K=32 posições por imagem) sem downsampling temporal. Isso garante que cada ação seja emparelhada com um estado visual subsequente decodificável de forma independente.
  • Backbone Compartilhado: O transformer recebe estados de ação e visuais ruidosos, um embedding de tempo de fluxo e o contexto fixo. Ele utiliza uma máscara de causalidade de bloco onde as queries no bloco jj (representando a jj-ésima transição) podem atender a todas as posições nos blocos kjk \leq j.
  • Cabeças Duplas: Duas cabeças de velocidade específicas de modalidade (gag_a para ações, gvg_v para visuais) preveem velocidades em espaços normalizados. As modalidades trocam informações durante a amostragem através de sua dependência compartilhada dos estados ruidosos dentro do prefixo temporal permitido.
  • Treinamento: O modelo é treinado usando correspondência de fluxo condicional (conditional flow matching) com um objetivo de regressão de velocidade de caminho linear, otimizando os ramos de compressão, o caminho de contexto, o transformer de fluxo e as cabeças de saída, mantendo os encoders/decoders DINOv3 e TiTok-VAE congelados.

3. Revisão de Proposta (PR)

Para guiar a execução, o PACT-WAM introduz um mecanismo de Revisão de Proposta (Proposal Review) utilizando um Modelo de Linguagem de Visão (VLM).

  • Processo: Quatro requisições paralelas de VLM avaliam prefixos de previsão aninhados em 4, 8, 12 e 16 passos. Elas avaliam o progresso consistente com a tarefa e detectam falhas visíveis (ex: desalinhamento, colisões).
  • Lógica de Execução: O controlador seleciona o maior prefixo consecutivamente aprovado abaixo de qualquer veto relatado. Se uma proposta for rejeitada, o sistema realiza uma reamostragem conjunta (até três tentativas) dentro de um orçamento limitado. Se todas as tentativas falharem, o episódio termina.

Principais Contribuições

  1. Alocação de Histórico Baseada na Recência: O artigo introduz uma estratégia que aloca 256 tokens por visão ao priorizar quadros recentes. No benchmark LIBERO, isso supera a codificação uniforme dos mesmos 16 quadros (98,6% vs. 87,5% de sucesso) e alcança desempenho comparável à codificação densa (98,0%) com 75% menos tokens de histórico.
  2. Geração Conjunta em Espaço Latente Compacto: O PACT-WAM gera conjuntamente trajetórias de ação e estados visuais em um espaço latente compacto por imagem, fornecendo uma previsão decodificável de forma independente em cada transição física. Isso permite que o mecanismo de Revisão de Proposta valide prefixos de execução, baseando-se em frameworks unificados de mundo-ação ao integrar codificação de histórico compacta e revisão de proposta.
  3. Desempenho com Melhoria em Tempo de Teste: A política base alcança altas taxas de sucesso em simulações e plataformas do mundo real. A adição da Revisão de Proposta proporciona um aumento significativo no tempo de teste, melhorando a robustez sem o retreinamento da política principal.

Resultados Experimentais

O modelo foi avaliado no LIBERO, RoboTwin 2.0 e em uma plataforma real AgileX Piper.

  • LIBERO (Simulação):
    • Sem PR: 98,6% de sucesso médio.
    • Com PR: 99,5% de sucesso médio (atingindo 100% nos conjuntos Object e Goal).
  • RoboTwin 2.0 (Simulação):
    • Sem PR: 92,3% de sucesso médio em 50 tarefas bimanuais.
    • Com PR: 93,4% de sucesso médio.
  • Piper Real (Mundo Real):
    • Sem PR: 78,0% de sucesso médio nas tarefas de Sorting, Handover e Cleanup.
    • Com PR: 86,7% de sucesso médio.
  • Estudos de Ablação:
    • Histórico: A hierarquia de tokens 8:6:2 supera significativamente a codificação uniforme e a densa em termos de eficiência e sucesso.
    • Geração Conjunta: O treinamento conjunto de ações e visuais melhora o sucesso do controle (98,6%) em comparação com variantes apenas de ação (93,6%) ou auxiliares visuais (96,4%).
    • Capacidade Visual: Aumentar a capacidade latente de K=32K=32 para K=64K=64 melhora a fidelidade da previsão (PSNR, SSIM), mas reduz ligeiramente o sucesso do controle (97,3% vs. 98,6%), sugerindo um compromisso onde o padrão K=32K=32 equilibra desempenho e custo computacional.
    • Revisão de Proposta: A PR filtra efetivamente trajetórias falhas, com previsões de previews reduzindo as taxas de falso rejeito em comparação ao uso apenas de observações atuais.

Significância e Alegações

O artigo alega que o PACT-WAM aborda com sucesso o compromisso entre custo de representação e a disponibilidade de previsão visual para decisões de execução. Ao combinar a codificação de histórico hierárquica com latentes visuais compactos e decodificáveis, o modelo permite a amostragem conjunta de trajetórias de ação e previsões temporalmente pareadas. Esta arquitetura permite um protocolo de Revisão de Proposta que guia a execução validando prefixos aninhados, aumentando assim a robustez em configurações de simulação e do mundo real.

Os autores enfatizam que sua abordagem preserva a informação temporal necessária para a seleção de ações enquanto reduz drasticamente a contagem de tokens necessária para o histórico. Eles observam que, embora a política base seja competitiva, a integração da previsão visual com um mecanismo de revisão baseado em VLM oferece um caminho distinto para melhorar a confiabilidade em tarefas de manipulação complexas. O trabalho destaca que uma maior fidelidade de previsão nem sempre se correlaciona com um maior sucesso de controle, sugerindo que a utilidade da previsão para a tomada de decisão é mais crítica do que a qualidade bruta de reconstrução.

Limitações observadas pelos autores: O sistema atual utiliza uma alocação de recência fixa que não se adapta à relevância da tarefa, um horizonte fixo de 16 passos e um processo de revisão que pode perder falhas breves entre os checkpoints. Trabalhos futuros sugerem explorar compressão adaptativa à tarefa e geração de horizonte variável.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →