← Derniers articles
🤖 AI

PACT-WAM: Predicting Actions and Visual Foresight with Compact Temporal Encoding for Robot Manipulation

PACT-WAM est un modèle d'action-monde compact qui prédit efficacement des trajectoires d'action de 16 étapes et des prévisions visuelles multi-vues correspondantes grâce à un encodage temporel hiérarchique et un échantillonnage par flux conditionnel, atteignant des taux de réussite élevés dans les tâches de manipulation robotique tout en permettant une révision de propositions basée sur la vision et le langage pour une amélioration ultérieure des performances.

Auteurs originaux : Yushan Liu, Jingjing Fan, Shoujie Li, Yifan Xie, Xiao-Ping Zhang, Wenbo Ding

Publié 2026-09-17
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Yushan Liu, Jingjing Fan, Shoujie Li, Yifan Xie, Xiao-Ping Zhang, Wenbo Ding

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé Technique : PACT-WAM

Problématique

Les politiques de manipulation robotique nécessitent deux formes d'informations temporelles : l'historique pour fournir un contexte au mouvement et aux interactions antérieures, et la prévision visuelle pour prédire les changements d'état et évaluer les actions proposées. Bien que les modèles Monde-Action (WAMs) connectent efficacement l'historique, les actions et les observations futures, ils font face à un goulot d'étranglement computationnel important. Les représentations denses des observations passées et futures entraînent des coûts de traitement substantiels ; par exemple, encoder 16 images d'historique avec 64 jetons chacune nécessite 1 024 jetons par vue, et les prévisions multi-étapes ajoutent des séquences de latents visuels distinctes. Les méthodes existantes traitent souvent ces défis de manière isolée — soit en compressant l'historique, soit en utilisant une prévision visuelle modulaire avec des contrôleurs séparés, soit en omettant la génération de futur lors de l'inférence. Le défi central est de concevoir des représentations compactes qui préservent la couverture historique et fournissent des états décodables de manière indépendante à chaque transition, tout en établissant un protocole pour utiliser ces prévisions afin de guider l'exécution sans un surcoût computationnel prohibitif.

Méthodologie : PACT-WAM

Les auteurs proposent PACT-WAM (Predicting Actions and Visual Foresight with Compact Temporal Encoding), un modèle monde-action qui génère conjointement une trajectoire d'action de 16 étapes et sa prévision visuelle multi-vues temporellement correspondante via l'échantillonnage de flux conditionnel. L'architecture repose sur trois choix de conception clés :

1. Encodage hiérarchique de l'historique

Au lieu d'un encodage uniforme, PACT-WAM emploie une allocation d'historique basée sur la récence. Il assigne des représentations spatiales grossières aux observations plus anciennes et des représentations plus fines aux plus récentes.

  • Mécanisme : Utilisant un backbone DINOv3 ViT-B/16 gelé, le modèle traite 16 images d'historique. Les 8 images les plus anciennes sont compressées à 4 jetons par vue, les 6 intermédiaires à 16 jetons, et les 2 plus récentes à 64 jetons.
  • Efficacité : Cela permet de conserver l'ensemble des 16 observations en utilisant seulement 256 jetons par vue, soit une réduction de 75 % par rapport à l'encodage dense (1 024 jetons), tout en maintenant une couverture temporelle élevée.
  • Intégration : Ces caractéristiques compressées sont fusionnées et projetées dans le modèle de langage Qwen3-VL-4B pour former un contexte partagé hth_t aux côtés de l'instruction de la tâche.

2. Génération conjointe de flux Action-Visuel

PACT-WAM utilise un transformateur de flux partagé avec une attention causale par transition pour mettre à jour conjointement l'action continue et les états visuels.

  • Latents Visuels : Les images futures sont représentées par des latents TiTok-VAE continus (K=32K=32 positions par image) sans sous-échantillonnage temporel. Cela garantit que chaque action est associée à un état visuel subséquent décodable de manière indépendante.
  • Backbone Partagé : Le transformateur reçoit des états d'action et visuels bruités, un embedding de temps de flux, et le contexte fixe. Il utilise un masque de bloc-causal où les requêtes dans le bloc jj (représentant la jj-ème transition) peuvent porter attention à toutes les positions dans les blocs kjk \leq j.
  • Têtes Doubles : Deux têtes de vélocité spécifiques à la modalité (gag_a pour les actions, gvg_v pour les visuels) prédisent les vélocités dans des espaces normalisés. Les modalités échangent des informations pendant l'échantillonnage grâce à leur dépendance partagée aux états bruités dans le préfixe temporel autorisé.
  • Entraînement : Le modèle est entraîné par correspondance de flux conditionnel (conditional flow matching) avec un objectif de régression de vélocité à chemin linéaire, optimisant les branches de compression, le chemin de contexte, le transformateur de flux et les têtes de sortie, tout en gardant les encodeurs/décodeurs DINOv3 et TiTok-VAE gelés.

3. Revue de Proposition (PR)

Pour guider l'exécution, PACT-WAM introduit un mécanisme de Revue de Proposition utilisant un Modèle de Langage Visuel (VLM).

  • Processus : Quatre requêtes VLM parallèles évaluent des préfixes de prévision imbriqués à 4, 8, 12 et 16 étapes. Elles évaluent la progression cohérente avec la tâche et détectent les échecs visibles (ex: désalignement, collisions).
  • Logique d'Exécution : Le contrôleur sélectionne le plus grand préfixe consécutivement approuvé en dessous de tout veto signalé. Si une proposition est rejetée, le système effectue un rééchantillonnage conjoint (jusqu'à trois tentatives) dans un budget limité. Si toutes les tentatives échouent, l'épisode se termine.

Contributions Clés

  1. Allocation d'Historique Basée sur la Récence : Le papier introduit une stratégie qui alloue 256 jetons par vue en priorisant les trames récentes. Sur le benchmark LIBERO, cela surpasse l'encodage uniforme des mêmes 16 trames (98,6 % contre 87,5 % de succès) et atteint une performance comparable à l'encodage dense (98,0 %) avec 75 % de jetons d'historique en moins.
  2. Génération Conjointe dans un Espace Latent Compact : PACT-WAM génère conjointement les trajectoires d'action et les états visuels dans un espace latent compact par image, fournissant une prévision décodable de manière indépendante à chaque transition physique. Cela permet au mécanisme de Revue de Proposition de valider les préfixes d'exécution, s'appuyant sur les cadres unifiés monde-action en intégrant l'encodage d'historique compact et la revue de proposition.
  3. Performance avec Amélioration au Temps de Test : La politique de base atteint des taux de succès élevés dans les simulations et les environnements réels. L'ajout de la Revue de Proposition apporte un gain significatif au temps de test, améliorant la robustesse sans réentraîner la politique de base.

Résultats Expérimentaux

Le modèle a été évalué sur LIBERO, RoboTwin 2.0 et une plateforme réelle AgileX Piper.

  • LIBERO (Simulation) :
    • Sans PR : 98,6 % de succès moyen.
    • Avec PR : 99,5 % de succès moyen (atteignant 100 % sur les suites Object et Goal).
  • RoboTwin 2.0 (Simulation) :
    • Sans PR : 92,3 % de succès moyen sur 50 tâches bimanuelles.
    • Avec PR : 93,4 % de succès moyen.
  • Réel Piper :
    • Sans PR : 78,0 % de succès moyen sur les tâches de tri, de transfert et de nettoyage.
    • Avec PR : 86,7 % de succès moyen.
  • Études d'Ablation :
    • Historique : La hiérarchie de jetons 8:6:2 surpasse nettement l'encodage uniforme et l'encodage dense en termes d'efficacité et de succès.
    • Génération Conjointe : L'entraînement conjoint des actions et des visuels améliore le succès du contrôle (98,6 %) par rapport aux variantes action-seule (93,6 %) ou visuel-auxiliaire (96,4 %).
    • Capacité Visuelle : Augmenter la capacité latente de K=32K=32 à K=64K=64 améliore la fidélité de la prévision (PSNR, SSIM) mais réduit légèrement le succès du contrôle (97,3 % contre 98,6 %), suggérant un compromis où le K=32K=32 par défaut équilibre performance et coût computationnel.
    • Revue de Proposition : La PR filtre efficacement les trajectoires défaillantes, les aperçus prédits réduisant les taux de faux rejets par rapport à l'utilisation des seules observations actuelles.

Signification et Revendications

Le papier affirme que PACT-WAM répond avec succès au compromis entre coût de représentation et disponibilité de la prévision visuelle pour les décisions d'exécution. En combinant l'encodage d'historique hiérarchique avec des latents visuels compacts et décodables, le modèle permet un échantillonnage conjoint de trajectoires d'actions et de prévisions temporellement couplées. Cette architecture permet un protocole de Revue de Proposition qui guide l'exécution en validant des préfixes imbriqués, améliorant ainsi la robustesse dans les contextes de manipulation simulés et réels.

Les auteurs soulignent que leur approche préserve l'information temporelle nécessaire à la sélection d'actions tout en réduisant drastiquement le nombre de jetons requis pour l'historique. Ils notent que si la politique de base est compétitive, l'intégration de la prévision visuelle avec un mécanisme de revue basé sur un VLM offre une voie distincte pour améliorer la fiabilité dans les tâches de manipulation complexes. Le travail met en évidence que une plus haute fidélité de prévision ne corrèle pas toujours avec un succès de contrôle plus élevé, suggérant que l'utilité de la prévision pour la prise de décision est plus critique que la qualité brute de la reconstruction.

Limites notées par les auteurs : Le système actuel utilise une allocation basée sur la récence fixe qui n'est pas adaptative à la pertinence de la tâche, un horizon fixe de 16 étapes, et un processus de revue qui peut manquer des échecs brefs entre les points de contrôle. Des travaux futurs sont suggérés pour explorer la compression adaptative aux tâches et la génération à horizon variable.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →