← Nieuwste papers
🤖 AI

PACT-WAM: Predicting Actions and Visual Foresight with Compact Temporal Encoding for Robot Manipulation

PACT-WAM is een compact wereldactiemodel dat efficiënt 16-staps actietrajecten en bijbehorende multi-view visuele voorspellingen voorspelt met behulp van hiërarchische temporele codering en conditionele flow-sampling, waarbij het hoge succespercentages bereikt in robotmanipulatietaken terwijl het visie-taal-gebaseerde voorstelbeoordeling mogelijk maakt voor verdere prestatieverbetering.

Oorspronkelijke auteurs: Yushan Liu, Jingjing Fan, Shoujie Li, Yifan Xie, Xiao-Ping Zhang, Wenbo Ding

Gepubliceerd 2026-09-17
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yushan Liu, Jingjing Fan, Shoujie Li, Yifan Xie, Xiao-Ping Zhang, Wenbo Ding

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: PACT-WAM

Probleemstelling

Robotmanipulatiebeleid vereist twee vormen van temporele informatie: historie om context voor beweging en eerdere interacties te bieden, en visuele vooruitblik om de verandering van de staat te voorspellen en voorgestelde acties te beoordelen. Hoewel World-Action Models (WAM's) effectief historie, acties en toekomstige observaties verbinden, kampen ze met een aanzienlijke computationele bottleneck. Dichte representaties van het verleden en de toekomst veroorzaken substantiële verwerkingskosten; bijvoorbeeld, het coderen van 16 historie-frames met elk 64 tokens vereist 1.024 tokens per view, en multi-step voorspellingen voegen aparte visuele latente sequenties toe. Bestaande methoden pakken deze uitdagingen vaak geïsoleerd aan—ofwel door historie te comprimeren, ofwel door modulaire visuele vooruitblik met aparte controllers te gebruiken, ofwel door generatie van de toekomst tijdens inferentie weg te laten. De kernuitdaging is het ontwerpen van compacte representaties die historische dekking behouden en onafhankelijk decodeerbare staten bieden bij elke transitie, terwijl een protocol wordt vastgesteld om deze voorspellingen te gebruiken om uitvoering te sturen zonder buitensporige computationele overhead.

Methodologie: PACT-WAM

De auteurs stellen PACT-WAM voor (Predicting Actions and Visual Foresight with Compact Temporal Encoding), een world-action model dat gezamenlijk een 16-staps actietraject en de bijbehorende temporele multi-view visuele voorspelling genereert via conditional flow sampling. De architectuur rust op drie belangrijke ontwerpkeuzes:

1. Hiërarchische Historie-encoding

In plaats van uniforme encoding gebruikt PACT-WAM een recentie-gebaseerde historie-allocatie. Het wijst grove ruimtelijke representaties toe aan oudere observaties en fijnere representaties aan recentere observaties.

  • Mechanisme: Gebruikmakend van een bevroren DINOv3 ViT-B/16 backbone, verwerkt het model 16 historie-frames. De oudste 8 frames worden gecomprimeerd naar 4 tokens per view, de middelste 6 naar 16 tokens, en de laatste 2 naar 64 tokens.
  • Efficiëntie: Dit behoudt alle 16 observaties met slechts 256 tokens per view, een reductie van 75% vergeleken met dense encoding (1.024 tokens), terwijl de hoge temporele dekking behouden blijft.
  • Integratie: Deze gecomprimeerde kenmerken worden samengevoegd en geprojecteerd in het Qwen3-VL-4B taalmodel om een gedeelde context hth_t te vormen naast de taakinstructie.

2. Gezamenlijke Actie-Visuele Flow Generatie

PACT-WAM maakt gebruik van een gedeelde flow transformer met transitie-wijze causale aandacht om continu actie- en visuele staten gezamenlijk bij te werken.

  • Visuele Latenten: Toekomstige afbeeldingen worden gerepresenteerd door continue TiTok-VAE latenten (K=32K=32 posities per afbeelding) zonder temporele downsampling. Dit zorgt ervoor dat elke actie gekoppeld is aan een onafhankelijk decodeerbare daaropvolgende visuele staat.
  • Gedeelde Backbone: De transformer ontvangt ruisige actie- en visuele staten, een flow-time embedding, en de vaste context. Het gebruikt een block-causaal masker waarbij queries in blok jj (die de jj-de transitie vertegenwoordigt) kunnen attenderen op alle posities in blokken kjk \leq j.
  • Dual Heads: Twee modaliteit-specifieke velocity heads (gag_a voor acties, gvg_v voor visuals) voorspellen snelheden in genormaliseerde ruimtes. De modaliteiten wisselen informatie uit tijdens sampling door hun gedeelde afhankelijkheid van de ruisige staten binnen het toegestane temporele prefix.
  • Training: Het model wordt getraind met conditional flow matching met een linear-path velocity regression objectief, waarbij de compressie-branches, context pathway, flow transformer en output heads worden geoptimaliseerd terwijl de DINOv3 en TiTok-VAE encoders/decoders bevroren blijven.

3. Proposal Review (PR)

Om uitvoering te sturen, introduceert PACT-WAM een Proposal Review mechanisme met behulp van een Vision-Language Model (VLM).

  • Proces: Vier parallelle VLM-verzoeken beoordelen geneste forecast prefixes bij 4, 8, 12 en 16 stappen. Ze evalueren de taak-consistente voortgang en detecteren zichtbare fouten (bijv. misalignement, botsingen).
  • Executie Logica: De controller selecteert het grootste opeenvolgend goedgekeurde prefix onder een eventuele veto. Als een voorstel wordt afgewezen, voert het systeem gezamenlijke resampling uit (tot drie pogingen) binnen een begroot budget. Als alle pogingen falen, eindigt de episode.

Belangrijkste Bijdragen

  1. Recentie-gebaseerde Historie-allocatie: Het paper introduceert een strategie die 256 tokens per view toewijst door recente frames prioriteit te geven. Op de LIBERO benchmark presteert dit beter dan uniforme encoding van dezelfde 16 frames (98,6% vs. 87,5% succes) en bereikt het een prestatie vergelijkbaar met dense encoding (98,0%) met 75% minder historie-tokens.
  2. Gezamenlijke Generatie in Compacte Latente Ruimte: PACT-WAM genereert gezamenlijk actietrajecten en visuele staten in een compacte per-afbeelding latente ruimte, wat een onafhankelijk decodeerbare voorspelling biedt bij elke fysieke transitie. Dit maakt het Proposal Review mechanisme mogelijk om executie-prefixes te valideren, voortbouwend op verenigde world-action frameworks door compacte historie-encoding en proposal review te integreren.
  3. Prestaties met Test-Time Verbetering: Het basisbeleid bereikt hoge succespercentages in simulatie en de echte wereld. De toevoeging van Proposal Review zorgt voor een significante verbetering tijdens de testfase, wat de robuustheid vergroot zonder de kern van het beleid opnieuw te trainen.

Experimentele Resultaten

Het model werd geëvalueerd op LIBERO, RoboTwin 2.0, en een real-world AgileX Piper platform.

  • LIBERO (Simulatie):
    • Zonder PR: 98,6% gemiddeld succes.
    • Met PR: 99,5% gemiddeld succes (bereikt 100% op Object en Goal suites).
  • RoboTwin 2.0 (Simulatie):
    • Zonder PR: 92,3% gemiddeld succes over 50 bimanuele taken.
    • Met PR: 93,4% gemiddeld succes.
  • Real-World Piper:
    • Zonder PR: 78,0% gemiddeld succes over Sorting, Handover, en Cleanup taken.
    • Met PR: 86,7% gemiddeld succes.
  • Ablatie Studies:
    • Historie: De 8:6:2 token hiërarchie presteert aanzienlijk beter dan uniforme encoding en dense encoding in termen van efficiëntie en succes.
    • Gezamenlijke Generatie: Het gezamenlijk trainen van acties en visuals verbetert het controle-succes (98,6%) vergeleken met actie-alleen (93,6%) of visuele-auxiliaire (96,4%) varianten.
    • Visuele Capaciteit: Het vergroten van de latente capaciteit van K=32K=32 naar K=64K=64 verbetert de forecast fidelity (PSNR, SSIM) maar vermindert het controle-succes licht (97,3% vs. 98,6%), wat wijst op een trade-off waarbij de standaard K=32K=32 een balans vindt tussen prestaties en computationele kosten.
    • Proposal Review: PR filtert gefaalde trajecten effectief uit, waarbij voorspelde previews de foutieve afwijzingsratio verlagen vergeleken met het enkel gebruiken van huidige observaties.

Betekenis en Claims

Het paper claimt dat PACT-WAM erin slaagt de trade-off tussen representatiekosten en de beschikbaarheid van visuele vooruitblik voor executiebeslissingen aan te pakken. Door hiërarchische historie-encoding te combineren met compacte, decodeerbare visuele latenten, maakt het model gezamenlijke sampling mogelijk van temporeel gekoppelde acties en voorspellingen. Deze architectuur staat een Proposal Review protocol toe dat de uitvoering stuurt door geneste prefixes te valideren, waardoor de robuustheid in zowel simulatie als real-world settings wordt vergroot.

De auteurs benadrukken dat hun aanpak de noodzakelijke temporele informatie voor actiekeuze behoudt terwijl het aantal tokens dat nodig is voor historie drastisch wordt verminderd. Ze merken op dat hoewel het basisbeleid competitief is, de integratie van visuele vooruitblik met een VLM-gebaseerd reviewmechanisme een duidelijk pad biedt voor het verbeteren van betrouwbaarheid in complexe manipulatietaken. Het werk benadrukt dat een hogere forecast fidelity niet altijd correleert met een hoger controle-succes, wat suggereert dat de utiliteit van de voorspelling voor besluitvorming belangrijker is dan de ruwe reconstructiekwaliteit.

Beperkingen opgemerkt door de auteurs: Het huidige systeem gebruikt een vaste recentie-gebaseerde allocatie die niet adaptief is aan taakrelevantie, een vaste 16-staps horizon, en een reviewproces dat korte fouten tussen checkpoints kan missen. Toekomstig werk suggereert het verkennen van taak-adaptieve compressie en variabele-horizon generatie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →