PACT-WAM: Predicting Actions and Visual Foresight with Compact Temporal Encoding for Robot Manipulation
PACT-WAM ist ein kompaktes World-Action-Modell, das durch hierarchische zeitliche Kodierung und bedingtes Flow-Sampling effizient 16-Schritte-Aktionstrajektorien sowie entsprechende Multi-View-Visuelle-Vorhersagen vorhersagt und dabei hohe Erfolgsraten in Robotermanipulationsaufgaben erzielt, während es gleichzeitig eine vision-language-basierte Vorschlagüberprüfung zur weiteren Leistungssteigerung ermöglicht.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Technisches Resümee: PACT-WAM
Problemstellung
Roboter-Manipulations-Policies benötigen zwei Formen zeitlicher Informationen: Historie, um Kontext für Bewegungen und vorangegangene Interaktionen bereitzustellen, sowie visuelle Voraussicht (Visual Foresight), um Zustandsänderungen vorherzusagen und vorgeschlagene Aktionen zu bewerten. Während World-Action Models (WAMs) Historie, Aktionen und zukünftige Beobachtungen effektiv miteinander verknüpfen, stehen sie vor einem erheblichen Rechenengpass. Dichte Repräsentationen vergangener und zukünftiger Beobachtungen verursachen beträchtliche Verarbeitungskosten; so erfordert beispielsweise das Kodieren von 16 Historien-Frames mit jeweils 64 Tokens 1.024 Tokens pro Ansicht, und mehrstufige Prognosen fügen zusätzliche visuelle Latent-Sequenzen hinzu. Bestehende Methoden adressieren diese Herausforderungen oft isoliert – entweder durch Komprimierung der Historie, die Verwendung modularer visueller Voraussicht mit separaten Controllern oder durch den Verzicht auf die Generierung der Zukunft während der Inferenz. Die Kernherausforderung besteht darin, kompakte Repräsentationen zu entwerfen, die die historische Abdeckung bewahren und unabhängig dekodierbare Zustände bei jedem Übergang bereitstellen, während gleichzeitig ein Protokoll etabliert wird, um diese Prognosen zur Steuerung der Ausführung zu nutzen, ohne eine prohibitive Rechenlast zu verursachen.
Methodik: PACT-WAM
Die Autoren schlagen PACT-WAM (Predicting Actions and Visual Foresight with Compact Temporal Encoding) vor, ein World-Action Model, das eine 16-Schritte-Aktions-Trajektorie und die dazugehörige mehrstufige visuelle Prognose durch bedingtes Flow-Sampling gemeinsam generiert. Die Architektur stützt sich auf drei zentrale Designentscheidungen:
1. Hierarchische Historien-Kodierung
Anstatt einer einheitlichen Kodierung verwendet PACT-WAM eine rezenzbasierte Historien-Allokation. Es weist älteren Beobachtungen grobe räumliche Repräsentationen und neueren feinere Repräsentationen zu.
- Mechanismus: Unter Verwendung eines gefrorenen DINOv3 ViT-B/16 Backbones verarbeitet das Modell 16 Historien-Frames. Die ältesten 8 Frames werden auf 4 Tokens pro Ansicht komprimiert, die mittleren 6 auf 16 Tokens und die neuesten 2 auf 64 Tokens.
- Effizienz: Dies bewahrt alle 16 Beobachtungen unter Verwendung von nur 256 Tokens pro Ansicht, was einer Reduktion um 75 % gegenüber der dichten Kodierung (1.024 Tokens) entspricht, während eine hohe zeitliche Abdeckung beibehalten wird.
- Integration: Diese komprimierten Merkmale werden zusammengeführt und in das Qwen3-VL-4B Sprachmodell projiziert, um zusammen mit der Aufgabeninstruktion einen gemeinsamen Kontext zu bilden.
2. Gemeinsame Action-Visual Flow Generierung
PACT-WAM nutzt einen gemeinsamen Flow-Transformer mit transitionsweiser kausaler Aufmerksamkeit, um kontinuierliche Aktionen und visuelle Zustände gemeinsam zu aktualisieren.
- Visuelle Latents: Zukünftige Bilder werden durch kontinuierliche TiTok-VAE Latents ( Positionen pro Bild) ohne zeitliche Downsampling dargestellt. Dies stellt sicher, dass jede Aktion mit einem unabhängig dekodierbaren nachfolgenden visuellen Zustand gepaart ist.
- Shared Backbone: Der Transformer erhält verrauschte Aktions- und visuelle Zustände, ein Flow-Time-Embedding und den festen Kontext. Er verwendet eine Block-kausale Maske, bei der Queries in Block (der den -ten Übergang repräsentiert) auf alle Positionen in Blöcken aufmerksam werden können.
- Dual Heads: Zwei modalitätsspezifische Velocity-Heads ( für Aktionen, für Visuelles) sagen Geschwindigkeiten in normalisierten Räumen voraus. Die Modalitäten tauschen während des Samplings Informationen über ihre gemeinsame Abhängigkeit von den verrauschten Zuständen innerhalb des zulässigen zeitlichen Präfixes aus.
- Training: Das Modell wird mittels Conditional Flow Matching mit einem linearen Pfad-Velocity-Regressionsziel trainiert, wobei die Kompressionszweige, der Kontextpfad, der Flow-Transformer und die Output-Heads optimiert werden, während die DINOv3 und TiTok-VAE Encoder/Decoder eingefroren bleiben.
3. Proposal Review (PR)
Um die Ausführung zu steuern, führt PACT-WAM einen Proposal Review Mechanismus unter Verwendung eines Vision-Language Models (VLM) ein.
- Prozess: Vier parallele VLM-Anfragen bewerten verschachtelte Prognose-Präfixe bei 4, 8, 12 und 16 Schritten. Sie evaluieren den aufgabenkonformen Fortschritt und detektieren sichtbare Fehler (z. B. Fehlausrichtung, Kollisionen).
- Ausführungslogik: Der Controller wählt das größte konsekutiv genehmigte Präfix unterhalb jeglicher gemeldeter Veto-Entscheidung aus. Wenn ein Vorschlag abgelehnt wird, führt das System ein gemeinsames Resampling (bis zu drei Versuche) innerhalb eines begrenzten Budgets durch. Wenn alle Versuche fehlschlagen, endet die Episode.
Wichtigste Beiträge
- Rezenzbasierte Historien-Allokation: Die Arbeit führt eine Strategie ein, die 256 Tokens pro Ansicht allokiert, indem sie jüngere Frames priorisiert. Auf dem LIBERO Benchmark übertrifft dies die einheitliche Kodierung derselben 16 Frames (98,6 % vs. 87,5 % Erfolg) und erreicht eine Leistung, die vergleichbar mit der dichten Kodierung ist (98,0 %), bei 75 % weniger Historien-Tokens.
- Gemeinsame Generierung im kompakten Latent-Raum: PACT-WAM generiert Trajektorien und visuelle Zustände gemeinsam in einem kompakten pro Bild verfügbaren Latent-Raum, wodurch eine unabhängig dekodierbare Prognose für jeden physischen Übergang bereitgestellt wird. Dies ermöglicht den Proposal Review Mechanismus zur Validierung von Ausführungs-Präfixen und baut auf vereinheitlichten World-Action Frameworks auf, indem es kompakte Historien-Kodierung und Proposal Review integriert.
- Leistung mit Test-Time-Optimierung: Die Basis-Policy erreicht hohe Erfolgsraten in Simulationen und realen Benchmarks. Die Hinzunahme des Proposal Review bietet einen signifikanten Test-Time-Boost, der die Robustheit verbessert, ohne die Kern-Policy neu trainieren zu müssen.
Experimentelle Ergebnisse
Das Modell wurde auf LIBERO, RoboTwin 2.0 und einer realen AgileX Piper Plattform evaluiert.
- LIBERO (Simulation):
- Ohne PR: 98,6 % durchschnittlicher Erfolg.
- Mit PR: 99,5 % durchschnittlicher Erfolg (erreicht 100 % bei Object und Goal Suiten).
- RoboTwin 2.0 (Simulation):
- Ohne PR: 92,3 % durchschnittlicher Erfolg über 50 bimanuelle Aufgaben.
- Mit PR: 93,4 % durchschnittlicher Erfolg.
- Real-World Piper:
- Ohne PR: 78,0 % durchschnittlicher Erfolg über Sorting, Handover und Cleanup Aufgaben.
- Mit PR: 86,7 % durchschnittlicher Erfolg.
- Ablationsstudien:
- Historie: Die 8:6:2 Token-Hierarchie übertrifft die einheitliche Kodierung und die dichte Kodierung hinsichtlich Effizienz und Erfolg signifikant.
- Gemeinsame Generierung: Das gemeinsame Training von Aktionen und Visuellem verbessert den Kontrollerfolg (98,6 %) im Vergleich zu Action-only (93,6 %) oder Visual-Auxiliary (96,4 %) Varianten.
- Visuelle Kapazität: Eine Erhöhung der Latent-Kapazität von auf verbessert die Prognose-Fidelität (PSNR, SSIM), reduziert aber den Kontrollerfolg leicht (97,3 % vs. 98,6 %), was auf einen Trade-off hindeutet, bei dem das Standard- die Balance zwischen Performance und Rechenkosten hält.
- Proposal Review: PR filtert fehlgeschlagene Trajektorien effektiv heraus; vorhergesagte Previews reduzieren die False-Rejection-Rate im Vergleich zur Nutzung aktueller Beobachtungen allein.
Signifikanz und Ansprüche
Die Arbeit behauptet, dass PACT-WAM erfolgreich den Trade-off zwischen Repräsentationskosten und der Verfügbarkeit von visueller Voraussicht für Entscheidungen löst. Durch die Kombination von hierarchischer Historien-Kodierung mit kompakten, dekodierbaren visuellen Latents ermöglicht das Modell eine gemeinsame Sampling-Verfahren von zeitlich gepaarten Aktionen und Prognosen. Diese Architektur erlaubt ein Proposal Review Protokoll, das die Ausführung durch die Validierung verschachtelter Präfixe steuert und somit die Robustheit in komplexen Manipulationsaufgaben erhöht.
Die Autoren betonen, dass ihr Ansatz die notwendigen zeitlichen Informationen für die Aktionswahl bewahrt und gleichzeitig die Anzahl der benötigten Tokens für die Historie drastisch reduziert. Sie merken an, dass während die Basis-Policy konkurrenzfähig ist, die Integration von visueller Voraussicht mit einem VLM-basierten Review-Mechanismus einen deutlichen Weg zur Verbesserung der Zuverlässigkeit in komplexen Manipulationsaufgaben eröffnet. Die Arbeit hebt hervor, dass eine höhere visuelle Rekonstruktionsqualität nicht zwangsläufig mit einem höheren Kontrollerfolg korreliert, was darauf hindeutet, dass der Nutzen der Prognose für die Entscheidungsfindung kritischer ist als die reine Rekonstruktionsgüte.
Vom Autor angemerkt Limitationen: Das aktuelle System verwendet eine feste rezenzbasierte Allokation, die nicht aufgabenrelevant adaptiv ist, einen festen 16-Schritte-Horizont und einen Review-Prozess, der kurze Fehler zwischen den Checkpoints möglicherweise übersieht. Zukünftige Arbeiten sollen die Untersuchung von aufgabenspezifischer Kompression und variablen Horizont-Generierungen explorieren.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.