← नवीनतम पेपर
🤖 AI

PACT-WAM: Predicting Actions and Visual Foresight with Compact Temporal Encoding for Robot Manipulation

PACT-WAM एक कॉम्पैक्ट वर्ल्ड-एक्शन मॉडल है जो पदानुतरित टेम्पोरल एनकोडिंग और कंडिशनल फ्लो सैंपलिंग का उपयोग करके 16-स्टेप एक्शन ट्राजेक्टरीज और संगत मल्टी-व्यू विजुअल फोरकास्ट्स को कुशलतापूर्वक पूर्वानुमानित करता है, जो रोबोट मैनिपुलेशन कार्यों में उच्च सफलता दर प्राप्त करने के साथ-साथ प्रदर्शन वृद्धि के लिए विजन-लैंग्वेज-आधारित प्रपोजल रिव्यू को सक्षम बनाता है।

मूल लेखक: Yushan Liu, Jingjing Fan, Shoujie Li, Yifan Xie, Xiao-Ping Zhang, Wenbo Ding

प्रकाशित 2026-09-17
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yushan Liu, Jingjing Fan, Shoujie Li, Yifan Xie, Xiao-Ping Zhang, Wenbo Ding

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: PACT-WAM

समस्या विवरण (Problem Statement)

रोबोट मैनिपुलेशन पॉलिसियों को दो प्रकार की टेम्पोरल जानकारी की आवश्यकता होती है: इतिहास (history) जो गति और पूर्व अंतःक्रियाओं के लिए संदर्भ प्रदान करता है, और विजुअल फोरसाइट (visual foresight) जो अवस्था परिवर्तनों की भविष्यवाणी करने और प्रस्तावित कार्यों का आकलन करने के लिए आवश्यक है। जबकि वर्ल्ड-एक्शन मॉडल्स (WAMs) इतिहास, क्रिया और भविष्य के अवलोकनों को प्रभावी ढंग से जोड़ते हैं, वे एक महत्वपूर्ण कम्प्यूटेशनल बाधा का सामना करते हैं। अतीत और भविष्य के अवलोकनों के सघन (dense) प्रतिनिधित्व में भारी प्रोसेसिंग लागत आती है; उदाहरण के लिए, 64 टोकन प्रति व्यू के साथ 16 हिस्ट्री फ्रेम्स को एनकोड करने के लिए प्रति व्यू 1,024 टोकन की आवश्यकता होती है, और मल्टी-स्टेप पूर्वानुमान अलग विजुअल-लेटेंट अनुक्रमों को जोड़ते हैं। मौजूदा विधियाँ अक्सर इन चुनौतियों को अलग-थलग तरीके से संबोधित करती हैं—या तो इतिहास को कंप्रेस करके, या अलग कंट्रोलर्स के साथ मॉड्यूलर विजुअल फोरसाइट का उपयोग करके, या इन्फरेंस के दौरान भविष्य के जनरेशन को छोड़कर। मुख्य चुनौती ऐसे कॉम्पैक्ट प्रतिनिधित्व डिजाइन करना है जो ऐतिहासिक कवरेज को सुरक्षित रखते हुए स्वतंत्र रूप से डिकोडेबल अवस्थाएं प्रदान करें, और एक ऐसा प्रोटोकॉल स्थापित करें जिससे अत्यधिक कम्प्यूटेशनल ओवरहेड के बिना निष्पादन (execution) को निर्देशित किया जा सके।

कार्यप्रणाली: PACT-WAM (Methodology: PACT-WAM)

लेखक PACT-WAM (प्रेडिक्टिंग एक्शन्स एंड विजुअल फोरसाइट विद कॉम्पैक्ट टेम्पोरल एनकोडिंग) प्रस्तावित करते हैं, जो कंडीशनल फ्लो सैंपलिंग के माध्यम से एक 16-स्टेप एक्शन ट्राजेक्टरी और उसके टेम्पोरली संबंधित मल्टी-व्यू विजुअल फोरकास्ट को संयुक्त रूप से उत्पन्न करता है। यह आर्किटेक्चर तीन प्रमुख डिज़ाइन विकल्पों पर आधारित है:

1. पदानुक्रमित इतिहास एनकोडिंग (Hierarchical History Encoding)

समान (uniform) एनकोडिंग के बजाय, PACT-WAM रेसेंसी-आधारित इतिहास आवंटन (recency-based history allocation) का उपयोग करता है। यह पुराने अवलोकनों को मोटे (coarse) स्थानिक प्रतिनिधित्व और हालिया अवलोकनों को सूक्ष्म (fine) प्रतिनिधित्व आवंटित करता है।

  • तंत्र (Mechanism): एक फ्रोजन DINOv3 ViT-B/16 बैकबोन का उपयोग करते हुए, मॉडल 16 हिस्ट्री फ्रेम्स को प्रोसेस करता है। सबसे पुराने 8 फ्रेम्स को 4 टोकन प्रति व्यू में, मध्य के 6 को 16 टोकन में, और नवीनतम 2 को 64 टोकन में कंप्रेस किया जाता है।
  • दक्षता (Efficiency): यह सभी 16 अवलोकनों को केवल 256 टोकन प्रति व्यू का उपयोग करके बनाए रखता है, जो सघन एनकोडिंग (1,024 टोकन) की तुलना में 75% की कमी है, जबकि उच्च टेम्पोरल कवरेज भी बनाए रखता है।
  • एकीकरण (Integration): इन कंप्रेस्ड फीचर्स को टास्क इंस्ट्रक्शन के साथ साझा संदर्भ hth_t बनाने के लिए Qwen3-VL-4B लैंग्वेज मॉडल में मर्ज और प्रोजेक्ट किया जाता है।

2. संयुक्त एक्शन-विजुअल फ्लो जनरेशन (Joint Action-Visual Flow Generation)

PACT-WAM एक साझा फ्लो ट्रांसफार्मर का उपयोग करता है जिसमें ट्रांजिशन-वाइज कॉज़ल अटेंशन (transition-wise causal attention) के माध्यम से निरंतर एक्शन और विजुअल स्टेट्स को संयुक्त रूप से अपडेट किया जाता है।

  • विजुअल लेटेंट्स (Visual Latents): भविष्य के इमेजेस को निरंतर TiTok-VAE लेटेंट्स (K=32K=32 पोजीशंस प्रति इमेज) द्वारा दर्शाया जाता है, जिसमें कोई टेम्पोरल डाउनसैंपलिंग नहीं होता है। यह सुनिश्चित करता है कि प्रत्येक एक्शन एक स्वतंत्र रूप से डिकोडेबल आगामी विजुअल स्टेट के साथ जुड़ा हो।
  • साझा बैकबोन (Shared Backbone): ट्रांसफार्मर नॉइज़ी एक्शन और विजुअल स्टेट्स, एक फ्लो-टाइम एम्बेडिंग, और फिक्स्ड कॉन्टेक्स्ट प्राप्त करता है। यह एक ब्लॉक-कॉज़ल मास्क का उपयोग करता है जहाँ ब्लॉक jj (जो jj-वें ट्रांजिशन का प्रतिनिधित्व करता है) के क्वेरीज ब्लॉक kjk \leq j के सभी पोजीशंस पर अटेंड कर सकती हैं।
  • ड्यूल हेड्स (Dual Heads): दो मोडैलिटी-विशिष्ट वेलोसिटी हेड्स (gag_a एक्शन्स के लिए, gvg_v विजुअल्स के लिए) नॉर्मलाइज्ड स्पेस में वेलोसिटी प्रेडिक्ट करते हैं। सैंपलिंग के दौरान मोडैलिटीज अनुमत टेम्पोरल प्रीफिक्स के भीतर अपने साझा निर्भरता के माध्यम से सूचना का आदान-प्रदान करती हैं।
  • प्रशिक्षण (Training): मॉडल को लीनियर-पाथ वेलोसिटी रिग्रेशन ऑब्जेक्टिव के साथ कंडीशनल फ्लो मैचिंग का उपयोग करके प्रशिक्षित किया जाता है, जो DINOv3 और TiOK-VAE एनकोडर्स/डिकोडर्स को फ्रोजन रखते हुए कंप्रेशन ब्रांचेस, कॉन्टेक्स्ट पाथवे, फ्लो ट्रांसफार्मर और आउटपुट हेड्स को ऑप्टिमाइज़ करता है।

3. प्रपोजल रिव्यू (Proposal Review - PR)

निष्पादन को निर्देशित करने के लिए, PACT-WAM एक विजन-लैंग्वेज मॉडल (VLM) का उपयोग करके प्रपोजल रिव्यू तंत्र पेश करता है।

  • प्रक्रिया (Process): चार समानांतर VLM रिक्वेस्ट 4, 8, 12, और 16 स्टेप्स पर नेस्टेड फोरकास्ट प्रीफिक्स का मूल्यांकन करती हैं। वे टास्क-कंसिस्टेंट प्रगति का आकलन करती हैं और दृश्य विफलताओं (जैसे मिसअलाइनमेंट, कोलिजन) का पता लगाती हैं।
  • निष्पादन तर्क (Execution Logic): कंट्रोलर किसी भी रिपोर्ट किए गए वीटो से नीचे के सबसे बड़े लगातार स्वीकृत (consecutively approved) प्रीफिक्स का चयन करता है। यदि कोई प्रपोजल खारिज हो जाता है, तो सिस्टम एक बाउंडेड बजट के भीतर संयुक्त री-सैंपलिंग (joint resampling) (तीन प्रयासों तक) करता है। यदि सभी प्रयास विफल हो जाते हैं, तो एपिसोड समाप्त हो जाता है।

मुख्य योगदान (Key Contributions)

  1. रेसेंसी-आधारित इतिहास आवंटन: यह पेपर एक ऐसी रणनीति पेश करता है जो हालिया फ्रेम्स को प्राथमिकता देकर प्रति व्यू 256 टोकन आवंटित करती है। LIBERO बेंचमार्क पर, यह समान 16 फ्रेम्स के यूनिफॉर्म एनकोडिंग (98.6% बनाम 87.5% सफलता) से बेहतर प्रदर्शन करता है और 75% कम हिस्ट्री टोकन के साथ डेंस एनकोडिंग (98.0%) के बराबर प्रदर्शन प्राप्त करता है।
  2. कॉम्पैक्ट लेटेंट स्पेस में संयुक्त जनरेशन: PACT-WAM एक कॉम्पैक्ट प्रति-इमेज लेटेंट स्पेस में एक्शन ट्राजेक्टरीज और विजुअल स्टेट्स को संयुक्त रूप से उत्पन्न करता है, जो प्रत्येक भौतिक ट्रांजिशन पर एक स्वतंत्र रूप से डिकोडेबल फोरकास्ट प्रदान करता है। यह कॉम्पैक्ट हिस्ट्री एनकोडिंग और प्रपोजल रिव्यू को एकीकृत करके यूनिफाइड वर्ल्ड-एक्शन फ्रेमवर्क्स का विस्तार करता है।
  3. टेस्ट-टाइम एन्हांसमेंट के साथ प्रदर्शन: बेस पॉलिसी सिमुलेशन और रियल-वर्ल्ड बेंचमार्क में उच्च सफलता दर प्राप्त करती है। प्रपोजल रिव्यू (PR) को जोड़ने से टेस्ट-टाइम पर महत्वपूर्ण उछाल मिलता है, जो कोर पॉलिसी को पुन: प्रशिक्षित किए बिना मजबूती (robustness) में सुधार करता है।

प्रयोगात्मक परिणाम (Experimental Results)

मॉडल का मूल्यांकन LIBERO, RoboTwin 2.0, और एक वास्तविक AgileX Piper प्लेटफॉर्म पर किया गया।

  • LIBERO (सिमुलेशन):
    • बिना PR के: 98.6% औसत सफलता।
    • PR के साथ: 99.5% औसत सफलता (Object और Goal सूट्स पर 100% तक पहुँचते हुए)।
  • RoboTwin 2.0 (सिमुलेशन):
    • बिना PR के: 50 बाइमैनुअल टास्क में 92.3% औसत सफलता।
    • PR के साथ: 93.4% औसत सफलता।
  • रियल-वर्ल्ड Piper:
    • बिना PR के: Sorting, Handover, और Cleanup टास्क में 78.0% औसत सफलता।
    • PR के साथ: 86.7% औसत सफलता।
  • एब्लेशन स्टडीज (Ablation Studies):
    • इतिहास (History): 8:6:2 टोकन पदानुक्रम दक्षता और सफलता के मामले में यूनिफॉर्म और डेंस एनकोडिंग से काफी बेहतर है।
    • संयुक्त जनरेशन (Joint Generation): एक्शन्स और विजुअल्स को संयुक्त रूप से प्रशिक्षित करने से कंट्रोल सफलता (98.6%) में सुधार होता है, जो केवल एक्शन-ओनली (93.6%) या विजुअल-ऑक्सिलरी (96.4%) वेरिएंट की तुलना में बेहतर है।
    • विजुअल कैपेसिटी (Visual Capacity): लेटेंट कैपेसिटी को K=32K=32 से बढ़ाकर K=64K=64 करने से फोरकास्ट फिडेलिटी (PSNR, SSIM) में सुधार होता है लेकिन कंट्रोल सफलता (97.3% बनाम 98.6%) थोड़ी कम हो जाती है, जो यह सुझाव देता है कि डिफॉल्ट K=32K=32 प्रदर्शन और कम्प्यूटेशनल लागत के बीच संतुलन बनाता है।
    • प्रपोजल रिव्यू (Proposal Review): PR प्रभावी ढंग से विफल ट्राजेक्टरीज को फ़िल्टर करता है, जिसमें वर्तमान अवलोकनों का उपयोग करने की तुलना में प्रेडिक्टेड प्रिव्यूज (predicted previews) फॉल्स रिजेक्शन रेट को कम करते हैं।

महत्व और दावे (Significance and Claims)

पेपर का दावा है कि PACT-WAM सफलतापूर्वक प्रतिनिधित्व लागत और निष्पादन निर्णयों के लिए विजुअल फोरसाइट की उपलब्धता के बीच के ट्रेड-ऑफ को संबोधित करता है। कॉम्पैक्ट, डिकोडेबल विजुअल लेटेंट्स के साथ हाइरार्किकल हिस्ट्री एनकोडिंग को जोड़कर, मॉडल टेम्पोरली पेयर्ड एक्शन्स और फोरकास्ट का संयुक्त सैंपलिंग (joint sampling) सक्षम करता है। यह आर्किटेक्चर एक प्रपोजल रिव्यू प्रोटोकॉल की अनुमति देता है जो नेस्टेड प्रीफिक्स को वैलिडेट करके निष्पादन को निर्देशित करता है, जिससे जटिल मैनिपुलेशन कार्यों में मजबूती बढ़ती है।

लेखक जोर देते हैं कि उनका दृष्टिकोण एक्शन सिलेक्शन के लिए आवश्यक टेम्पोरल जानकारी को सुरक्षित रखते हुए हिस्ट्री के लिए आवश्यक टोकन की संख्या को नाटकीय रूप से कम करता है। वे उल्लेख करते हैं कि जबकि बेस पॉलिसी प्रतिस्पर्धी है, विजन-लैंग्वेज मॉडल-आधारित रिव्यू तंत्र के साथ विजुअल फोरसाइट का एकीकरण, जटिल मैनिपुलेशन कार्यों में विश्वसनीयता में सुधार के लिए एक अलग मार्ग प्रदान करता है। यह कार्य रेखांकित करता है कि उच्च फोरकास्ट फिडेलिटी हमेशा उच्च कंट्रोल सफलता के साथ सह-संबंधित नहीं होती है, जो यह सुझाव देता है कि निर्णय लेने के लिए फोरकास्ट की उपयोगिता कच्चे पुनर्निर्माण (reconstruction) की गुणवत्ता से अधिक महत्वपूर्ण है।

लेखकों द्वारा नोट की गई सीमाएँ (Limitations): वर्तमान सिस्टम एक फिक्स्ड रेसेंसी-आधारित आवंटन का उपयोग करता है जो कार्य प्रासंगिकता के अनुकूल नहीं है, इसमें एक फिक्स्ड 16-स्टेप होराइजन है, और एक रिव्यू प्रक्रिया है जो चेकपॉइंट्स के बीच संक्षिप्त विफलताओं को मिस कर सकती है। भविष्य के कार्य के रूप में टास्क-एडैप्टिव कंप्रेशन और वेरिएबल-होराइजन जनरेशन की खोज करने का सुझाव दिया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →