← नवीनतम पेपर
💻 computer science

AffordTrajDP: Dynamic Affordance-Guided Visuomotor Policy Learning for Robotic Manipulation

AffordTrajDP एक गतिशील ढांचा है जो एक रिट्रीव्ड एंकर अफोर्डेंस को किसी वस्तु के SE(3) पोज़ के माध्यम से प्रसारित करके टेम्पोरल रूप से सुसंगत, स्टेट-अवेयर गाइडेंस ट्रैजेक्टरीज उत्पन्न करके रोबोटिक मैनिपुलेशन को बढ़ाता है, जिससे स्टैटिक अफोर्डेंस की सीमाओं को दूर किया जाता है और प्रिसिजन-क्रिटिकल कार्यों में बेहतर सफलता दर प्राप्त की जाती है।

मूल लेखक: Gaoyuan Wu, Ziyu Shan, Haoyang Du, Yuyao Jiang, Ziwei Wang

प्रकाशित 2026-08-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gaoyuan Wu, Ziyu Shan, Haoyang Du, Yuyao Jiang, Ziwei Wang

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं। लंबे समय तक, वैज्ञानिकों ने रोबोटों को इंसानों को काम करते हुए वीडियो दिखाकर सिखाने की कोशिश की, इस उम्मीद में कि रोबोट बस "देखकर सीख" जाएगा। लेकिन जब चीजें बदलती हैं, तो रोबोट इसमें बहुत खराब साबित होते हैं। यदि आप एक कप को तीन इंच बाईं ओर खिसका देते हैं, या रोशनी बदल जाती है, तो पुराने सेटअप पर प्रशिक्षित रोबोट भ्रमित हो सकता है और कप गिरा सकता है। यह एक विशिष्ट रसोई के लिए लिखी गई रेसिपी का पालन करने जैसा है, लेकिन फिर आप चूल्हे को दूसरे कमरे में रख देते हैं; निर्देश अब समझ में नहीं आते।

इसे ठीक करने के लिए, शोधकर्ताओं ने "अफोर्डेंस" (affordance) नामक एक चतुर तकनीक विकसित की। अफोर्डेंस को एक "जादुई हाईलाइट" के रूप में सोचें जो रोबोट को बताता है कि उसे ठीक कहाँ पकड़ना या छूना है। पूरे बिखरे हुए कमरे को देखने के बजाय, रोबोट केवल हाइलाइट किए गए स्थान को देखता है। हालाँकि, इसमें एक पेंच है: इनमें से अधिकांश हाइलाइट स्थिर (static) होते हैं। वे एक चलती कार पर लगाए गए स्टिकर की तरह हैं। यदि कार आगे बढ़ती है, तो स्टिकर हवा में उसी स्थान पर रहता है, और रोबोट, उस स्टिकर को छूने की कोशिश में, कार को पूरी तरह से मिस कर देता है। यह पेपर ठीक इसी समस्या को हल करता है: आप "जादुई हाइलाइट" को वस्तु के साथ कैसे चला सकते हैं ताकि रोबोट अपनी पकड़ कभी न खोए?

AffordTrajDP (एक लंबा नाम, लेकिन इसे "अफोर्डेंस ट्राजेक्टरी डायनेमिक पॉलिसी" समझें) के पीछे के शोधकर्ताओं ने महसूस किया कि पुराने तरीके से स्थिर हाइलाइट्स का उपयोग करना ही वह मुख्य कारण था जिससे रोबens जटिल कार्यों जैसे कि USB ड्राइव डालने या ब्लॉक को एक के ऊपर एक रखने में विफल रहे। उनका समाधान हाइलाइट को एक निश्चित स्टिकर के रूप में मानना बंद करना और इसे एक चलते हुए लक्ष्य के रूप में मानना है।

यहाँ उनका नया सिस्टम कैसे काम करता है, एक सरल उदाहरण के साथ: कल्पना कीजिए कि आप अपने दोस्त द्वारा फेंकी गई फ्रिसबी (Frisbee) को पकड़ने की कोशिश कर रहे हैं।

  • पुराना तरीका (स्थिर अफोर्डेंस): आपका दोस्त आपसे कहता है, "फ्रिसबी बड़े ओक के पेड़ के पास होगी।" आप पेड़ की ओर दौड़ते हैं और प्रतीक्षा करते हैं। लेकिन आपका दोस्त फ्रिसबी को पेड़ के आगे फेंक देता है। आप पेड़ पर फ्रिसबी का इंतजार करते हुए खड़े रहते हैं जो कभी नहीं आती, जबकि असली फ्रिसबी पास से उड़ जाती है। ऐसा तब होता है जब रोबोट एक स्थिर संपर्क बिंदु (contact point) का उपयोग करता; वह वस्तु के आधार पर गणना करता है जहाँ वह थी, न कि जहाँ वह जा रही है।
  • नया तरीका (AffordTrajDP): एक एकल स्थान के बजाय, आपका दोस्त आपको एक चलता हुआ पथ (path) देता है। "फ्रिसबी यहाँ होगी, फिर यहाँ, फिर यहाँ।" आप केवल एक स्थान की ओर नहीं दौड़ते; आप एक ऐसे पथ पर दौड़ते हैं जो फ्रिसबी की उड़ान से मेल खाता है।

रोबोट की दुनिया में, "पथ" को डायनेमिक अफोर्डेंस ट्राजेक्टरी कहा जाता है। सिस्टम पहले एक मेमोरी बैंक से एक "सोर्स" उदाहरण पाता है—जैसे कप को पकड़ने के लिए उसके हैंडल के सही स्थान को खोजने के लिए उसकी एक फोटो देखना। फिर, केवल उस स्थान की नकल करने के बजाय, रोबोट भविष्यवाणी करता है कि अगले कुछ सेकंड में वस्तु कहाँ होगी। वह उस सटीक ग्रैब-स्पॉट (पकड़ने की जगह) को लेता है और उसे आगे की ओर "प्रोपैगेट" (propagate) करता है, यानी वस्तु की अनुमानित गति के साथ खींचता है। यह एक चलता हुआ मार्ग बनाता है जो हर मिलीसेकंड में अपडेट होता है, यह सुनिश्चित करता है कि रोबोट का हाथ हमेशा वस्तु के साथ संरेखित (aligned) रहे, भले ही वस्तु डगमगाए या हिले।

टीम ने इस विचार का परीक्षण दो तरीकों से किया: ManiSkill3 नामक एक सुपर-सटीक कंप्यूटर सिमुलेशन में और वास्तविक दुनिया में वास्तविक रोबोट भुजाओं (एक Galaxea A1 और एक UR7e) का उपयोग करके।

सिमुलेशन में, उन्होंने रोबोट को क्यूब उठाने से लेकर चार्जर प्लग करने तक, छह अलग-अलग कार्यों के साथ चुनौती दी। परिणाम स्पष्ट थे: पुराने तरीकों (जैसे DP3 और AffordDP) ने लगभग 52.2% से 57.8% बार सफलता प्राप्त की। लेकिन नए डायनेमिक गाइड के साथ, सफलता दर उछलकर 70.0% हो गई। सुधार सबसे कठिन कार्यों में सबसे नाटकीय था, जैसे चार्जर प्लग डालना, जहाँ पुराने तरीके प्लग को सॉकेट के साथ संरेखित रखने में संघर्ष करते थे।

उन्होंने सिमुलेशन तक ही सीमित नहीं रहे। वे एक वास्तविक लैब में रोबोट को क्यूब स्टैकिंग, कप उठाने और अत्यंत कठिन एडॉप्टर इंसर्शन (एक तंग सॉकेट में विशिष्ट प्लग फिट करना) जैसे कार्यों के लिए ले गए। उन्होंने रोबोट का परीक्षण उन वस्तुओं के साथ किया जिन्हें उसने पहले देखा था और उन वस्तुओं के साथ भी जिन्हें उसने पहले कभी नहीं देखा था (अलग आकार या रंग)।

  • Galaxea A1 रोबोट पर, नए तरीके ने सभी कार्यों में 66.1% की सफलता दर हासिल की, जबकि पिछले सर्वश्रेष्ठ तरीके ने केवल 35.0% हासिल किया।
  • UR7e रोबोट पर, नए तरीके ने 72.5% सफलता प्राप्त की, जो पिछले सर्वश्रेष्ठ 55.8% को पीछे छोड़ गया।

शोधकर्ताओं ने एक "डिटेक्टिव" प्रयोग भी चलाया यह देखने के लिए कि उनके सिस्टम का कौन सा हिस्सा वास्तव में भारी काम कर रहा है। उन्होंने पहेली के टुकड़ों को हटाने की कोशिश की:

  1. केवल पथ, कोई विशिष्ट स्थान नहीं: यदि उन्होंने रोबलेट को एक पथ का पालन करने के लिए कहा लेकिन यह नहीं बताया कि उसे वस्तु पर कहाँ से शुरू करना है, तो रोबोट भ्रमित हो गया और विफल रहा (कभी-कभी पुराने तरीकों से भी बदतर प्रदर्शन किया)।
  2. केवल स्थान, कोई पथ नहीं: यदि उन्होंने रोबोट को सटीक ग्रैब स्पॉट दिया लेकिन वस्तु के हिलने के साथ उसे अपडेट नहीं किया, तो संपर्क के बाद रोबोट अपने रास्ते से भटक गया, विशेष रूप से कठिन कार्यों में।
  3. दोनों एक साथ: केवल तभी जब उन्होंने विशिष्ट "कहाँ छूना है" को "यह कैसे चलता है" के साथ जोड़ा, रोबोट लगातार सफल हुआ।

यह सुझाव देता है कि एक अस्त-व्यस्त, बदलती दुनिया में सटीक कार्यों को संभालने के लिए रोबोटों को केवल एक स्नैपशॉट की आवश्यकता नहीं है कि कहाँ पकड़ना है; उन्हें एक चलते हुए रोडमैप की आवश्यकता है जो वास्तविक समय में अपडेट होता रहे। लेखक नोट करते हैं कि हालांकि उनकी विधि एक महत्वपूर्ण कदम है, फिर भी इसे अत्यंत सूक्ष्म अंतर वाले कार्यों (जैसे USB इंसर्शन कार्य, जो सभी के लिए सबसे कठिन था) के साथ चुनौतियों का सामना करना पड़ता है। हालांकि, यह साबित करके कि डायनेमिक, चलते हुए गाइड स्थिर गाइडों की तुलना में बेहतर काम करते हैं, उन्होंने रोबोट को चीज़ों को बिगड़ने से बचाने के लिए एक नया रास्ता खोल दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →