← नवीनतम पेपर
💻 computer science

Implicit-Behavior Coordination from Unlabeled Sub-Task Demonstrations for Rearrangement Tasks

यह शोध पत्र लॉन्ग-होरिज़न रोबोटिक पुनर्व्यवस्था (rearrangement) के लिए एक डेटा-संचालित दृष्टिकोण प्रस्तावित करता है जो वैल्यू-गाइडेड एक्शन सिलेक्शन के माध्यम से अनलेबल उप-कार्य प्रदर्शनों (unlabeled sub-task demonstrations) से सीधे इनप्लिसिट व्यवहारों को सीखता और समन्वित करता है, जो पारंपरिक एक्सप्लिसिट स्किल-एब्स्ट्रैक्शन विधियों की तुलना में बेहतर स्केलेबिलिटी और प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Ahmed Shokry, Usama Ahmed Siddiquie, Sicong Pan, Maren Bennewitz

प्रकाशित 2026-07-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ahmed Shokry, Usama Ahmed Siddiquie, Sicong Pan, Maren Bennewitz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कमरा साफ करना सिखा रहे हैं। इसे करने का पुराना तरीका एक सख्त, पहले से लिखे गए स्क्रिप्ट देने जैसा है। आपको इसे बताना होगा, "पहले, किताब की ओर चलो। दूसरा, इसे उठाओ। तीसरा, शेल्फ की ओर चलो। चौथा, इसे नीचे रखो।" यदि चलते समय रोबोट किसी कुर्सी से टकरा जाता है, तो स्क्रिप्ट टूट जाती है, और पूरी प्रक्रिया बिखर जाती है। इस तरीके में आपको हर एक गतिविधि को मैन्युअल रूप से लेबल करना पड़ता है और यह बताने के लिए जटिल नियम लिखने पड़ते हैं कि "चलने" से "उठाने" की प्रक्रिया में कैसे स्विच किया जाए। यह एक ऐसे ऑर्केस्ट्रा को संचालित करने जैसा है जहाँ प्रत्येक संगीतकार को एक अलग कागज़ की ज़रूरत होती है और कंडक्टर को विशिष्ट स्वर चिल्लाकर बताने की आवश्यकता होती है।

यह शोध एक अलग, अधिक अराजक और आश्चर्यजनक रूप से प्रभावी तरीके का सुझाव देता है: इम्प्लिसिट-बिहेवियर कोऑर्डिनेशन (Implicit-Behavior Coordination)।

रोबोट को स्क्रिप्ट देने के बजाय, कल्पना कीजिए कि आप उसके दिमाग में वीडियो क्लिप्स का एक विशाल, मिला-जुला ढेर डाल देते हैं। कुछ क्लिप्स में रोबोट को चलते हुए दिखाया गया है, कुछ में कप उठाते हुए, कुछ में दराज खोलते हुए, और कुछ में कोई वस्तु रखते हुए। महत्वपूर्ण बात यह है कि इनमें से किसी भी क्लिप पर कोई लेबल नहीं है। रोबोट को यह नहीं पता कि कौन सी क्लिप "चलना" है या "उठाना" है। वह बस क्रियाओं का एक मिश्रण देखता है।

जादू दो चरणों में होता है:

  1. द ड्रीमर (The Dreamer - जनरेटर): रोबट वर्तमान स्थिति को देखना सीखता है (जैसे फर्श पर एक किताब देखना) और कई संभावित अगले कदमों की कल्पना करता है। क्योंकि इसने वीडियो के उस मिश्रित ढेर से सीखा है, यह एक "चलने" वाला कदम, एक "उठाने" वाला कदम, या यहाँ तक कि एक "धकेलने" वाला कदम भी कल्पना कर सकता है। यह एक जैज़ संगीतकार की तरह है जो गाने के अनुकूल कई अलग-अलग सुरों की कल्पना करता है।
  2. द जज (The Judge - क्रिटिक): यह सबसे महत्वपूर्ण हिस्सा है। रोबोट का एक "जज" होता है जो उन सभी कल्पित कदमों को देखता है और पूछता है, "कौन सा कदम मुझे लक्ष्य के करीब ले जाएगा?" यदि लक्ष्य किताब को शेल्फ पर रखना है, तो जज "उठाने" वाले कदम को चुनता है। यदि किताब हाथ में है, तो जज "चलने" वाले कदम को चुनता है।

यह शोध तर्क देता है कि आपको कौशल (skills) को मैन्युअल रूप से परिभाषित करने या रोबोट को यह बताने की आवश्यकता नहीं है कि चलने से उठाने के बीच कब स्विच करना है। आपको किसी "स्किल लाइब्रेरी" या "कंडक्टर" की आवश्यकता नहीं है। रोबोट खुद ही समन्वय (coordination) सीख जाता है क्योंकि वह लगातार पूछता रहता है, "मेरे संभावित अगले कदमों में से सबसे अच्छा कौन सा है?"

यह कितनी अच्छी तरह काम करता है?
शोधकर्ताओं ने इसे 'हैबिटैट' (Habitat) नामक एक कंप्यूटर सिमुलेशन में टेस्ट किया, जिसमें 'फetch' नाम का एक रोबोट था। उन्होंने इसे तीन स्तरों के अव्यवस्थित कार्य दिए:

  • स्तर 1: केवल चलना और वस्तु को रखना (रोबोट पहले से ही उसे पकड़े हुए है)।
  • स्तर 2: चलना, वस्तु उठाना, फिर से चलना, और फिर उसे रखना।
  • स्तर 3: चलना, दराज खोलना, उसमें से कुछ बाहर निकालना, चलना, और फिर उसे रखना।

इन सिमुलेशन में, उनकी नई विधि एक स्टार प्लेयर रही। सबसे कठिन कार्य (दराज खोलना) पर, उनका रोबोट 68.5% बार सफल रहा। इसकी तुलना में, पुराने "स्किल ट्रांसफॉर्मर" तरीके की सफलता दर केवल 58.5% थी। और भी प्रभावशाली बात यह है कि उनका तरीका "ओरेकल" (Oracle) सिस्टम के लगभग बराबर पहुँच गया (एक अत्यंत बुद्धिमान रोबोट जो पहले से ही एक आदर्श योजना जानता है और जिसके पास विशेष सेंसर हैं), जिसकी सफलता दर 70.0% थी। लेखक सुझाव देते हैं कि यह साबित करता है कि लंबी, जटिल प्रक्रियाओं को हल करने के लिए आपको स्पष्ट स्किल लेबल की आवश्यकता नहीं है।

क्या होता है जब चीजें कठिन हो जाती हैं?
टीम ने यह भी टेस्ट किया कि क्या होता है जब रोबत को बहुत लंबे कार्यों की श्रृंखला करनी पड़ती है, जैसे बिना रुके एक के बाद एक पाँच अलग-अलग चीजें उठाना।

  • पुराना "स्किल ट्रांसफॉर्मर" रोबोट विफल हो गया, जो एक वस्तु पर 65% सफलता से गिरकर पाँच वस्तुओं पर मात्र 0.5% सफलता पर आ गया। वह लंबी श्रृंखला से भ्रमित हो गया।
  • नई विधि ने अपनी पकड़ बनाए रखी, पाँच वस्तुओं के बाद भी 32% सफलता दर्ज की।
  • "ओरेकल" सिस्टम अभी भी सर्वश्रेष्ठ था (लगभग 62%), लेकिन यह ऐसी जानकारी पर निर्भर करता है जिसे वास्तविक दुनिया में आसानी से प्राप्त नहीं किया जा सकता।

टीम ने इसे एक वास्तविक रोबोट (एक मेज पर UR3e आर्म) पर भी आजमाया, जिसमें वास्तविक दुनिया का शोर (noise) शामिल था। हालाँकि उन्होंने पूर्ण प्रतियोगिता नहीं चलाई, लेकिन रोबोट सफलतापूर्वक दराज खोलने, वस्तु उठाने और वापस रखने में सफल रहा। यह सुझाव देता है कि यह विचार कंप्यूटर के बाहर भी काम करता है, हालांकि लेखक कहते हैं कि यह अभी शुरुआती दौर है।

यह क्या नहीं करता है?
यह शोध स्पष्ट रूप से बताता है कि यह अभी क्या हल नहीं करता है।

  • यह तब काम नहीं करता जब प्रशिक्षण डेटा विरल (sparse) या असंबद्ध हो। यदि रोबोट कभी ऐसा "चलने" वाला क्लिप नहीं देखता जो "उठाने" वाले क्लिप के साथ ओवरलैप करता हो, तो वह स्विच करना नहीं सीख पाएगा। "जज" को एक रास्ते की आवश्यकता होती है।
  • इसका मतलब यह नहीं है कि रोबोट परफेक्ट है। वास्तविक दुनिया में, रोबोट संघर्ष करता है यदि उसे सटीक रूप से पता न हो कि लक्ष्य कहाँ है; उसे पुरस्कारों (rewards) के आधार पर अनुमान लगाना पड़ता है।
  • यह दावा नहीं करता कि इसने रोबोट की हर समस्या को हल कर दिया है। लेखक स्वीकार करते हैं कि उन्होंने केवल सीमित व्यवहारों (चलना, उठाना, रखना, दराज खोलना) का परीक्षण किया है और अभी तक हजारों अलग-अलग वस्तुओं वाले विशाल, जटिल वातावरण का परीक्षण नहीं किया है।

निष्कर्ष (The Bottom Line)
लेखकों का सुझाव है कि हम शायद रोबोट ट्रेनिंग को बहुत अधिक जटिल बना रहे हैं। कौशल की एक विशाल लाइब्रेरी बनाने और उनके बीच स्विच करने के जटिल नियम लिखने के बजाय, हम बस रोबोट को बिना लेबल वाले उप-कार्यों (sub-tasks) का एक मिला-जुला बैग दे सकते हैं और एक "जज" को हर कदम पर सबसे अच्छे कदम को चुनने दे सकते हैं। यह एक बच्चे को खाना बनाना सिखाने जैसा है—उसे लेबल किए गए अध्यायों वाली रेसिपी बुक देने के बजाय, उसे हजारों अलग-अलग कुकिंग वीडियो देखने देना और फिर पूछना, "इस सूप को बनाने के लिए मुझे आगे क्या करना चाहिए?"

परिणाम बताते हैं कि यह "इम्प्लिसिट" तरीका एक आशाजनक, डेटा-संचालित विकल्प है जो पुराने, कठोर तरीकों की तुलना में लंबे, अव्यवस्थित कार्यों को बेहतर ढंग से संभालता है, खासकर जब रोबोट को लंबे समय तक काम करना पड़ता है। लेकिन याद रखें, यह मुख्य रूप से सिमुलेशन पर आधारित है, और वास्तविक दुनिया अभी भी एक चुनौतीपूर्ण जगह है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →