← नवीनतम पेपर
🤖 machine learning

CoWAM: Coordination Contracts for Selective Policy Intervention with WAMs

CoWAM द्विपक्षीय (bimanual) रोबोटों के लिए एक चयनात्मक हस्तक्षेप परत (selective intervention layer) पेश करता है जो समन्वय अनुबंधों (coordination contracts) का उपयोग करता है ताकि वर्ल्ड एक्शन मॉडल (WAM) नीतियों को केवल तभी सुरक्षित रूप से संशोधित किया जा सके जब विशिष्ट सिंक्रोनाइज़ेशन, भूमिका और टकराव के मानदंड पूरे हों, जिससे हानिकारक हस्तक्षेप के नगण्य जोखिम को बनाए रखते हुए समन्वय सफलता दर में महत्वपूर्ण सुधार होता है।

मूल लेखक: Shuaijun Liu, Qifu Wen, Shuyang Hao, Qi Luo, Chenglong Zhang, Feiyang You, Chengyu Wu, Ningxin Su

प्रकाशित 2026-08-04
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Shuaijun Liu, Qifu Wen, Shuyang Hao, Qi Luo, Chenglong Zhang, Feiyang You, Chengyu Wu, Ningxin Su

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रोबोटिक भुजाओं की एक जोड़ी को एक जटिल टैंगो (tango) नृत्य सिखा रहे हैं। आप नहीं चाहते कि वे केवल हिलें-डुलें; आप चाहते हैं कि वे एक साथ मिलकर चलें। यदि एक भुजा कप उठाने के लिए पहुँचती है और दूसरी गलती से उसे गिरा देती है, या यदि वे दोनों एक ही हैंडल को पकड़ने की कोशिश करते हैं, तो नृत्य विफल हो जाता है। यह बाइमैनुअल रोबोटिक्स (bimanual robotics) की दुनिया है, जहाँ दो भुजाओं को वस्तुओं को संभालने के लिए पूर्ण समन्वय के साथ काम करना होता है। रोबोट को योजना बनाने में मदद करने के लिए, वैज्ञानिक वर्ल्ड एक्शन मॉडल्स (World Action Models - WAMs) नामक चीज़ का उपयोग करते हैं। WAM को एक "क्रिस्टल बॉल" (भविष्य दिखाने वाला गोला) की तरह समझें: यह एक प्रस्तावित चाल को लेता है और सिम्युलेट करता है कि यदि वह चाल चली गई तो भविष्य कैसा दिखेगा। यह एक वीडियो गेम प्रीव्यू की तरह है, जो रोबोट को दिखाता है, "यदि तुम वहाँ पहुँचे, तो तुम इसे गिरा दोगे।" लेकिन पेचीदा बात यह है कि सिर्फ इसलिए कि रोबोट एक ऐसा भविष्य देख सकता है जहाँ चीजें गलत हो जाती हैं, इसका मतलब यह नहीं है कि उसे तुरंत अपना इरादा बदल लेना चाहिए। कभी-कभी रोबोट की मूल योजना वास्तव में ठीक होती है, और एक डरावने सिम्युलेशन पर घबराहट करने से अधिक गलतियाँ हो सकती हैं। बड़ा सवाल यह है: हम रोबोट को कैसे बताएं कि कब अपने अंतर्मन (gut) पर भरोसा करना है और कब अपनी क्रिस्टल बॉल की बात सुननी है?

यह शोध पत्र एक चतुर समाधान पेश करता है जिसे CoWAM (Coordination Contracts with World Models) कहा जाता है। रोबोट के "क्रिस्टल बॉल" को उसकी योजनाओं को बेतरतीब ढंग से ओवरराइड करने देने के बजाय, CoWAM एक सख्त और निष्पक्ष रेफरी की तरह कार्य करता है जो केवल तभी हस्तक्षेप करता है जब विशिष्ट नियम टूटते हैं। शोधकर्ताओं ने एक ऐसी प्रणाली स्थापित की है जहाँ रोबोट की मूल योजना (जिसे "नोमिनल एक्शन" कहा जाता है) तब तक प्रभारी रहती है जब तक कि कोई बेहतर विकल्प श्रृंखला की कठिन परीक्षाओं को पास न कर ले। इन परीक्षाओं को कोऑर्डिनेशन कॉन्ट्रैक्ट्स (coordination contracts) कहा जाता है। इन कॉन्ट्रैक्ट्स को वादों की एक चेकलिस्ट के रूप में समझें: "वादा करो कि तुम दूसरी भुजा से नहीं टकराओगे," "वादा करो कि तुम सही समय पर वस्तु को पकड़ोगे," और "वादा करो कि तुम कप नहीं गिराओगे।"

यह प्रणाली इस प्रकार कार्य करती है: रोबोट संभावित चालों की एक सूची बनाता है, जिसमें उसकी शीर्ष पसंद और कुछ विकल्प शामिल होते हैं। CoWAM उन सभी के लिए "क्रिस्टल बॉल" भविष्यवाणियों को देखता है। यह रोबोट को एक नई चाल पर तभी स्विच करने की अनुमति देता है यदि वह नई चाल प्रत्येक सक्रिय अनुबंध (जैसे कोई टकराव नहीं, सटीक समय, आदि) को पूरा करती है और एक स्पष्ट, कम जोखिम वाला सुधार प्रदान करती है। यदि नई चाल जोखिम भरी है या वह मूल योजना को स्पष्ट रूप से नहीं हरा पाती है, तो CoWAM कहता है, "मूल योजना के साथ बने रहो।" यदि मूल योजना भी खराब दिखती है, तो रोबोट के पास रुकने और मदद माँगने के लिए एक सुरक्षा जाल (safety net) होता है।

लेखकों ने इसे आठ अलग-अलग दो-हाथ वाले कार्यों, जैसे कटोरे सजाना, बर्तन उठाना और बोतलों को कूड़ेदान में डालना, जैसे एक सिम्युलेटेड विश्व में परखा। उन्होंने पाया कि CoWAM अन्य तरीकों की तुलना में सही चाल चुनने में बहुत बेहतर था। विशेष रूप से, जब अवसर आया, तो इसने वैध, समन्वित विकल्पों को 93.3% बार सफलतापूर्वक पहचाना और चुना, जबकि पूर्ण "कॉन्ट्रैक्ट" प्रणाली के बिना यह केवल 76.7% था। इससे भी महत्वपूर्ण बात यह है कि यह बहुत सावधान था: इसने हानिकारक गलतियाँ (जैसे कि टक्कर होना) 1% से भी कम समय में कीं। वास्तविक दुनिया के सिम्युलेशन में, इसने सबसे अच्छे पिछले तरीकों की तुलना में सफल कार्य पूर्णता में 9.6 प्रतिशत अंक की वृद्धि की। यह शोध पत्र दिखाता है कि इन सख्त "अनुबंधों" का उपयोग करके भविष्यवाणियों को फ़िल्टर करने से, रोबोट न केवल नई चीजें आज़माने के लिए साहसी बन सकते हैं बल्कि आपदाओं से बचने के लिए स्मार्ट भी हो सकते हैं, जिससे एक अराजक नृत्य एक सुचारू प्रदर्शन में बदल जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →