← नवीनतम पेपर
🤖 machine learning

Posterior-driven Heuristic Support Adaptation in a Probabilistic Treatment of Real2Sim2Real for Vision-Driven Deformable Linear Object Manipulation

यह शोध पत्र रियल2सिम2रियल (Real2Sim2Real) परिदृश्यों में विरूपण योग्य रैखिक वस्तुओं (deformable linear objects) के हेरफेर के लिए पैरामीटर पहचान और सुदृढ़ नीति शिक्षण में सुधार करने हेतु, लाइकलीहुड-फ्री इन्फरेंस (likelihood-free inference) में निश्चित सैंपलिंग सपोर्ट की सीमाओं को दूर करने के लिए एक पोस्टीरियर-ड्रिवन ह्यूरिस्टिक सपोर्ट अडैप्टेशन विधि (EDGE, MODE और CENTRE रणनीतियों का उपयोग करते हुए) प्रस्तावित करता है।

मूल लेखक: Georgios Kamaras, Craig Innes, Subramanian Ramamoorthy

प्रकाशित 2026-09-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Georgios Kamaras, Craig Innes, Subramanian Ramamoorthy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट दुनिया में चलने-फिरने में उल्लेखनीय रूप से कुशल होते जा रहे हैं, लेकिन वे अभी भी उन कोमल और लचीली चीजों के साथ संघर्ष करते हैं जो हमारे दैनिक जीवन का एक बड़ा हिस्सा हैं। एक कठोर धातु वाला हाथ कॉफी मग को आसानी से उठा सकता है, लेकिन जब उसे एक गीले नूडल, कपड़े के टुकड़े या रबर के पाइप जैसे सामान को संभालने के लिए कहा जाता है, तो वह अक्सर विफल हो जाता है। इन वस्तुओं को, जिन्हें वैज्ञानिक समुदाय में 'डिफॉर्मेबल लीनियर ऑब्जेक्ट्स' (deformable linear objects) के रूप में जाना जाता है, हिलाने-डुलाने पर वे अपना आकार लगातार बदलते रहते हैं। रोबोट को उन्हें नियंत्रित करना सिखाने के लिए, इंजीनियर आमतौर पर कंप्यूटर के भीतर उस वस्तु का एक 'डिजिटल ट्विन' (digital twin) बनाते हैं। वे हजारों सिमुलेशन चलाते हैं, जिससे रोबोट एक आभासी दुनिया में अभ्यास करता है जब तक कि वह सही चालें सीख न जाए। चुनौती उस आभासी दुनिया और वास्तविकता के बीच के अंतर में निहित है। यदि कंप्यूटर मॉडल यह मान लेता है कि रबर का पाइप वास्तविक वाले की तुलना में अधिक सख्त या लंबा है, तो रोबोट कौशल का एक ऐसा सेट सीख लेगा जो सिमुलेशन में तो पूरी तरह काम करता है, लेकिन वास्तविक वस्तु का उपयोग करते समय पूरी तरह विफल हो जाता है।

इस अंतर को पाटने के लिए, शोधकर्ता 'लाइक्लीहुड-फ्री इन्फरेंस' (likelihood-free inference) नामक पद्धति का उपयोग करते हैं। इसे एक शिक्षित अनुमान लगाने की प्रक्रिया के रूप में समझें। रोबोट एक वास्तविक वस्तु को देखता है, और कंप्यूटर उन छिपे हुए भौतिक गुणों—जैसे लंबाई और कठोरता—का पता लगाने की कोशिश करता है जो डिजिटल संस्करण को बिल्कुल वास्तविक वस्तु की तरह व्यवहार करने में सक्षम बनाएंगे। कंप्यूटर एक "पोस्टीरियर" (posterior) उत्पन्न करता है, जो अनिवार्य रूप से इन गुणों के सबसे संभावित मानों का एक मानचित्र है। हालाँकि, इस प्रक्रिया में एक छिपा हुआ जाल है। कंप्यूटर द्वारा अनुमान लगाना शुरू करने से पहले, शोधकर्ता को संभावित मानों की एक सीमा (range) निर्धारित करनी होती है, एक ऐसी सीमा जिसके भीतर उत्तर होना चाहिए। यदि यह प्रारंभिक सीमा गलत तरीके से सेट की गई है, तो कंप्यूटर का सबसे अच्छा अनुमान उस बॉक्स के किनारे पर फंस जाएगा, जिससे एक आत्मविश्वासी लेकिन गलत निष्कर्ष निकलेगा। शोधकर्ता जॉर्जियोस कामारस, क्रेग इनेस और सुब्रमण्यन राममूर्ति ने इस विशिष्ट समस्या को हल करने का प्रयास किया, और यह सवाल उठाया कि कंप्यूटर यह कैसे जान सकता है कि उसकी प्रारंभिक सीमाएं गलत हैं और वह चलते-चलते उन्हें कैसे समायोजित कर सकता है।

टीम ने एक ऐसे कार्य पर ध्यान केंद्रित किया जो कोमल वस्तुओं को संभालने की कठिनाई को दर्शाता है: एक रोबोटिक हाथ एक लचीले पाइप को झटककर क्यूब के ढेर के ऊपर वाले हिस्से को गिरा देता है। लक्ष्य सरल है, लेकिन भौतिकी जटिल है। पाइप को इतना लंबा और सख्त होना चाहिए कि वह क्यूब से टकराने के लिए संवेग (momentum) ले जा सके, लेकिन इतना सख्त भी नहीं कि वह ढेर को तोड़ दे या इतना लंबा भी नहीं कि वह उलझ जाए। शोधकर्ताओं ने पहले अपने विचारों का परीक्षण शिकारी और शिकार (predator and prey) की आबादी के एक सरल, अमूर्त गणितीय मॉडल पर किया, जो एक अराजक, दोलनशील व्यवहार के लिए जाना जाता है। इन परीक्षणों में, उन्होंने दिखाया कि जब कंप्यूटर को ऐसे मानों की श्रेणी दी गई जिसमें वास्तविक उत्तर शामिल नहीं था, तो वह अपने पूरे विश्वास को उस रेंज के बिल्कुल किनारे पर जमा देता था, जिससे निश्चितता का एक झूठा अहसास पैदा होता था। फिर उन्होंने कंप्यूटर को यह गलती पहचानने में मदद करने के लिए तीन अलग-अलग रणनीतियाँ विकसित कीं। पहली रणनीति, जिसे उन्होंने EDGE नाम दिया, इस बात पर नज़र रखती है कि कंप्यूटर का विश्वास कहाँ जमा हो रहा है। यदि कंप्यूटर को यकीन है कि उत्तर अनुमत सीमा के बिल्कुल किनारे पर है, तो EDGE रणनीति कंप्यूटर को उस दिशा में अपनी सीमा को बाहर की ओर फैलाने के लिए कहती है। अन्य दो रणनीतियाँ, MODE और CENTRE, इस बात पर नज़र रखती हैं कि कंप्यूटर का सबसे अच्छा अनुमान समय के साथ कैसे बदलता है या उसके विश्वास का केंद्र कहाँ स्थित है, लेकिन EDGE दृष्टिकोण सबसे विश्वसनीय साबित हुआ।

इस नई पद्धति के साथ, टीम वास्तविक दुनिया के प्रयोग के साथ आगे बढ़ी जिसमें रोबोट और रबर के पाइप शामिल थे। उन्होंने लंबाई और कोमलता में भिन्नता वाले चार अलग-अलग पाइप बनाए, और रोबोट को क्यूब के ढेर को गिराने की कोशिश करते हुए देखने के लिए एक कैमरा सेटअप किया। उन्होंने अपनी इन्फरेंस प्रक्रिया चलाई, जिससे कंप्यूटर प्रत्येक पाइप के गुणों को सीख सका। जब उन्होंने निश्चित सीमाओं के साथ मानक पद्धति का उपयोग किया, तो कंप्यूटर अक्सर अटक गया, थोड़ा बहुत अलग दिखने वाले पाइपों के बीच अंतर करने में असमर्थ रहा। लेकिन जब उन्होंने कंप्यूटर को अपनी खोज सीमा को विस्तारित करने के लिए EDGE रणनीति का उपयोग करने दिया, तो परिणाम बदल गए। कंप्यूटर अब 200 मिलीमीटर लंबे पाइप और 290 मिलीमीटर लंबे पाइप के बीच अंतर कर सका, और वह उनकी कठोरता का सटीक अनुमान लगा सका। इस सूक्ष्म समझ ने उन्हें प्रत्येक विशिष्ट पाइप के लिए एक नया 'रोबोट पॉलिसी' प्रशिक्षित करने की अनुमति दी। सभी पाइपों के लिए एक सामान्य तरीका सिखाने के बजाय, उन्होंने प्रत्येक के लिए एक विशेष कौशल सिखाया।

इस विशेष प्रशिक्षण के परिणाम चौंकाने वाले थे। जब शोधकर्ताओं ने वास्तविक दुनिया में रोबोटों का परीक्षण किया, तो अनुकूलित, व्यापक सीमाओं के साथ प्रशिक्षित एजेंटों ने काफी बेहतर प्रदर्शन किया। वे अधिक स्थिर थे, अधिक उद्देश्य के साथ चले, और क्यूब को गिराने में बहुत अधिक सफल रहे। उन पाइपों के लिए जहाँ प्रारंभिक सीमाएँ बहुत संकीर्ण थीं, सुधार नाटकीय था। रोबट ने पाइप को ठीक सही ऊंचाई तक उठाने और उसे सही बल के साथ झटकने का कौशल सीखा, जो स्वाभाविक रूप से उभरा क्योंकि कंप्यूटर अंततः वस्तु की वास्तविक भौतिक सीमाओं को समझ गया था। इसके विपरीत, पुराने, निश्चित सीमाओं के साथ प्रशिक्षित रोबोट अक्सर पाइप को मेज पर घसीटते थे या बहुत कमजोर प्रहार करते थे, जिससे वे लक्ष्य को हटाने में विफल रहे।

यह कार्य प्रदर्शित करता है कि जिस तरह से हम रोबोट के सीखने के लिए खोज क्षेत्र (search space) को परिभाषित करते हैं, वह लर्निंग एल्गोरिदम जितना ही महत्वपूर्ण है। कंप्यूटर को यह पहचानने की अनुमति देकर कि वह सोचने के लिए जगह खत्म कर रहा है और उसके अनुसार अपनी सीमाओं को फैलाने की अनुमति देकर, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो यह जानने में अधिक ईमानदार है कि वह क्या जानता है और जो उसे जानने की आवश्यकता है उसे सीखने में अधिक सक्षम है। EDGE ह्यूरिस्टिक एक सरल लेकिन शक्तिशाली मार्गदर्शक के रूप में कार्य करता है, यह सुनिश्चित करता है कि रोबोट का डिजिटल प्रशिक्षण भौतिक दुनिया की वास्तविक जटिलता को दर्शाता है। यह दृष्टिकोण केवल रोबोट को एक विशिष्ट कार्य में बेहतर नहीं बनाता है; यह मशीनों को हमारे चारों ओर मौजूद कोमल, अप्रत्याशित और लगातार बदलने वाली सामग्रियों के साथ बातचीत करने के लिए सिखाने का एक सामान्य मार्ग प्रदान करता है। निष्कर्ष बताते हैं कि भविष्य में, रोबोटों को यह बताने की आवश्यकता नहीं होगी कि उन्हें क्या उम्मीद करनी चाहिए; इसके बजाय, उन्हें अपनी समझ की सीमाओं को पहचानने और सीखते समय उन्हें विस्तारित करने के उपकरण दिए जा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →