← नवीनतम पेपर
💻 computer science

Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation

यह शोध पत्र एक नवीन दृष्टिकोण प्रस्तावित करता है जो जटिल, संपर्क-समृद्ध (contact-rich) वातावरणों में सार्वभौमिक, गैर-पकड़ (non-prehensile) रोबोटिक हेरफेर नीतियों को प्रभावी ढंग से प्रशिक्षित करने के लिए संरचित रीसेट रणनीतियों और अन्वेषण को बढ़ाने के लिए पाठ्यक्रम शिक्षण (curriculum learning) का लाभ उठाते हुए, संकुचित अवस्था नमूनाकरण (constrained state sampling) को सुदृढीकरण शिक्षण (reinforcement learning) के साथ जोड़ता है।

मूल लेखक: Marc Toussaint, Cornelius V. Braun, Armand Jordana, Sayantan Auddy, Eckart Cobo-Briesewitz, Denis Shcherba, Tilman Burghoff, Justin Carpentier

प्रकाशित 2026-07-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Marc Toussaint, Cornelius V. Braun, Armand Jordana, Sayantan Auddy, Eckart Cobo-Briesewitz, Denis Shcherba, Tilman Burghoff, Justin Carpentier

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक आर्म को मेज पर एक गेंद या घन (cube) को उठाने के बिना, उसे धकेलने, खिसकाने और संतुलित करने के बारे में सिखाने की कोशिश कर रहे हैं। इसे "नॉन-प्रीहेन्साइल मैनिपुलेशन" (non-prehensile manipulation) कहा जाता है। यह अविश्वसनीय रूप से कठिन है क्योंकि फिसलने और उछलने का भौतिक विज्ञान (physics) अव्यवस्थित, अप्रत्याशित और अचानक होने वाले परिवर्तनों से भरा होता है (जैसे जब एक गेंद दीवार से टकराती है और वापस उछलती है)।

यह शोध पत्र इस कार्य के लिए रोबोट को प्रशिक्षित करने के दो मुख्य विचारों को जोड़कर एक नया तरीका पेश करता है: सुदृढीकरण लर्निंग (Reinforcement Learning - RL) और प्रतिबंधित नमूनाकरण (Constrained Sampling)। यहाँ इसका विवरण सरल उपमाओं के साथ दिया गया है।

समस्या: रोबोट एक अंधेरे जंगल में खो गया है

सुदृढीकरण लर्निंग (RL) को 'गलतियों से सीखने' के रूप में समझें। इसमें रोबोट यादृच्छिक (random) चालें चलता है, यदि वह सफल होता है तो उसे इनाम मिलता है, और वह अपनी गलतियों से सीखता है।

  • समस्या: जटिल कार्यों में (जैसे एक घन को उसके कोने पर संतुलित करना), रोबोट को सफलता के लिए बहुत ही विशिष्ट और दुर्लभ चालों के क्रम को खोजना होता है। यदि रोबोट हर बार एक यादृच्छिक स्थिति से शुरू होता है, तो वह किसी भी "जादुई स्थान" तक पहुँचने से पहले वर्षों तक दीवारों से टकराते हुए बिता सकता है जहाँ घन संतुलित हो सके। यह घास के ढेर में सुई खोजने जैसा है, जहाँ आप आँख बंद करके तीर फेंक रहे हों।

समाधान: एक स्मार्ट मैप और एक निर्देशित दौरा

लेखक एक नया सिस्टम प्रस्तावित करते हैं जिसे CSRF (Combined Constrained Sampling and Reinforcement Learning) कहा जाता है। वे "जंगल में खो जाने" की समस्या को तीन तरकीबों से हल करते हैं:

1. "भौतिकी-आधारित" मानचित्र (Constrained Sampling)

रोबोट को पूरी तरह से यादृच्छिक और अराजक स्थिति में छोड़ने के बजाय, लेखकों ने एक विशेष "सैंपलर" बनाया है।

  • उपमा: कल्पना कीजिए कि आप एक छात्र को अपने हाथ पर झाड़ू संतुलित करना सिखाना चाहते हैं। आप झाड़ू को हवा में उछालकर यह उम्मीद नहीं करेंगे कि वह उनके हाथ में गिर जाए। इसके बजाय, आप झाड़ू को सावधानीपूर्वक ऐसी स्थिति में रखेंगे जहाँ वह संतुलित हो सके, भले ही वह अभी पूरी तरह से स्थिर न हो।
  • यह कैसे काम करता है: यह सैंपलर भौतिकी के नियमों (जैसे घर्षण और गुरुत्वाकर्षण) को समझने के लिए गणित का उपयोग करता है। यह ऐसे शुरुआती और लक्ष्य स्थान उत्पन्न करता है जो भौतिक रूप से संभव हैं (उदाहरण के लिए, गेंद मेज को छू रही है, हवा में तैर नहीं रही है) और विभिन्न प्रकार के दिलचस्प संपर्क परिदृश्यों को कवर करता है (जैसे गेंद दीवार, फर्श, या रोबोट के हाथ को छू रही है)। यह सुनिश्चित करता है कि रोबोट हमेशा एक "सिखाने योग्य" क्षण में शुरू करे।

2. "ट्रेनिंग व्हील्स" दृष्टिकोण (Curriculum Learning)

एक बार जब रोबोट के पास वैध शुरुआती स्थितियों की एक सूची आ जाती है, तो लेखक उसे तुरंत गहरे पानी में नहीं झोंक देते।

  • उपमा: तैरना सीखने के बारे में सोचें। आप समुद्र के गहरे हिस्से में कूदकर शुरुआत नहीं करते। आप उथले पानी से शुरू करते हैं, फिर बीच में, और फिर गहरे पानी में जाते हैं।
  • यह कैसे काम करता है: सिस्टम रोबोट को उन लक्ष्यों तक पहुँचने के लिए प्रशिक्षित करना शुरू करता है जो उसके शुरुआती स्थान के बहुत करीब हैं। जैसे-जैसे रोबoret बेहतर होता जाता है, सिस्टम धीरे-धीरे शुरुआत और लक्ष्य के बीच की दूरी बढ़ाता जाता है। इसे "करिकुलम" (पाठ्यक्रम) कहा जाता है। यह रोबोट को आसान कार्यों से कठिन कार्यों की ओर ले जाता है, जिससे उसे हताशा या फंसने से बचाया जा सके।

3. "पुल बनाने वाला" (Projected Interpolation)

कभी-कभी, एक अच्छे मानचित्र के बावजूद, "शुरुआत" से "लक्ष्य" तक की छलांग बहुत बड़ी होती है।

  • उपमा: यदि आप एक चौड़ी नदी के पार अपने घर से अपने दोस्त के घर तक जाना चाहते हैं, तो आप बस कूद नहीं सकते। आपको एक पुल की आवश्यकता है।
  • यह कैसे काम करता है: सिस्टम रोबोट के दिमाग में "शुरुआत" और "लक्ष्य" के बीच एक सीधी रेखा खींचता है। हालाँकि, चूंकि एक सीधी रेखा दीवार के माध्यम से जा सकती है (जो असंभव है), सिस्टम उस रेखा को निकटतम वैध, भौतिक पथ पर "प्रोजेक्ट" (परिवर्तित) करता है। यह मध्यवर्ती लक्ष्यों (stepping stones) की एक श्रृंखला बनाता है जिन पर रोबोट वास्तव में चल सकता है, जिससे यात्रा सीखना बहुत आसान हो जाता है।

उन्होंने क्या परीक्षण किया?

टीम ने इस पद्धति का चार अलग-अलग परिदृश्यों पर परीक्षण किया, जो सरल से लेकर बहुत कठिन तक हैं:

  1. डबल-स्फीयर (Double-Sphere): एक रोबोट एक गेंद को दीवार के विरुद्ध धकेल रहा है।
  2. पांडा-स्फीयर (Panda-Sphere): एक जटिल रोबोटिक आर्म (जैसे पांडा रोबोट) पूरे शरीर का उपयोग करके गेंद को उठाने और पकड़ने का काम कर रहा है।
  3. स्फीयर-क्यूब (Sphere-Cube): एक घन को उसके किनारे या कोने पर संतुलित करना।
  4. पांडा-क्यूब (Panda-Cube): एक जटिल रोबोटिक आर्म द्वारा घन को संतुलित करना।

परिणाम

  • यादृच्छिक बनाम स्मार्ट: जब उन्होंने रोबोट को यादृच्छिक रूप से शुरू होने दिया, तो वह कठिन कार्यों में लगभग पूरी तरह से विफल रहा। जब उन्होंने अपने "स्मार्ट मैप" (Constrained Sampling) का उपयोग किया, तो रोबोट सफलतापूर्वक सीख गया।
  • गति: "ट्रेनिंग व्हील्स" (Curriculum) और "पुल बनाने वाले" (Interpolation) तरीकों के साथ रोबोट ने बहुत तेज़ी से सीखा।
  • वास्तविक दुनिया: उन्होंने सिमुलेशन में सीखी गई कौशलों को वास्तविक दुनिया में स्थानांतरित करने के लिए एक वास्तविक रोबोट (गेंद को ट्रैक करने के लिए कैमरे का उपयोग करते हुए) पर भी इसका परीक्षण किया।

निष्कर्ष

यह शोध पत्र तर्क देता है कि रोबोट को जटिल भौतिक कौशल सिखाने के लिए, हमें उन्हें केवल "अनुमान" लगाने के लिए नहीं छोड़ना चाहिए। इसके बजाय, हमें स्मार्ट, भौतिक रूप से वैध शुरुआती बिंदु उत्पन्न करने के लिए गणित का उपयोग करना चाहिए और रोबोट को चरण-दर-चरण सीखने के मार्ग के माध्यम से निर्देशित करना चाहिए। यह संयोजन रोबोट को संतुलन और धकेलने जैसे कठिन कार्यों में महारत हासिल करने की अनुमति देता है जो पहले मानक AI विधियों के लिए बहुत कठिन थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →