← नवीनतम पेपर
💻 computer science

Learning to Act Through Contact: A Unified View of Multi-Task Robot Learning

यह शोध पत्र एक एकीकृत ढांचे (unified framework) को प्रस्तुत करता है जो संपर्क लक्ष्यों (contact goals) के अनुक्रमों को स्पष्ट रूप से परिभाषित और निष्पादित करके विभिन्न रोबोटिक रूपात्मकताओं (morphologies) में विविध लोकोमोशन और मैनिपुलेशन कार्यों में महारत हासिल करने के लिए एक एकल लक्ष्य-सशर्त सुदृढीकरण शिक्षण नीति (goal-conditioned reinforcement learning policy) का उपयोग करता है।

मूल लेखक: Shafeef Omar, Majid Khadiv

प्रकाशित 2026-05-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shafeef Omar, Majid Khadiv

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना सिखा रहे हैं। पारंपरिक रूप से, यदि आप चाहते थे कि रोबोट चले, तो आप उसे "आगे बढ़ो" सिखाते। यदि आप चाहते थे कि वह एक कप उठाए, तो आप उसे "कप पकड़ो" सिखाते। यदि आप चाहते थे कि वह कूदे, तो आप उसे "कूदो" सिखाते। रोबोट इन सबको अलग-अलग, स्वतंत्र कौशलों के रूप में सीखता है। यदि आप उससे कुछ थोड़ा नया करने को कहते, जैसे समतल जमीन के बजाय पत्थरों पर चलना, तो वह अक्सर रुक जाता क्योंकि उसे उस विशिष्ट कौशल के लिए नहीं सिखाया गया था।

यह शोध पत्र सोचने का एक अलग तरीका प्रस्तावित करता है। रोबोट को यह सिखाने के बजाय कि क्या करना है (चलना, कूदना, पकड़ना), लेखक उसे यह सिखाते हैं कि कहाँ छूना है।

मुख्य विचार: "टच लिस्ट" (स्पर्श सूची)

रोबोट के मस्तिष्क को केवल कमांड की सूची के रूप में न देखें जैसे "चलो" या "नाचो", बल्कि इसे हाथ मिलाने के शेड्यूल के रूप में देखें।

इस नए ढांचे में, एक "कार्य" (task) केवल संपर्क लक्ष्यों (contact goals) का एक क्रम है।

  • लक्ष्य 1: "अपने बाएं पैर को इस विशिष्ट स्थान पर 0.5 सेकंड के लिए छुएं।"
  • लक्ष्य 2: "अपने दाएं पैर को उस स्थान पर 0.5 सेकंड के लिए छुएं।"
  • लक्ष्य 3: "अपने हाथ से मेज को यहाँ छुएं।"

रोबोट को इससे कोई फर्क नहीं पड़ता कि वह चल रहा है, रेंग रहा है, या कोई डिब्बा उठा रहा है। उसे केवल स्पर्श के शेड्यूल की परवाह है। यदि शेड्यूल कहता है "यहाँ छुओ, फिर वहाँ छुओ," तो रोबोट उन स्पर्शों को करने के लिए अपने शरीर को हिलाने का सबसे अच्छा तरीका खुद ढूंढ लेता है।

छूने के तीन "मोड"

लेखक हर संपर्क को तीन सरल चरणों में विभाजित करते हैं, जैसे कि एक नृत्य की दिनचर्या:

  1. रीच (पहुँचना): रोबोट अपने अंग को लक्ष्य स्थान तक पहुँचने के लिए बाहर की ओर घुमाता है (जैसे हाथ दरवाजे के हैंडल की ओर बढ़ता है)।
  2. होल्ड (पकड़ना): एक बार जब वह छू लेता है, तो वह वहां मजबूती से टिका रहता है (जैसे दरवाजे के हैंडल को पकड़ना)।
  3. डिटैच (हटना): वह छूना छोड़ देता है और अगले स्थान को खोजने के लिए स्वतंत्र रूप से घूमता है (जैसे दूर जाने के लिए हाथ छोड़ना)।

इन तीन चरणों को मिलाकर, रोबोट लगभग कुछ भी कर सकता है।

"स्विस आर्मी नाइफ" रोबोट

शोधकर्ताओं ने इस विचार का परीक्षण दो बहुत ही अलग प्रकार के रोबोटों पर किया: एक चार पैरों वाला कुत्ता (क्वाड्रुपेड) और एक दो पैरों वाला मानव जैसा रोबोट (ह्यूमनॉइड)। उन्होंने एक ही मस्तिष्क (एक पॉलिसी) को सब कुछ संभालने के लिए प्रशिक्षित किया।

  • कुत्ता: इस एकल मस्तिष्क ने टहलना, तेज चलना, उछलना, कूदना और यहाँ तक कि रेंगना भी सीखा। उसे प्रत्येक चाल (gait) के लिए अलग मस्तिष्क की आवश्यकता नहीं थी। वह बस "स्पर्श के शेड्यूल" का पालन करता था।
  • ह्यूमनॉइड: इस रोबोट ने दो पैरों पर चलना, चार पैरों पर रेंगना और यहाँ तक कि "हाथ की सहायता से" कूदना भी सीखा।
  • हाथ: उसी ह्यूमनॉइड मस्तिष्क ने एक डिब्बे को उठाना, मेज पर उसे घुमाना और उसकी स्थिति को बनाए रखते हुए उसे ऊपर उठाना सीखा।

यह एक बड़ी बात क्यों है (उपमा)

कल्पना कीजिए कि आप पियानो बजाना सीख रहे हैं।

  • पुराना तरीका: आप एक विशिष्ट गाना याद करते हैं। यदि कोई आपसे दूसरा गाना बजाने को कहता है, तो आप नहीं बजा पाते। आपको सब कुछ फिर से सीखना पड़ता है।
  • नया तरीका (यह शोध पत्र): आप "विशिष्ट समय पर चाबियों (keys) को दबाने" की अवधारणा सीखते हैं। आप गाने याद नहीं करते; आप "कब दबाना है" के लय और समय को याद करते हैं। क्योंकि आप "कब दबाना है" के अंतर्निary तर्क को समझते हैं, इसलिए आप केवल "स्पर्श शेड्यूल" को पढ़कर एक ऐसा गाना बजा सकते हैं जो आपने पहले कभी नहीं सुना है।

यह शोध पत्र दिखाता है कि संपर्क (कब और कहाँ दबाना है) पर ध्यान केंद्रित करके, रोबोट नई स्थितियों के अनुकूल होने में बहुत बेहतर हो जाता है।

वास्तविक दुनिया का प्रमाण

शोधकर्ताओं ने दिखाया कि यह दृष्टिकोण दो प्रमुख तरीकों से पुराने तरीकों की तुलना में बेहतर काम करता है:

  1. नई दिशाएँ: जब इसे बगल की ओर चलने (कुछ ऐसा जिसे इसे स्पष्ट रूप से नहीं सिखाया गया था) के लिए कहा गया, तो "स्पर्श-आधारित" रोबोट ने तुरंत इसे समझ लिया। पुराना "वेग-आधारित" (velocity-based) रोबोट भ्रमित होकर वहीं खड़ा रह गया।
  2. नए आकार: जब इसे एक चौकोर डिब्बे के बजाय एक गोल गेंद को पकड़ने के लिए कहा गया (ऐसे आकार जो उसने पहले कभी नहीं देखे थे), तो "स्पर्श-आधारित" रोबोट ने तुरंत अपनी पकड़ को अनुकूलित कर लिया। पुराना रोबोट, जो "डिब्बे के आकार" को याद रखने पर निर्भर था, संघर्ष करने लगा।

निचोड़

यह शोध पत्र दावा करता है कि गति के एक मौलिक निर्माण खंड (building block) के रूप में स्पर्श को मानकर, न कि केवल गति का एक परिणाम मानकर, हम एक सार्वभौमिक रोबोट मस्तिष्क बना सकते हैं। यह मस्तिष्क चलने, कूदने और वस्तुओं को उठाने के बीच सहजता से स्विच कर सकता है, बस "कहाँ छूना है" के निर्देशों की एक नई सूची का पालन करके। यह रोबोट को अधिक लचीला, मजबूत और वास्तविक दुनिया की अनिश्चितताओं के लिए तैयार बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →