← नवीनतम पेपर
💻 computer science

Affordance-Based Hierarchical Reinforcement Learning for Quadruped Pedipulation

यह शोध पत्र एक तीन-स्तरीय पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) ढांचे का प्रस्ताव करता है जो जटिल वस्तु हेरफेर कार्यों को निष्पादित करने के लिए मानव मार्गदर्शन के बिना चतुष्पाद रोबोटों को इष्टतम बेस पोज़ और इंटरेक्शन-पॉइंट अफोर्डेंस का स्वायत्त रूप से चयन करने में सक्षम बनाने हेतु पोज़ और इंटरेक्शन-पॉइंट अफोर्डेंस का लाभ उठाता है।

मूल लेखक: Tuba Girgin, Jose Castelblanco, Gabriel Rodriguez, Emre Girgin, Cagri Kilic

प्रकाशित 2026-06-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tuba Girgin, Jose Castelblanco, Gabriel Rodriguez, Emre Girgin, Cagri Kilic

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक चार पैरों वाला रोबोट कुत्ता, जो एक उच्च-तकनीकी बिल्ली के समान है, एक ऊबड़-खाबड़ और असमान आँगन में एक भारी पत्थर को धकेलने का तरीका समझने की कोशिश कर रहा है। अतीत में, वैज्ञानिकों को सख्त कठपुतली मास्टर की तरह काम करना पड़ता था, जो रोबोट को ठीक-ठीक बताता था कि उसे कहाँ खड़ा होना है और पत्थर को धकेलने के लिए अपने पैर को कैसे चलाना है। यदि पत्थर हिल जाता या ज़मीन बदल जाती, तो रोबट फंस जाता क्योंकि उसे अनुकूलन (adapt) करना नहीं आता था।

यह शोध पत्र रोबोट को एक स्मार्ट, स्वतंत्र समस्या-समाधानकर्ता बनाने के लिए सिखाने का एक नया तरीका पेश करता है। एक कठपुतली होने के बजाय, रोबोट एक जटिल कार्य की योजना बनाने वाले मानव की तरह तीन परतों में "सोचना" सीखता है।

तीन-परतीय मस्तिष्क (The Three-Layer Brain)

शोधकर्ताओं ने 'रीइन्फोर्समेंट लर्निंग' (Reinforcement Learning) नामक सीखने की विधि का उपयोग करके रोबोट के लिए एक "पदानुक्रमित" (hierarchical/layered) मस्तिष्क बनाया। इसे एक कंपनी की तरह समझें जिसमें एक CEO, एक मैनेजर और एक वर्कर होता है:

  1. CEO (उच्च-स्तरीय दृष्टि): यह परत रोबोट की आँखों (एक लेजर स्कैनर) के माध्यम से दुनिया को देखती है। इसका काम पत्थर को पहचानना और यह पूछना है, "इस पत्थर को धकेलने के लिए मेरे खड़े होने की सबसे अच्छी जगह कौन सी है?" यह केवल एक यादृच्छिक (random) स्थान नहीं चुनता; यह एक "अफोर्डेंस" (affordance) की तलाश करता है।

    • उपमा: कल्पना कीजिए कि आप एक ढलान पर एक भारी शॉपिंग कार्ट को धकेलने की कोशिश कर रहे हैं। आप फिसलन भरी घास पर नहीं खड़े होंगे; बल्कि आप उस समतल, ठोस फुटपाथ की तलाश करेंगे जो आपको सबसे अच्छा उत्तोलन (leverage) दे सके। रोबोट का "CEO" भी ऐसा ही करता है। यह जमीन के ढलान और पत्थर के आकार की गणना करता है ताकि धकेलने के लिए सबसे सटीक "पुशिंग स्टांस" (pushing stance) मिल सके।
  2. मैनेजर (नेविगेशन): एक बार जब CEO कहता है, "वहाँ खड़े हो जाओ," तो मैनेजर कार्यभार संभाल लेता है। यह रोबोट के पैरों को निर्देश देता है, "उस स्थान तक पहुँचने के लिए आगे बढ़ो और थोड़ा मुड़ो।" यह बाधाओं से बचते हुए और संतुलन बनाए रखते हुए रोबोट को इलाके के माध्यम से मार्गदर्शन करता है।

  3. वर्कर (लोकोमोशन और पेडिप्यूलेशन): यह मांसपेशी है।

    • लोकोमोशन (Locomotion): यह हिस्सा वास्तव में चलने के लिए पैरों को चलाता है।
    • पेडिप्यूलेशन (Pedipulation): यह पैरों से धकेलने के लिए एक विशेष शब्द है। एक बार जब रोबोट सही जगह पर पहुँच जाता है, तो वर्कर तय करता है कि पत्थर पर उसका अगला-दायां पैर ठीक कहाँ रखना है। वह केवल पैर को नीचे नहीं पटकता; वह पत्थर को कुशलतापूर्वक धकेलने के लिए एक सुचारू, घुमावदार पथ (जैसे हवा में रेखा खींचना) का अनुसरण करता है।

इसने कैसे सीखा (प्रशिक्षण शिविर)

रोबोट ने यह सीधे वास्तविक क्षेत्र में असली पत्थर धकेलकर नहीं सीखा। वह बहुत खतरनाक और धीमा होता। इसके बजाय, शोधकर्ताओं ने रोबोट को IsaacSim नामक एक सुपर-रियलिस्टिक वीडियो गेम की दुनिया में रखा।

  • सिमुलेशन (Simulation): गेम में, उन्होंने रोबोट पर अलग-अलग ढलानों पर हजारों पत्थर फेंके। रोबोट ने पत्थर धकेलने की कोशिश की, असफल हुआ, उसे "पेनल्टी" मिली, फिर से कोशिश की, और अंततः सबसे अच्छा तरीका सीख लिया।
  • वास्तविक दुनिया: गेम में महारत हासिल करने के बाद, वे रोबोट को बाहर ले गए। उन्होंने इसे कोई नया निर्देश नहीं दिया। उन्होंने बस इसे नकली पत्थरों के साथ वास्तविक कंक्रीट पर खुला छोड़ दिया। रोबोट ने वास्तविक दुनिया में नेविगेट करने, खड़े होने के लिए सबसे अच्छी जगह खोजने और पत्थरों को धकेलने के लिए वीडियो गेम में सीखे गए कौशल का सफलतापूर्वक उपयोग किया।

"अफोर्डेंस" का रहस्य

इस सफलता की कुंजी अफोर्डेंस (Affordance) की अवधारणा है। सरल शब्दों में, अफोर्डेंस का अर्थ है कि कोई वस्तु अपने आकार और वातावरण के आधार पर कुछ संभावनाएँ "प्रदान" करती है।

  • एक कुर्सी बैठने की सुविधा (affords sitting) देती है।
  • एक दरवाजे का हैंडल घुमाने की सुविधा (affords turning) देता है।
  • एक ढलान पर एक सपाट जगह धकेलने के लिए एक स्थिर स्थिति (stable stance) प्रदान करती है।

रोबोट का मस्तिष्क इन "प्रस्तावों" को पहचानने के लिए प्रशिक्षित है। वह एक पत्थर को देखता है और कहता है, "आह, यह हिस्सा सपाट है और मेरे पीछे की जमीन स्थिर है; यह धकेलने के लिए एक 'अफोर्डेबल' (affordable) स्थान है।"

परिणाम

शोध पत्र दिखाता है कि यह तीन-परतीय प्रणाली काम करती है।

  • गेम में: रोबोट ने पत्थर को धकेलने के लिए सबसे अच्छा कोण चुनने में महारत हासिल की, जिससे उसने यादृच्छिक रूप से धकेलने की तुलना में कम बल का उपयोग करके उसे अधिक दूर तक धकेला।
  • वास्तविक जीवन में: रोबोट सफलतापूर्वक एक पत्थर तक चला, ढलान के आधार पर सबसे अच्छे कोण का पता लगाया, और उसे धकेला। उसने यह सब बिना किसी इंसान के जॉयस्टिक पकड़े या उसे ठीक-ठीक कदम रखने के लिए बताए किया।

यह क्यों महत्वपूर्ण है (शोध पत्र के अनुसार)

लेखक बताते हैं कि यह एक बड़ी प्रगति है क्योंकि यह हर कार्य के लिए विशिष्ट पथ डिजाइन करने की आवश्यकता को समाप्त कर देता है। रोबोट को "2 मीटर चलो, 10 डिग्री मुड़ो और धकेलो" जैसा प्रोग्राम करने के बजाय, रोबोट एक अव्यवस्थित, अज्ञात वातावरण को देखना, यह समझना कि क्या संभव है (अफोर्डेंस), और कार्य को अपने आप निष्पादित करना सीखता है।

शोध पत्र विशेष रूप से उल्लेख करता है कि यह ग्रहीय अन्वेषण (जैसे मंगल ग्रह की खोज) और खोज एवं बचाव (search and rescue) के लिए उपयोगी हो सकता है, जहाँ रोबोटों को खतरनाक स्थानों में काम करने की आवश्यकता होती है जहाँ मनुष्य नहीं जा सकते और जहाँ संचार (communication) रोबोट को रिमोटली नियंत्रित करने के लिए बहुत धीमा होता है। रोबोट को इतना स्मार्ट होने की आवश्यकता है कि वह अपने दम पर अपने वातावरण के साथ बातचीत करने का तरीका ढूंढ सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →