← नवीनतम पेपर
💻 computer science

Practice Makes Policies: Bootstrapping and Consolidating Robotic Capabilities from Zero Human Demonstrations

यह शोध पत्र HERO को प्रस्तुत करता है, जो एक स्व-सुधार करने वाला पदानुक्रमित एम्बोडीड एजेंट (hierarchical embodied agent) है, जो ह्यूरिस्टिक रीजनिंग (heuristic reasoning), उदाहरण पुन: उपयोग (exemplar reuse) और रिफ्लेक्सिव निष्पादन (reflexive execution) को व्यवस्थित करके शून्य मानव प्रदर्शनों से कुशल क्लोज्ड-लूप नीतियों में रोबोटिक हेरफेर क्षमताओं को स्वायत्त रूप से बूटस्ट्रैप और समेकित करता है।

मूल लेखक: Jialiang Li, Yuhan Wang, Haojun Li, Gaojing Zhang, Yangtian Ye, Qipeng Liu, Haotian Liang, Wenzhao Lian

प्रकाशित 2026-07-30
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jialiang Li, Yuhan Wang, Haojun Li, Gaojing Zhang, Yangtian Ye, Qipeng Liu, Haotian Liang, Wenzhao Lian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट केवल एक मानव प्रोग्रामर द्वारा लिखे गए सख्त स्क्रिप्ट का पालन नहीं करते, बल्कि वास्तव में हमारी तरह चलना और सोचना भी सीखते हैं। यह "एम्बोडीड एआई" (embodied AI) का सपना है—एक कंप्यूटर को शरीर देना ताकि वह वास्तविक दुनिया के साथ अंतःक्रिया कर सके। अभी, किसी रोबोट को कुछ नया करना सिखाना आमतौर पर एक छोटे बच्चे को उनके जूते के फीते बांधना सिखाने जैसा लगता है: आपको उनका हाथ पकड़ना पड़ता है, उन्हें ठीक से दिखाना पड़ता है कि क्या करना है, और इसे सैकड़ों बार दोहराना पड़ता है जब तक कि उनकी मांसपेशियों को वह गति "याद" न हो जाए। इसे 'ह्यूमन डेमोंस्ट्रेशन' (मानव प्रदर्शन) से सीखना कहा जाता है। लेकिन क्या होगा अगर एक रोबोट अपने आप सीख सके? क्या होगा अगर वह बिना आपके उंगली उठाए रास्ता दिखाए, केवल दुनिया को देखकर और चीजें आजमाकर यह समझ सके कि कप कैसे पकड़ना है, बॉक्स को कैसे धकेलना है, या दराज कैसे खोलनी है? यह वह बड़ा सवाल है जिसका शोधकर्ता पीछा कर रहे हैं: हम रोबोट को शून्य से अपना खुद का "मसल मेमोरी" (मांसपेशियों की स्मृति) बनाने के लिए कैसे प्रेरित करें?

यहाँ HERO आता है, एक नया रोबोट मस्तिष्क जो एक स्व-शिक्षित प्रशिक्षु (apprentice) की तरह कार्य करता है। यह पेपर HERO को एक ऐसे सिस्टम के रूप में पेश करता है जो शून्य मानवीय सहायता के साथ शुरू होता है और एक चतुर तीन-चरणीय विकास के माध्यम से वस्तुओं को नियंत्रित करना सीखता है। इसे एक रोबोट के तीन अलग-अलग चरणों में बड़े होने के रूप में सोचें। सबसे पहले, यह "ह्यूरिस्टिक रीजनिंग" (Heuristic Reasoning) का उपयोग करता है, जो एक स्मार्ट अनुमान लगाने वाले की तरह है जो किसी ऐसे कार्य को करने के लिए ज्ञान के एक विशाल पुस्तकालय का उपयोग करता है जिसे उसने पहले कभी नहीं देखा है। यदि यह विफल हो जाता है या धीमा हो जाता है, तो यह "एग्ज़ेम्पलर रियूज़" (Exemplar Reuse) की ओर बढ़ता है, जो एक ऐसी याद रखने जैसा है कि इसने सफलतापूर्वक एक समान वस्तु को कब हिलाया था और बस उस गति की नकल करता है, जिसे नई स्थिति के अनुसार समायोजित किया गया है। अंत में, पर्याप्त अभ्यास करने के बाद, यह "रिफ्लेक्सिव एक्जीक्यूशन" (Reflexive Execution) विकसित करता है, जो शुद्ध मसल मेमोरी है—एक तेज़, स्वचालित प्रतिक्रिया जिसे हर बार गहराई से सोचने की आवश्यकता नहीं होती है। पेपर दिखाता है कि इन तीन कौशलों को मिलाकर और रोबोट को अपने आप अभ्यास करने देकर, यह ब्लॉक्स को स्टैक करने या दराजों को खोजने जैसे जटिल कार्यों को सीख सकता है, और अंततः इसमें इतना कुशल हो जाता है कि इसे लगभग सोचने की भी आवश्यकता नहीं पड़ती।

पेपर की मूल कहानी: शून्य से मसल मेमोरी तक

HERO के पीछे के शोधकर्ताओं, शंघाई जियाओ टोंग यूनिवर्सिटी और ससेक्स यूनिवर्सिटी की एक टीम ने एक विशिष्ट समस्या को हल करना चाहा: आज के अधिकांश रोबोट एक "स्थिर" (static) मोड में फंसे हुए हैं। वे या तो सामान्य तर्क (क्या करना है इसके बारे में बात करना) में बहुत अच्छे हैं लेकिन वास्तव में हिलने-डुलने में धीमे और अनाड़ी हैं, या वे हिलने-डुलने में बहुत तेज़ हैं लेकिन केवल तभी जब आप उन्हें पहले दिखा दें कि क्या करना है। HERO इस अंतर को पाटने की कोशिश करता है एक ऐसा सिस्टम बनाकर जो अपने कौशल को विकसित करता है।

पेपर इस विचार का खंडन करता है कि रोबोट को सीखने के लिए मानव वीडियो के विशाल डेटाबेस की आवश्यकता है। इसके बजाय, HERO शून्य मानव प्रदर्शन के साथ शुरू होता है। यह अपनी यात्रा "ह्यूरिस्टिक बूटस्ट्रैपर" (लेवल 1) का उपयोग करके शुरू करता है। जब किसी नए कार्य का सामना होता है, जैसे "लाल पैकेज उठाना," तो यह परत एक जासूस की तरह कार्य करती है। यह एक विजन-लैंग्वेज मॉडल (VLM)—एक प्रकार का एआई जो चित्रों और शब्दों को समझता है—का उपयोग करके दृश्य को देखता है, अनुमान लगाता है कि वस्तु को कहाँ से पकड़ना है, और एक पथ की योजना बनाता है। यह पूर्ण नहीं है, और थोड़ा धीमा है, लेकिन यह बिना किसी पूर्व प्रशिक्षण के काम पूरा कर देता है।

एक बार जब रोबोट सफलतापूर्वक कुछ पकड़ लेता है, तो वह उसे भूलता नहीं है। वह उस सफलता को एक "एग्ज़ेम्पलर" (exemplar) के रूप में सहेज लेता है। जैसे-जैसे रोबोट अधिक अभ्यास करता है, वह दूसरे चरण में प्रवेश करता है: "एग्ज़ेम्पलर एक्सेलेरेटर" (लेवल 2)। अब, यदि वह किसी ऐसे कार्य को देखता है जो पहले किए गए कार्य के समान है, तो उसे फिर से अनुमान लगाने की आवश्यकता नहीं होती। वह सहेजे गए उदाहरण को ढूंढता है, उस पुराने मूवमेंट को नए ऑब्जेक्ट के अनुकूल ढालने या घुमाने की गणना करता है, और उसे निष्पादित करता है। यह पिछले सप्ताह एक विशिष्ट जार खोलने के तरीके को याद रखने और उसी आकार के नए जार के लिए उसी कलाई के घुमाव का उपयोग करने जैसा है। यह चरण अनुमान लगाने वाले चरण की तुलना में बहुत तेज़ है।

अंतिम और सबसे प्रभावशाली चरण "रिफ्लेक्सिव पॉलिसी" (लेवल 3) है। सैकड़ों सफल प्रयासों को एकत्र करने के बाद, यह एक विशेष "मसल मेमोरी" मॉडल को प्रशिक्षित करता है। यह मॉडल सोचने और नकल करने के चरणों को पूरी तरह से छोड़ देता है। यह वस्तु और लक्ष्य को देखता है और तुरंत रोबोट के हाथ को सही कमांड भेजता है। यह पेपर में उल्लेखित "क्लोज्ड-लूप" नियंत्रण है, जिसका अर्थ है कि रोबोट लगातार अपनी गति की जांच करता है और वास्तविक समय में समायोजन करता है, ठीक वैसे ही जैसे कोई इंसान भौतिकी (physics) के बारे में सोचे बिना गेंद को पकड़ता है।

वास्तविक दुनिया में यह कैसे काम करता है

इसका परीक्षण करने के लिए, शोधकर्ताओं ने चार कैमरों के साथ एक वास्तविक लैब में फ्रैंका एमिका पांडा रोबोट आर्म सेटअप किया। उन्होंने इसे चार अलग-अलग चुनौतियाँ दीं: अलग-अलग रंगों के पैकेज उठाना, एक विशिष्ट क्रम में ब्लॉक्स को स्टैक करना, छिपे हुए क्रोइसेंट (croissant) को खोजने के लिए दराज खोलना, और छिपे हुए बैंडेज रोल को प्रकट करने के लिए बक्से को हिलाना।

रोबोट ने ये कार्य केवल एक बार नहीं किए; इसने ऑटोनॉमस कैपेबिलिटी इवोल्यूशन (स्वायत्त क्षमता विकास) का एक निरंतर चक्र चलाया। यहाँ जादू भरा लूप है:

  1. प्रयास (Try): रोबट एक कार्य का प्रयास करता है। यदि यह नया है, तो यह "अनुमान लगाने" (L1) मोड का उपयोग करता है।
  2. सहेजना (Save): यदि यह सफल होता है, तो यह उस मूव को सहेज लेता है। यदि यह पहले से देखा गया कार्य है, तो यह तेज़ होने के लिए "नकल करने" (L2) मोड का उपयोग कर सकता है।
  3. रीसेट (Reset): कार्य समाप्त करने के बाद, रोबोट स्वचालित रूप से सब कुछ शुरुआती स्थिति में वापस लाने का तरीका ढूंढ लेता है (एक "रिवर्स टास्क") ताकि वह फिर से प्रयास कर सके। इसने कुल 664 बार ऐसा किया!
  4. सीखना (Learn): एक बार जब इसके पास पर्याप्त डेटा हो गया, तो इसने "मसल मेमोरी" (L3) मॉडल को प्रशिक्षित किया।

परिणाम काफी स्पष्ट थे। पेपर ने पाया कि HERO लगभग बिना किसी मानवीय मदद के इस विशाल मात्रा में डेटा एकत्र कर सकता है—प्रति उप-कार्य केवल 1.03 सेकंड का मानवीय हस्तक्षेप, जो मुख्य रूप से दृश्य को ठीक करने के लिए था यदि रोबोट कहीं अटक गया हो। रोबोट बिना किसी मानवीय स्पर्श के 46 लगातार उप-कार्य चक्र पूरे करने में सफल रहा।

जब उन्होंने अंतिम रोबोट का इन कार्यों पर परीक्षण किया, तो पूर्ण HERO सिस्टम (तीनों परतों का उपयोग करते हुए) ने चार अलग-अलग कार्यों में 86.0% सफलता दर हासिल की। यह केवल एक परत का उपयोग करने की तुलना में काफी बेहतर था। उदाहरण के लिए, यदि वे केवल अनुमान लगाने वाली परत (L1) का उपयोग करते, तो सफलता दर गिरकर 76.0% हो जाती। यदि वे केवल मसल मेमोरी परत (L3) का उपयोग करते, तो यह 70.0% होती। पेपर का सुझाव है कि असली सफलता लचीलेपन में है: जहाँ संभव हो वहाँ तेज़ मसल मेमोरी का उपयोग करना, लेकिन जब चीजें कठिन हो जाएं या रोबोट किसी नई चीज़ का सामना करे, तो "नकल करने" और "अनुमान लगाने" के कौशल तैयार रखना।

ट्रेड-ऑफ और खामियां

पेपर अपनी सीमाओं के बारे में ईमानदार है। "अनुमान लगाने" वाली परत (L1) सबसे धीमी है, जिसमें प्रति उप-कार्य लगभग 46.57 सेकंड लगते हैं क्योंकि इसे बहुत अधिक गहन सोच और 3D मैपिंग करनी पड़ती है। "नकल करने" वाली परत (L2) 20.96 सेकंड में तेज़ है, और "मसल मेमोरी" परत (L3) बार-बार किए जाने वाले कार्यों के लिए सबसे कुशल है, जिसमें 37.90 सेकंड लगते हैं (हालांकि इसमें रोबोट के वास्तव में चलने का समय भी शामिल है, जो एक लंबी प्रक्रिया है)।

उन्होंने यह भी विश्लेषण किया कि चीजें कहाँ गलत हुईं। 120 कार्य प्रयासों में से, 73 बिना किसी त्रुटि के पूरी तरह से संपन्न हुए। जो विफलताएं हुईं वे ज्यादातर रोबोट द्वारा वस्तु के स्थान का गलत अनुमान लगाने (परसेप्शन एरर) या "मस्तिष्क" द्वारा खराब मूव सीक्वेंस की योजना बनाने के कारण हुईं। दिलचस्प बात यह है कि सिस्टम की "मॉनिटरिंग" बहुत अच्छी थी; इसने 94.5% बार सही ढंग से पहचान लिया कि कार्य कब विफल हुआ, जिससे इसे फिर से प्रयास करने या मदद मांगने की अनुमति मिली।

लेखक सुझाव देते हैं कि हालांकि HERO एक बड़ा कदम है, लेकिन यह अभी भी पूर्ण नहीं है। "अनुमान लगाने" वाला हिस्सा अभी भी धीमा हो सकता है, और कभी-कभी वस्तुओं के 3D आकार को गलत पढ़ सकता है। इसके अलावा, रोबोट वर्तमान में बुनियादी मूव्स (जैसे "पकड़ना", "धकेलना", "खींचना") की एक पूर्व-निर्धारित सूची पर निर्भर करता है जिन्हें मनुष्यों ने ही डिजाइन किया था। यह अभी अपने आप पूरी तरह से नए प्रकार के मूव्स का आविष्कार नहीं कर सकता।

निष्कर्ष

सरल शब्दों में, HERO यह सिद्ध करता है कि एक रोबोट खाली स्लेट के साथ शुरू कर सकता है, करके सीख सकता है, और अंततः अपने आप "मसल मेमोरी" विकसित कर सकता है, बिना हर कदम पर किसी इंसान का हाथ पकड़े। यह सुझाव देता है कि रोबक्शन का भविष्य केवल स्मार्ट दिमाग या मजबूत भुजाएं बनाने के बारे में नहीं है, बल्कि ऐसे सिस्टम बनाने के बारे में है जो अनुभव प्राप्त करने के साथ सहजता से सोचने, नकल करने और प्रतिक्रिया करने के बीच स्विच कर सकें। पेपर यह दावा नहीं करता है कि इसने रोबोट की सभी समस्याओं को हल कर दिया है, लेकिन यह मशीनों के लिए एक आशाजनक मार्ग प्रदान करता है जो वास्तव में हमारी अव्यवस्थपूर्ण, अप्रत्याशित दुनिया में सीख और अनुकूलित हो सकती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →