← नवीनतम पेपर
💻 computer science

One Demonstration Is Enough for Real-World Robotic Reinforcement Learning

यह शोध पत्र AutoSERL को प्रस्तुत करता है, जो स्लाइडिंग विंडो मार्गदर्शन, सुरक्षा रिकवरी और स्वचालित समाप्ति तंत्र को एकीकृत करके एक एकल प्रदर्शन (demonstration) का उपयोग करके वास्तविक दुनिया के रोबोटिक सुदृढीकरण शिक्षण (reinforcement learning) को स्वचालित करता है, जिससे मौजूदा बेसलाइन की तुलना में विविध संपर्क-गहन कार्यों में बेहतर प्रदर्शन और मजबूती प्राप्त होती है।

मूल लेखक: Yuwan Liu, Hongze Yu, Song Liu, Yuhan Wang, Junge Zhang, Yaodong Yang, Yuanpei Chen, Ceyao Zhang

प्रकाशित 2026-09-01
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuwan Liu, Hongze Yu, Song Liu, Yuhan Wang, Junge Zhang, Yaodong Yang, Yuanpei Chen, Ceyao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

वास्तविक दुनिया में एक रोबोट को नाजुक शारीरिक कार्य करने के लिए सिखाना एक अत्यंत कठिन प्रयास है। कंप्यूटर प्रोग्रामों के विपरीत जो एक आदर्श डिजिटल शून्य (वैक्यूम) में चलते हैं, भौतिक मशीनों को एक अव्यवस्थित वातावरण में नेविगेट करना होता है जहाँ एक गलत कदम भी किसी हिस्से को तोड़ सकता है, मशीन को नुकसान पहुँचा सकता है, या उसे बस फँसा सकता है। इन खामियों से बचने के लिए सीखना, रोबोट पारंपरिक रूप से सुदृढीकरण शिक्षण (reinforcement learning) पर भरोसा करते हैं, जो एक प्रयास-और-त्रुटि (trial-and-error) की प्रक्रिया है जहाँ मशीन एक क्रिया करने की कोशिश करती है, देखती है कि क्या हुआ, और एक पुरस्कार संकेत (reward signal) के आधार पर अपने व्यवहार को समायोजित करती है। हालाँकि, भौतिक दुनिया में, यह प्रक्रिया धीमी और खतरनाक है। यदि एक रोबोट प्लग को सॉकेट में डालने की कोशिश करता है और विफल हो जाता है, तो वह तंत्र को जाम कर सकता है या सतह को खरोंच सकता है। इसके अलावा, सफलता के लिए "पुरस्कार" अक्सर दुर्लभ होता है; रोबट को गलती से प्लग अंदर करने से पहले हजारों बार प्रयास करना पड़ सकता है, जिससे सीखने की प्रक्रिया अविश्वसनीय रूप से अक्षम हो जाती है। चीजों को तेज करने के लिए, शोधकर्ताओं ने पहले मानव शिक्षकों की ओर रुख किया है, जो रोबोट को कार्य कैसे करना है यह दिखाते हैं या जब वह फंस जाता है तो उसे शारीरिक रूप से निर्देशित करते हैं। लेकिन इस दृष्टिकोण में एक बड़ी खामी है: इसके लिए हर एक प्रशिक्षण सत्र के लिए एक मानव का उपस्थित और सतर्क रहना आवश्यक है, जो थका देने वाला, महंगा और बड़े पैमाने पर संभव नहीं है।

शोधकर्ताओं की एक टीम ने AutoSERL नामक एक नई प्रणाली विकसित की है जो इस समस्या को हल करती है। यह एक एकल प्रदर्शन (demonstration) का उपयोग करके रोबोट को सिखाती है, जिसमें बाद में किसी मानव द्वारा निगरानी करने की आवश्यकता नहीं होती है। यह प्रणाली एक रिकॉर्ड किए गए उदाहरण को लेकर, जिसमें एक मानव सफलतापूर्वक कार्य पूरा करता है, उसे स्वचालित नियमों के एक सेट में बदल देती है जो रोबोट के सीखने के मार्गदर्शन के लिए होते हैं। शोधकर्ताओं ने इसका परीक्षण छह अलग-अलग कठिन कार्यों पर किया, जैसे प्लग डालना, हुक पर वस्तुएं लटकाना और दराज खींचना। हर मामले में, रोबोट ने केवल उस एक प्रारंभिक उदाहरण का उपयोग करके कार्य को पूरी तरह से करना सीख लिया, और अंततः उन प्रणालियों से बेहतर प्रदर्शन किया जिन्हें बीस उदाहरणों के साथ प्रशिक्षित किया गया था या जो निरंतर मानव पर्यवेक्षण पर निर्भर थीं। मुख्य नवाचार यह है कि रोबोट यह पहचानना सीख जाता है कि वह कब सही रास्ते से भटक रहा है या फंस रहा है, और वह एकल प्रदर्शन को वापस देखकर खुद को स्वचालित रूप से ठीक करता है, जो प्रभावी रूप से एक मानव शिक्षक की आवश्यकता को प्रतिस्थापित कर देता है।

मुख्य चुनौती जिसे शोधकर्ताओं ने संबोधित किया वह यह थी कि एक मानव को लगातार देखते हुए रखे बिना रोबोट को सुरक्षित और सही पथ पर कैसे रखा जाए। पिछले तरीकों में, जब रोबोट कोई गलती करता था तो एक मानव हस्तक्षेप करता था, उसे शारीरिक रूप से वापस एक सुरक्षित स्थिति में ले जाता था या लक्ष्य की ओर निर्देशित करता था। यह "ह्यूमन-इन-द-लूप" दृष्टिकोण अच्छा काम करता था लेकिन दीर्घकालिक प्रशिक्षण के लिए व्यावहारिक नहीं था। नया सिस्टम, AutoSERm, इस हस्तक्षेप प्रक्रिया को स्वचालित करता है। यह एक एकल प्रदर्शन प्रक्षेपवक्र (trajectory) के साथ शुरू होता है, जो केवल एक रिकॉर्डिंग है जिसमें रोबोट का हाथ कार्य के प्रारंभ से अंत तक घूमता है। इस एक रिकॉर्डिंग से, सिस्टम रोबोट को मार्गदर्शन देने के लिए तीन विशिष्ट तंत्र निकालता है।

पहला तंत्र एक 'स्लाइडिंग विंडो' है जो एक चलते हुए गाइड रेल की तरह कार्य करता है। जैसे ही रोबोट कार्य करने का प्रयास करता है, सिस्टम लगातार रोबोट की वर्तमान स्थिति की तुलना एकल प्रदर्शन में दिखाए गए पथ से करता है। यदि रोबोट सही पथ से बहुत दूर भटक जाता है, तो सिस्टम उसे धीरे से प्रदर्शन रेखा के निकटतम बिंदु की ओर धकेलता है। महत्वपूर्ण बात यह है कि यह गाइड केवल रोबोट को पथ पर आगे खींचता है; यह इसे कभी भी पीछे उस स्थान पर नहीं खींचता जहाँ से यह पहले ही जा चुका है। यह रोबोट को एक लूप में फंसने या एक ही स्थान पर बार-बार इधर-उधर होने से रोकता है, जो एक सामान्य विफलता मोड है जब रोबट अकेले कठिन कार्य सीखने की कोशिश करते हैं। क्योंकि मूल प्रदर्शन सुरक्षित रूप से रिकॉर्ड किया गया था, इसलिए उसके पथ का पालन करने से यह भी सुनिश्चित होता है कि रोबोट वातावरण में बाधाओं से टकराने से बच जाए।

दूसरा तंत्र उन स्थितियों को संभालता है जब रोबोट शारीरिक रूप से फंस जाता है, शायद इसलिए क्योंकि कोई हिस्सा जाम हो गया है या रोबोट ने किसी वस्तु को अजीब कोण पर पकड़ा हुआ है। सिस्टम रोबोट की प्रगति की निगरानी करता है और पता लगा सकता है कि क्या वह रुक गया है या किसी वस्तु के साथ संघर्ष कर रहा है। ऐसा होने पर, सिस्टम स्वचालित रूप से रोबोट को मूल प्रदर्शन में परिभाषित एक विशिष्ट, सुरक्षित रिकवरी पॉइंट (पुनर्प्राप्ति बिंदु) पर वापस ले जाता है। वहां से, यह प्रदर्शन के उस हिस्से को फिर से चलाता है जो दिखाता है कि उस सुरक्षित बिंदु से कार्य के अगले चरण तक सफलतापूर्वक कैसे आगे बढ़ना है। यह रोबलेट को किसी मानव के नोटिस करने और हस्तक्षेप करने की प्रतीक्षा किए बिना, तुरंत डेडलॉक (गतिरोध) से उबरने की अनुमति देता है।

तीसरा तंत्र यह जानने का नियम है कि मदद करना कब बंद करना है। प्रशिक्षण का लक्ष्य यह है कि रोबोट अंततः कार्य को अपने आप सीख ले, इसलिए सिस्टम को मार्गदर्शन बंद करने के लिए डिज़ाइन किया गया है जब रोबोट पर्याप्त रूप से सीख लेता है। सिस्टम गिनता है कि उसे एक प्रशिक्षण सत्र के दौरान कितनी बार हस्तक्षेप करना पड़ा। यदि रोबोट बहुत कम हस्तक्षेपों के साथ कार्य को सफलतापूर्वक पूरा करता है, तो सिस्टम मान लेता है कि रोबोट ने कौशल सीख लिया है और आगे का सारा मार्गदर्शन बंद कर देता है। यह रोबोट को प्रदर्शन के बंधनों के बिना अपने स्वयं के आंदोलनों को खोजने और परिष्कृत करने की अनुमति देता है, जिससे यह सुनिश्चित होता है कि वह एक मजबूत और स्वतंत्र नीति विकसित करे।

शोधकर्ताओं ने दो अलग-अलग रोबोट भुजाओं पर छह विशिष्ट कार्यों के लिए इस ढांचे का परीक्षण किया। इन कार्यों को इसलिए चुना गया क्योंकि इनके लिए सटीक भौतिक संपर्क की आवश्यकता होती है और इनमें गलती की गुंजाइश बहुत कम होती है। कार्यों में प्लग को सॉकेट में डालना, USB ड्राइव लगाना, करेक्शन टेप डिस्पेंसर, हैंगर और चम्मच को हुक पर लटकाना, और हुक के साथ दराज खींचना शामिल था। इंसर्शन (डालने वाले) कार्यों में, AutoSERL के साथ केवल एक प्रदर्शन के साथ प्रशिक्षित रोबोट ने 100 प्रतिशत सफलता दर प्राप्त की। अन्य विधियों की तुलना में, परिणाम स्पष्ट थे। बीस प्रदर्शनों के साथ प्रशिक्षित एक प्रणाली समान समय में सफलता के उसी स्तर तक नहीं पहुँच सकी। एक प्रणाली जिसने केवल मानव की गतिविधियों की नकल की बिना कुछ सीखे, वह स्थिति में छोटे बदलावों के अनुकूल होने में विफल रही। यहाँ तक कि एक प्रणाली जो रोबोट के फंसने पर मानव के हस्तक्षेप पर निर्भर थी, वह भी या तो सीखने में अधिक समय लेती थी या तुलनीय परिणाम प्राप्त करने के लिए समान समय की आवश्यकता थी।

अध्ययन ने यह भी देखा कि रोबोट वातावरण में परिवर्तनों को कितनी अच्छी तरह संभाल सकता है। एक परीक्षण में, शोधकर्ताओं ने उस वस्तु की शुरुआती स्थिति को कुछ सेंटीमीटर खिसका दिया जिसे रोबोट को प्लग करना था। इस परिवर्तन के बावजूद, AutoSERL के साथ प्रशिक्षित रोबोट, बिना स्वचालित मार्गदर्शन के प्रशिक्षित रोबोट की तुलना में तेजी से और अधिक सफलतापूर्वक सीख गया। यह सुझाव देता है कि सिस्टम केवल उस सटीक पथ को याद नहीं करता है जो मानव ने लिया था; यह कार्य के अंतर्निहित तर्क को सीखता है और नए शुरुआती बिंदुओं के अनुकूल हो सकता है। शोधकर्ताओं ने यह भी पाया कि सिस्टम विभिन्न यादृच्छिक (random) शुरुआती स्थितियों में भी मजबूत था, और प्रशिक्षण की शुरुआत कैसे भी की गई हो, लगातार उच्च सफलता दर प्राप्त करता रहा।

परिणाम प्रभावशाली होने के बावजूद, शोधकर्ता स्वीकार करते हैं कि इस प्रणाली की सीमाएँ हैं। रिकवरी तंत्र उस एकल प्रदर्शन में निहित जानकारी पर निर्भर करता है। यदि रोबोट ऐसी विफलता का सामना करता है जो मूल रिकॉर्डिंग में कभी नहीं दिखाई गई थी, तो सिस्टम को यह नहीं पता होगा कि कैसे उबरना है। उदाहरण के लिए, यदि रोबोट इस तरह फंस जाता है जो मूल कार्य से पूरी तरह अलग है, तो स्वचालित गाइड के पास समाधान नहीं हो सकता है। शोधकर्ता सुझाव देते हैं कि भविष्य के कार्यों में अधिक मजबूत रिकवरी सिस्टम बनाने के लिए कई प्रदर्शनों का उपयोग किया जा सकता है जो गलतियों की एक विस्तृत श्रृंखला को संभाल सके। इसके अतिरिक्त, वर्तमान प्रणाली उन कार्यों के लिए डिज़ाइन की गई है जहाँ रोबोट अपने हाथ को छह दिशाओं की स्वतंत्रता (six directions of freedom) में घुमाता है, और यह अभी स्पष्ट नहीं है कि यह कई चलते हुए हिस्सों वाले अधिक जटिल कार्यों के लिए कितनी अच्छी तरह काम करेगी।

इन सीमाओं के बावजूद, निष्कर्ष रोबोटिक लर्निंग को व्यावहारिक बनाने की दिशा में एक महत्वपूर्ण कदम का प्रतिनिधित्व करते हैं। एक मानव शिक्षक की आवश्यकता को एक स्मार्ट, स्वचालित प्रणाली से बदलकर, जो एक एकल उदाहरण से सीखती है, शोधकर्ताओं ने दिखाया है कि रोबोट को कठिन भौतिक कार्य कुशलतापूर्वक और सुरक्षित रूप से सिखाया जा सकता है। सिस्टम ने मानव मार्गदर्शन की सुरक्षा और रोबोट की स्वतंत्रता के बीच के अंतर को सफलतापूर्वक पाट दिया है। परीक्षण किए गए छह कार्यों में, स्वचालित दृष्टिकोण न केवल मानव-पर्यवेक्षित प्रशिक्षण के प्रदर्शन के बराबर था, बल्कि अक्सर अन्य स्वचालित बेसलाइन से बेहतर भी रहा, जो यह सिद्ध करता है कि एक एकल, सुव्यवस्थित प्रदर्शन वास्तविक दुनिया के रोबोटिक लर्निंग की क्षमता को अनलॉक करने के लिए पर्याप्त है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →