Latent Policy Barrier: Learning Robust Visuomotor Policies by Staying In-Distribution
यह शोध पत्र लेटेंट पॉलिसी बैरियर (LPB) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो विशेषज्ञ अनुकरण (expert imitation) को आउट-ऑफ-डिस्ट्रीब्यूशन रिकवरी से अलग करके विज़ुओमोटर पॉलिसियों की मजबूती और डेटा दक्षता को बढ़ाता है, जिसमें एक डायनेमिक्स मॉडल का उपयोग करके लेटेंट अवस्थाओं को अनुकूलित किया जाता है और उन्हें बिना किसी अतिरिक्त मानवीय सुधार के विशेषज्ञ प्रदर्शनों के सुरक्षित वितरण के भीतर रखा जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कोई नाजुक काम करना सिखा रहे हैं, जैसे कपों को एक के ऊपर एक रखना या बेल्ट में धागा पिरोना, एक मानव विशेषज्ञ द्वारा इसे पूरी तरह से करने के वीडियो दिखाकर। इसे "बिहेवियर क्लोनिंग" (Behavior Cloning) कहा जाता है। रोबोट वीडियो देखता है और उसके मूव्स की नकल करने की कोशिश करता है।
समस्या यह है कि रोबोट थोड़े अनाड़ी होते हैं। यदि रोबोट एक छोटी सी गलती करता है—मान लीजिए उसने कप को सिर्फ एक अंश (fraction) डिग्री ज्यादा झुका दिया—तो वह उसे सुधारने की कोशिश कर सकता है। लेकिन क्योंकि वह पहले से ही थोड़ा गलत है, उसका सुधार भी गलत हो सकता है, जिससे गलती और बड़ी हो जाती है। जल्द ही, रोबोट ऐसी स्थिति में पहुँच जाता है जो विशेषज्ञ ने उसे वीडियो में नहीं दिखाई थी। वह "अनछुए क्षेत्र" (जिसे पेपर में आउट-ऑफ-डिस्ट्रीब्यूशन या OOD स्टेट्स कहा गया है) में खो जाता है, और आमतौर पर क्रैश हो जाता है या विफल हो जाता है।
पुराना तरीका: "मदद मांगना"
पारंपरिक रूप से, इसे ठीक करने के लिए, शोधकर्ता एक इंसान को रोबोट को देखते रहने के लिए कहते थे। जब रोबोट अपने रास्ते से भटकने लगता है, तो इंसान बीच में आता है, रोबोट का हाथ पकड़ता है, और उसे वापस सही रास्ते पर ले जाता है। रोबोट फिर इन "सुधार" वाले वीडियोों से सीखता है।
- नुकसान: यह इंसानों के लिए थका देने वाला है। यह एक ड्राइविंग इंस्ट्रक्टर की तरह है जो लगातार स्टीयरिंग व्हील को पकड़ता रहता है। साथ ही, इंसान के सुधार भी एकदम सही नहीं हो सकते, जिससे रोबोट को बुरी आदतें सीखने को मिल सकती हैं।
नया तरीका: "अदृश्य सुरक्षा जाल" (लेटेंट पॉलिसी बैरियर)
स्टैनफोर्ड के इस पेपर के लेखकों ने एक स्मार्ट, आत्म-सुधार प्रणाली प्रस्तावित की है जिसे लेटेंट पॉलिसी बैरियर (LPB) कहा जाता है। उन्हें इसमें किसी इंसान के लगातार हस्तक्षेप की आवश्यकता नहीं है। इसके बजाय, वे रोबोट को एक आंतरिक "सुरक्षा जाल" देते हैं जो उसके अपने व्यवहार के लिए एक GPS की तरह काम करता है।
यह कैसे काम करता है, यहाँ एक सरल उपमा (analogy) दी गई है:
1. "एक्सपर्ट मैप" (द बैरियर)
कल्पना कीजिए कि विशेषज्ञ की सटीक गतिविधियाँ एक मानचित्र (map) पर एक सुरक्षित, चमकते हुए पथ के रूप में खींची गई हैं। रोबोट का लक्ष्य इसी पथ पर रहना है।
- नवाचार: हर एक मोड़ को याद करने के बजाय, रोब lewat यह पहचानना सीखता है कि सुरक्षित पथ का "आकार" कैसा है। यदि रोबोट को महसूस होता है कि वह चमकते हुए पथ से कदम बाहर रख रहा है, तो वह जानता है कि वह खतरे में है।
2. दो दिमाग, एक लक्ष्य
यह प्रणाली रोबोट के "दिमाग" को दो भागों में विभाजित करती है:
- इमिटेटर (बेस पॉलिसी): यह हिस्सा केवल विशेषज्ञ के परफेक्ट वीडियो पर प्रशिक्षित किया जाता है। इसका काम एक शुद्ध, उच्च गुणवत्ता वाला नकलची होना है। इसे गलतियों की चिंता नहीं होती; यह बस वही करने की कोशिश करता है जो विशेषज्ञ ने किया था।
- प्रेडिक्टर (डायनेमिक्स मॉडल): यह "सुरक्षा जाल" है। इसे परफेक्ट वीडियो और हजारों "प्रैक्टिस रन" के मिश्रण पर प्रशिक्षित किया जाता है, जहाँ रोबोट को गलतियाँ करने और अन्वेषण (explore) करने की अनुमति दी गई थी। यह मॉडल सीखता है: "यदि मैं यह क्रिया करता हूँ, तो मैं कहाँ पहुँच जाऊँगा?"
3. "लुक-अहेड" सुधार (The "Look-Ahead" Correction)
जब रोबोट वास्तव में कार्य कर रहा होता है (इन्फरेंस टाइम), तो यहाँ क्या होता है:
- इमिटेटर एक मूव का सुझाव देता है।
- प्रेडिक्टर तुरंत भविष्य का सिम्युलेशन करता है: "यदि हम ऐसा करते हैं, तो कुछ सेकंड में रोबटना कहाँ होगा?"
- सिस्टम जाँचता है: "क्या वह भविष्य का स्थान अभी भी चमकते हुए विशेषज्ञ पथ पर है?"
- यदि हाँ: बहुत अच्छा, वह मूव करें।
- यदि नहीं: रोबोट मानचित्र से भटक रहा है! सिस्टम गणित (gradients) का उपयोग करके इमिटेटर के सुझाव को सुरक्षित पथ की ओर वापस धकेलने के लिए धीरे से गाइड करता है, इससे पहले कि रोबोट वास्तव में हिलता है।
यह एक GPS की तरह है जो न केवल आपको बताता है कि "आपने मोड़ छोड़ दिया," बल्कि वास्तव में कार को सड़क पर वापस लाने के लिए स्टीयर करता है, इससे पहले कि आपको पता भी चले कि आपने रास्ता छोड़ दिया है।
यह क्यों शानदार है?
- कोई मानवीय देखरेख नहीं: रोबोट बिना किसी इंसान के नियंत्रण पकड़े अपनी गलतियों को खुद ठीक करता है।
- सस्ता डेटा: "प्रेडिक्टर" दिमाग, रोबोट के अपने अस्त-व्यस्त अभ्यास सत्रों से सीखता है। इसे हर एक त्रुटि के लिए महंगे, परफेक्ट मानवीय सुधारों की आवश्यकता नहीं होती।
- पुराने रोबोटों के साथ भी काम करता है: आप एक ऐसे रोबोट को ले सकते हैं जिसे पहले से ही किसी और ने प्रशिक्षित किया है और इसे बहुत अधिक पुन: प्रशिक्षण (retraining) के बिना अधिक विश्वसनीय बनाने के लिए इसमें यह "सुरक्षा जाल" लगा सकते हैं।
परिणाम
टीम ने सिमुलेशन और वास्तविक रोबोटों (जैसे कपों को स्टैक करना और बेल्ट जोड़ना) पर इसका परीक्षण किया।
- लैब में: जब उन्होंने रोबोट को बहुत कम विशेषज्ञ वीडियो दिए (सामान्य मात्रा का केवल 20%), तब भी LPB अन्य तरीकों की तुलना में कार्य को बेहतर ढंग से सीख गया।
- दबाव के तहत: जब उन्होंने रोबोट की गतिविधियों में रैंडम "नॉइज़" या झटके जोड़े, तो LPB काम करता रहा जबकि अन्य रोबोट विफल हो गए।
- वास्तविक दुनिया में: एक वास्तविक रोबोट पर, जब रोबोट एक ऐसी अजीब स्थिति में शुरू हुआ जिसे उसने पहले कभी नहीं देखा था, तो LPB ने काम पूरा करने के लिए कैमरा और हाथ को वापस एक "सुरक्षित" दृश्य में लाने का तरीका ढूंढ लिया। मानक रोबोट वहीं फंस गया।
सारांश
यह पेपर एक तरीका पेश करता है जिससे चीजों को करने के "विशेषज्ञ तरीके" के चारों ओर एक अदृश्य बाधा बनाकर रोबोट लर्निंग को मजबूत बनाया जा सके। भविष्य की भविष्यवाणी करने और रोबोट को धीरे से सुरक्षा की ओर वापस लाने के लिए दूसरे AI मॉडल का उपयोग करके, रोबोट सीमित डेटा से सीख सकता है और बिना किसी इंसान के हाथ थामे अपनी गलतियों से उबर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।