← नवीनतम पेपर
🤖 machine learning

SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions

SafeExplorer भौतिक रोबोटों पर सुदृढीकरण सीखने (reinforcement learning) के लिए एक निष्पक्ष पॉलिसी ग्रेडिएंट पद्धति पेश करता है जो नियत रिकवरी हस्तक्षेपों (deterministic recovery interventions) से होने वाले पूर्वाग्रह को समाप्त करता है, जिससे मानक PPO की तुलना में अंतिम प्रदर्शन को बनाए रखते हुए या उसमें सुधार करते हुए प्रशिक्षण के समय गिरने की घटनाओं को काफी कम कर दिया जाता है।

मूल लेखक: Elham Daneshmand, Majid Khadiv, Glen Berseth, Hsiu-Chin Lin

प्रकाशित 2026-07-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Elham Daneshmand, Majid Khadiv, Glen Berseth, Hsiu-Chin Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कुत्ते को दौड़ना सिखा रहे हैं। आप चाहते हैं कि वह करके सीखे, लेकिन एक समस्या है: यदि वह वास्तविक दुनिया में गिर जाता है, तो उसके पैर टूट सकते हैं या वह दीवार से टकरा सकता है। आप वीडियो गेम की तरह बस "रीसेट" बटन नहीं दबा सकते। हर बार गिरने की एक कीमत (पैसा और समय) चुकानी पड़ती है।

रोबोट को टूटने से बचाने के लिए, आप एक "सेफ्टी कोच" (सुरक्षा प्रशिक्षक) को काम पर रखते हैं। यह कोच रोबोट को दौड़ते हुए देखता है। जैसे ही रोबोट डगमगाता है या सुरक्षित क्षेत्र से बाहर जाने लगता है, कोच नियंत्रण संभाल लेता है, उसे वापस पैरों पर खड़ा होने में मदद करता है, और उसे फिर से प्रयास करने देता है। यह रोबोट को क्रैश होने से बचाता है, लेकिन यह सीखने वाले एल्गोरिदम (learning algorithm) के लिए एक छिपी हुई समस्या पैदा कर देता है।

समस्या: "घोस्ट" टीचर (परछाईं शिक्षक)
रोबोट का दिमाग (AI) यह सोचता है कि वह अपनी गलतियों से सीख रहा है। लेकिन क्योंकि सेफ्टी कोच अक्सर बीच में दखल देता है, रोबोट वास्तव में अपने स्वयं के कार्यों और कोच के कार्यों के मिश्रण से सीख रहा होता है। यह वैसा ही है जैसे कोई छात्र गणित सीखने की कोशिश कर रहा हो, लेकिन शिक्षक हर बार उत्तर बताने के लिए फुसफुसाता रहता है जब भी छात्र अटक जाता है। यदि छात्र बाद में खुद से समस्या हल करने की कोशिश करता है, तो वह भ्रमित हो सकता है क्योंकि उसने वास्तव में कठिन हिस्सों का अभ्यास कभी किया ही नहीं।

इससे भी बुरा यह है कि यदि सेफ्टी कोच एक कठोर, नियम-आधारित प्रणाली है (जैसे कि एक कंप्यूटर प्रोग्राम जो हमेशा गिरने को ठीक करने के लिए बिल्कुल एक जैसा काम करता है), तो इस भ्रम को ठीक करने के लिए इस्तेमाल किए जाने वाले मानक गणितीय तरीके विफल हो जाते हैं। वे शून्य से भाग देने (divide by zero) की कोशिश करते हैं, जो गणित में वर्जित है।

समाधान: SafeExplorer
शोधकर्ताओं ने एक नई सीखने की विधि बनाई जिसे SafeExplorer कहा जाता है। इसे एक बहुत ही स्मार्ट छात्र के रूप में समझें जो जानता है कि पढ़ाई के समय कोच की फुसफुसाहट को कैसे नजरअंदाज करना है।

यह इस प्रकार काम करता है, तीन चतुर तरीकों के माध्यम से:

  1. "मास्क्ड" स्कोरकार्ड (Masked Scorecard):
    आमतौर पर, जब रोबोट सीखता है, तो वह अपने द्वारा उठाए गए हर कदम को देखता है। SafeExplorer उन कदमों पर एक "मास्क" लगा देता है जहाँ सेफ्टी कोच ने नियंत्रण लिया था। यह कहता है, "हम केवल उन्हीं कदमों से सीखेंगे जो तुमने लिए थे।" यह सुधार की गणना करते समय कोच के कार्यों को पूरी तरह से अनदेखा कर देता है। यह बिना यह जाने कि कोच कैसे सोचता है, इस समस्या को ठीक करता है, भले ही कोच एक कठोर रोबोट हो जिसके पास यह बताने की "संभावना" (probability) न हो कि वह आगे क्या करेगा।

  2. गिरने के लिए "क्रिस्टल बॉल" (The "Crystal Ball" for Falls):
    जब रोबोट सुरक्षित क्षेत्र में होता है, तो उसे अनुमान लगाना होता है कि आगे क्या होगा। लेकिन जब सेफ्टी कोच हस्तक्षेप करता है, तो वह रास्ता अक्सर अनुमानित होता है (विशेष रूप से यदि कोच एक कठोर प्रोग्राम है)। SafeExplorer एक "क्रिस्टल बॉल" (एक क्लोज्ड-फॉर्म गणितीय सूत्र) का उपयोग करता है ताकि उन कोच-निर्देशित क्षणों के दौरान सटीक इनाम (reward) को जान सके। उसे उन विशिष्ट चरणों के लिए अनुमान लगाने या परीक्षण और त्रुटि (trial and error) से सीखने की आवश्यकता नहीं है। वह बस उत्तर जानता है, जिससे सीखना बहुत तेज़ हो जाता है।

  3. "सफलता-आधारित" नकल (The "Success-Only" Copycat):
    कभी-कभी सेफ्टी कोच गिरने को रोकने की कोशिश करता है लेकिन विफल हो जाता है, और रोबोट फिर भी क्रैश हो जाता है। SafeExplorer का एक नियम है: "कोच की नकल तभी करो जब उसने वास्तव में स्थिति को संभाला हो।" यदि कोच डगमगाहट को ठीक करने की कोशिश करता है और रोबोट फिर भी गिर जाता है, तो रोबोट उस प्रयास को अनदेखा कर देता है। वह केवल कोच की सफल बचतों से सीखता है। यह रोबोट को एक ऐसे कोच से बुरी आदतें सीखने से रोकता है जो पूर्ण (perfect) नहीं है।

परिणाम: कम गिरना, बेहतर दौड़ना
टीम ने तीन अलग-अलग रोबोट परिदृश्यों पर इसका परीक्षण किया: एक तेज़ चीते जैसा रोबोट, एक चार पैरों वाला चींटी जैसा रोबोट, और एक वास्तविक दुनिया का क्वाड्रुपेड रोबोट जिसे Unitree Go1 कहा जाता है।

  • चीते पर: SafeExplorer ने मानक विधि की तुलना में प्रशिक्षण के दौरान गिरने की संख्या को 233 गुना कम कर दिया।
  • चींटी पर: इसने गिरने की संख्या को 48 गुना कम कर दिया।
  • Go1 पर: इसने गिरने की संख्या को 26 गुना कम कर दिया।

हर मामले में, रोबोट ने पुराने तरीकों की तरह ही (या उससे बेहतर) दौड़ना सीख लिया, लेकिन उसने बहुत कम क्रैश के साथ यह उपलब्धि हासिल की।

"अविश्वसनीय कोच" का परीक्षण
सबसे प्रभावशाली हिस्सा "चींटी" वाले रोबोट के साथ हुआ। इस परिदृश्य में, सेफ्टी कोच अपने काम में काफी बुरा था—वह अक्सर रोबोट को बचाने में विफल रहता था। मानक तरीके जो कोच पर निर्भर थे, पूरी तरह विफल रहे और हजारों बार क्रैश हुए। हालाँकि, SafeExplorer ही एकमात्र तरीका था जो सफल रहा। क्योंकि यह केवल कोच की सफलता की नकल करता था, इसने उन स्थितियों से बचना सीख लिया जहाँ कोच विफल होने वाला था, और अंततः बिना कोच की मदद के खुद दौड़ना सीख लिया।

इसका क्या अर्थ है
यह कोई जादुई छड़ी नहीं है जो रोबोट को कभी गिरने नहीं देती। यह उन्हें प्रशिक्षित करने का एक स्मार्ट तरीका है ताकि वे सीखते समय कम गिरें। शोधकर्ताओं ने दिखाया है कि यह साबित करने के लिए कि नियंत्रण किसका है (रोबोट का या कोच का), ईमानदार होना और केवल सफल बचावों से सीखना, वास्तविक हार्डवेयर पर रोबोट को बिना तोड़े प्रशिक्षित किया जा सकता है।

यह शोध गणितीय रूप से सिद्ध करता है कि यह विधि निष्पक्ष (unbiased) है (यह रोबोट को धोखा नहीं देती है) और सिमुलेशन के माध्यम से दिखाता है कि यह अविश्वसनीय रूप से अच्छा काम करती है। यह सुझाव देता है कि जिन रोबोट्स को वास्तविक हार्डवेयर पर सीखने की आवश्यकता है, उनके लिए सुरक्षा हस्तक्षेपों के "शोर" (noise) को अनदेखा करना सुरक्षित रहने और तेजी से सीखने की कुंजी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →