← नवीनतम पेपर
🤖 AI

Safe Exploration via Policy Priors

यह शोध पत्र SOOPER को प्रस्तुत करता है, जो एक सुरक्षित सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो ऑनलाइन अन्वेषण के दौरान सुरक्षा की गारंटी देने के लिए रूढ़िवादी नीति पूर्ववृत्तों (conservative policy priors) और संभाव्य गतिकी मॉडलों का लाभ उठाता है, साथ ही इष्टतम अभिसरण प्राप्त करता है और बेंचमार्क एवं वास्तविक हार्डवेयर दोनों पर अत्याधुनिक तरीकों से बेहतर प्रदर्शन करता है।

मूल लेखक: Manuel Wendl, Yarden As, Manish Prajapat, Anton Pollak, Stelian Coros, Andreas Krause

प्रकाशित 2026-08-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Manuel Wendl, Yarden As, Manish Prajapat, Anton Pollak, Stelian Coros, Andreas Krause

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कुछ नया करना सिखा रहे हैं, जैसे कमरे में चलना या रेस कार चलाना। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning) कहा जाता है। यह एक कुत्ते को करतब सिखाने जैसा है: रोबोट चीज़ें आज़माता है, अच्छा करने पर उसे "ट्रीट" (इनाम) मिलता है और बुरा करने पर "डाँट" (दंड) मिलती है। समय के साथ, वह व्यवहार करने का सबसे अच्छा तरीका समझ जाता है। लेकिन यहाँ एक पेंच है: वास्तविक भौतिक दुनिया में, आप रोबट को बेतहाशा "कोशिश और विफलता" करने की अनुमति नहीं दे सकते। यदि चलने के दौरान सीखने वाला कोई रोबोट ज़ोर से गिर जाता है, तो उसके पैर टूट सकते हैं। यदि कोई सेल्फ-ड्राइविंग कार दीवारों से टकराकर सीखना शुरू करती है, तो वह लोगों को चोट पहुँचा सकती है। यह "सेफ एक्सप्लोरेशन" (Safe Exploration - सुरक्षित अन्वेषण) की बड़ी समस्या है: आप एजेंट को बेहतर बनने के लिए कैसे सीखने देते हैं बिना ऐसा कोई कदम उठाए जो आपदा का कारण बन सके?

वैज्ञानिकों ने एक "सेफ्टी नेट" (सुरक्षा जाल) देकर इसे हल करने की कोशिश की है। आमतौर पर, इसका अर्थ एक बैकअप प्लान या एक सख्त नियम पुस्तिका होता है जो रोबोट को चोट लगने से पहले ही रोक देता है। लेकिन ये सुरक्षा जाल इतने सख्त हो सकते हैं कि रोबोट कुछ भी नया नहीं सीख पाता; वह बस सुरक्षित रहता है लेकिन एक ही जगह अटक जाता है। चुनौती यह खोजने की है कि नए, बेहतर तरीके खोजने के लिए पर्याप्त साहसी कैसे बना जाए, जबकि यह भी पता हो कि कब पीछे हटकर सुरक्षित रहना है। यह शोध पत्र ठीक इसी दुविधा को संबोधित करता है, और एक नया तरीका प्रस्तावित करता है जिससे रोबोट ऑनलाइन, यानी वास्तविक समय में, बिना कभी खतरे की रेखा पार किए सीख सके।

यह शोध पत्र एक नया एल्गोरिदम पेश करता है जिसे SOOPER कहा जाता है (जिसका अर्थ है Safe Online Optimism for Pessimistic Expansion in RL)। SOOPER को एक बहुत ही सावधान, अनुभवी मार्गदर्शक वाले रोबोट के रूप में समझें। यह मार्गदर्शक एक "पॉलिसी प्रायर" (policy prior) है—निर्देशों का एक समूह जो रोबोट पहले से जानता है, शायद किसी सिम्युलेटर या पुराने डेटा से सीखा हुआ। यह मार्गदर्शक "पेसिमिस्टिक" (निराशावादी/सावधानी बरतने वाला) है, जिसका अर्थ है कि यह सबसे खराब स्थिति को मानकर चलता है और केवल सुरक्षित रहने के लिए न्यूनतम प्रयास करता है। यह एक ऐसे माता-पिता की तरह है जो जानता है कि फिसलन भरे फर्श पर बिना गिरे कैसे चलना है, लेकिन वह बहुत तेज़ या स्टाइलिश नहीं है।

SOOPER की चतुराई यह है कि यह सीखने के दौरान रोबet को "ऑप्टिमिस्टिक" (आशावादी) होने की अनुमति देता है। रोबोट को नए, जोखिम भरे कदम उठाने की अनुमति दी जाती है ताकि वह एक तेज़ या अधिक कुशल रास्ता खोज सके। हालाँकि, इसमें एक इन-बिल्ट सेफ्टी स्विच (सुरक्षा स्विच) होता है। जैसे-जैसे रोबोट इन नए कदमों को आज़माता है, वह लगातार गणना करता है: "यदि मैं इस तरह चलता रहा, तो क्या मैं अंततः अपना सुरक्षा बजट समाप्त कर दूँगा?" यदि उत्तर थोड़ा सा भी "शायद" है, तो रोबोट तुरंत अपने पेसिमिस्टिक मार्गदर्शक पर स्विच हो जाता है। मार्गदर्शक कार्यभार संभाल लेता है, रोबोट को सुरक्षित स्थिति में वापस लाने के लिए उसका मार्गदर्शन करता है। यह स्विच इतनी तेज़ी से होता है कि रोबोट वास्तव में किसी मुसीबत में नहीं पड़ता।

जादुई हिस्सा यह है: रोबोट केवल रुकता और इंतज़ार नहीं करता। जब मार्गदर्शक कार्यभार संभालता है, तो रोबोट उस क्षण को "सीखा गया सबक" के रूप में रिकॉर्ड करता है। वह महसूस करता है, "ओह, जिस रास्ते को मैं आज़मा रहा था, वह एक ऐसे डेड एंड (बंद रास्ते) की ओर ले जाता है जहाँ मुझे धीमा और सावधान रहना पड़ेगा।" यह जानकारी रोबोट को दुनिया का एक बेहतर मानसिक मानचित्र बनाने में मदद करती है। समय के साथ, रोबोट ठीक से समझ जाता है कि सुरक्षित सीमाएँ कहाँ हैं और वह उन सीमाओं के भीतर रहते हुए नए, तेज़ रास्ते खोज लेता है। यह एक ऐसे हाइकर (पगडंडी पर चलने वाले यात्री) की तरह है जो एक गाइड के साथ जंगल की खोज कर रहा है जो सुरक्षित रास्तों को जानता है। हाइकर झाड़ियों के बीच से रास्ता काटकर शॉर्टकट खोजने की कोशिश करता है। यदि वह किसी ढलान के बहुत करीब पहुँच जाता है, तो गाइड उसका हाथ पकड़ लेता है और उसे सुरक्षित रास्ते पर वापस खींच लेता है। हाइकर सीखता है, "ठीक है, वह शॉर्टकट बहुत खतरनाक था," और अगली बार, वह एक अलग रास्ता आज़माता है। अंततः, हाइकर एक ऐसा शॉर्टकट खोज लेता है जो सुरक्षित भी है और तेज़ भी, बिना कभी ढलान से गिरे।

लेखक गणितीय रूप से सिद्ध करते हैं कि यह विधि सीखने की प्रक्रिया के हर चरण में सुरक्षा की गारंटी देती है। वे यह भी दिखाते हैं कि रोबोट का प्रदर्शन समय के साथ सुधरता है, और अंततः एक ऐसी रणनीति खोज लेता है जो सर्वोत्तम संभव रणनीति के लगभग बराबर होती है, जबकि वह सुरक्षा नियमों का उल्लंघन कभी नहीं करती। उन्होंने विभिन्न कार्यों, जैसे पोल को सीधा खड़ा करने या बाधाओं के चारों ओर रेस कार चलाने के कंप्यूटर सिमुलेशन पर इसका परीक्षण किया। हर मामले में, SOOPER सुरक्षित रहा और अन्य शीर्ष तरीकों की तुलना में तेज़ी से सीखकर बेहतर प्रदर्शन किया।

सबसे प्रभावशाली बात यह है कि उन्होंने केवल कंप्यूटर सिमुलेशन तक ही सीमित नहीं रहे। उन्होंने SOOPER को एक वास्तविक, भौतिक रिमोट-कंट्रोल रेस कार पर उतारा। इस कार को उच्च गति पर गाड़ी चलानी होती है, टायरों से बचना होता है और लक्ष्य तक पहुँचना होता है। वास्तविक दुनिया अव्यवस्थित और अप्रत्याशित है, जिसमें कार के मोटर्स और सेंसरों में देरी जैसी चीज़ें होती हैं। इन वास्तविक दुनिया की गड़बड़ियों के बावजूद, SOOPER ने शुरुआती "सुरक्षित" ड्राइविंग शैली की तुलना में तेज़ी से और कुशलता से गाड़ी चलाना सफलतापूर्वक सीखा, और इस दौरान वह कभी भी बाधाओं से नहीं टकराया। यह शोध पत्र सुझाव देता है कि यह दृष्टिकोण वास्तविक दुनिया में रोबोट्स को सुरक्षित रूप से सीखने के लिए एक बड़ा कदम हो सकता है, जिससे उन्हें नियंत्रित प्रयोगशालाओं से हमारे वास्तविक सड़कों और घरों तक पहुँचाया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →