← नवीनतम पेपर
🤖 machine learning

Safe-Support Q-Learning: Learning without Unsafe Exploration

यह शोध पत्र "सेफ-सपोर्ट क्यू-लर्निंग" (Safe-Support Q-Learning) का प्रस्ताव देता है, जो एक दो-चरणीय ढांचा है जो एक सुरक्षित सेट पर समर्थित व्यवहार नीति (behavior policy) का लाभ उठाकर और एक सुरक्षित, उच्च-प्रदर्शन वाली नीति प्राप्त करने के लिए KL-नियमित बेलमैन लक्ष्य (KL-regularized Bellman target) का उपयोग करके, सुदृढीकरण शिक्षण (reinforcement learning) प्रशिक्षण के दौरान असुरक्षित अवस्थाओं के आगमन को समाप्त करता है, जिससे सुरक्षित क्षेत्र के भीतर अन्वेषण (exploration) से समझौता किए बिना यह संभव होता है।

मूल लेखक: Yeeun Lim, Narim Jeong, Donghwan Lee

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yeeun Lim, Narim Jeong, Donghwan Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी समस्या: बिना दुर्घटना किए साइकिल चलाना सीखना

कल्पना कीजिए कि आप एक रोबोट को साइकिल चलाना सिखा रहे हैं। सामान्य सुदृढीकरण शिक्षण (Reinforcement Learning - RL) में, रोबोट चीजों को आजमाकर सीखता है। वह यह समझने के लिए कि क्या नहीं करना है, डगमगा सकता है, गिर सकता है या दीवार से टकरा सकता है। एक वीडियो गेम में, टकराना ठीक है; आप बस "रीसेट" बटन दबा सकते हैं। लेकिन वास्तविक दुनिया में (जैसे कार चलाना या रोब रोबोटिक हाथ को नियंत्रित करना), एक भी दुर्घटना विनाशकारी हो सकती है।

अधिकांश वर्तमान "सेफ आरएल" (Safe RL) विधियां रोबोट को सावधान रहने के लिए सिखाने की कोशिश करती हैं, जैसे कि जब वह दीवार के बहुत करीब पहुँच जाए तो उसे "डांट" (दंड/penalty) देना। लेकिन रोबोट को यह सीखने के लिए कि वह बुरा है, अभी भी दीवार के करीब जाना पड़ता है। यह एक बच्चे को यह बताने जैसा है, "चूल्हे को मत छुओ," लेकिन उसे हाथ पीछे खींचने से पहले गर्मी महसूस करने के लिए इतना करीब आने देना।

पेपर का समाधान: "सेफ ज़ोन" की बाड़

यह पेपर एक सख्त नियम प्रस्तावित करता है: रोबोट को कभी भी "सेफ ज़ोन" (सुरक्षित क्षेत्र) से बाहर जाने की अनुमति नहीं है। उसे सब कुछ इस तरह सीखना होगा कि वह कभी भी असुरक्षित स्थिति में न जाए।

इसे करने के लिए, लेखकों ने एक नई विधि बनाई जिसे सेफ-सपोर्ट क्यू-लर्निंग (Safe-Support Q-Learning) कहा जाता है। यह कैसे काम करता है, इसे तीन सरल चरणों में समझा जा सकता है:

1. "गार्जियन" (व्यवहार नीति/Behavior Policy)

सबसे पहले, वे एक "गार्जियन" नीति बनाते हैं। इसे रोबोट के साथ साइकिल चलाते हुए एक बहुत ही सावधान, थोड़े अनाड़ी इंसान के रूप में समझें।

  • यह गार्जियन कोई विश्व-स्तरीय रेसर नहीं है (इसे परफेक्ट होने की आवश्यकता नहीं है)।
  • इसका एकमात्र काम "सेफ ज़ोन" के भीतर सख्ती से रहना है (जैसे फुटपाथ पर रहना, कभी भी कर्ब से न टकराना)।
  • क्योंकि यह थोड़ा रैंडम (stochastic) है, यह रोबट को अलग-अलग सुरक्षित रास्ते दिखाने के लिए पर्याप्त घूमता है, लेकिन यह कभी भी कोई खतरनाक मोड़ नहीं लेता।

2. "मैप मेकर" (क्यू-फंक्शन/Q-Function)

इसके बाद, रोबोट एक मानसिक मानचित्र (जिसे क्यू-फंक्शन कहा जाता है) बनाता है कि विभिन्न चालें कितनी अच्छी हैं।

  • समस्या: आमतौर पर, यदि रोबोट कभी किसी खतरनाक चाल को नहीं देखता है, तो वह गलती से यह सोच सकता है, "हे, वह ढलान एक शॉर्टकट जैसा लग रहा है!" और उसे उच्च स्कोर दे सकता है।
  • समाधान: लेखक मानचित्र बनाने की प्रक्रिया में एक विशेष नियम (KL रेगुलराइजेशन) जोड़ते हैं। यह रोबोट को बताता है: "केवल उन्हीं चालों को उच्च स्कोर दें जो गार्जियन द्वारा की गई चालों जैसी दिखती हैं।"
  • उपमा: कल्पना कीजिए कि रोबोट एक यात्रा गाइड लिख रहा है। नियम कहता है, "आप केवल उन्हीं रास्तों की सिफारिश कर सकते हैं जिन पर गार्जियन वास्तव में चला है। यदि गार्जियन कभी ढलान के पास नहीं गया, तो आपके गाइडबुक को उस ढलान को 'वर्जित' या 'शून्य अंक' के रूप में मानना चाहिए।" यह रोबोट को उन खतरनाक शॉर्टकट्स के प्रति उत्साहित होने से रोकता है जिन्हें उसने कभी देखा ही नहीं।

3. "स्टूडेंट" (अंतिम नीति/Final Policy)

एक बार मानचित्र बन जाने के बाद, रोबोट यह पता लगाने की कोशिश करता है कि सबसे अच्छा तरीका क्या है।

  • वह मानचित्र को देखता है और पूछता है, "लक्ष्य तक पहुँचने का सबसे तेज़ तरीका क्या है?"
  • हालाँकि, उसे गार्जियन की शैली के करीब रहने के लिए मजबूर किया जाता है। वह अचानक व्हीली (wheelie) करने का निर्णय नहीं ले सकता यदि गार्जियन ने कभी ऐसा नहीं किया था।
  • यह सुनिश्चित करता है कि रोबोट की "सर्वश्रेष्ठ" योजना भी अभी भी सुरक्षित है, क्योंकि इसे पूरी तरह से गार्जियन के सुरक्षित पथ के आधार पर बनाया गया है।

उन्होंने इसका परीक्षण कैसे किया

शोधकर्ताओं ने इसका परीक्षण दो क्लासिक वीडियो गेम जैसे वातावरणों पर किया:

  1. फ्रोजनलेक (FrozenLake): एक ग्रिड जहाँ रोबोट को गड्ढों में गिरे बिना बर्फ पर चलना होता है।
  2. कार्टपोल (CartPole): एक खेल जहाँ आपको चलते हुए कार्ट पर एक पोल को संतुलित करना होता है ताकि वह गिर न जाए।

उन्होंने अपनी विधि की तुलना अन्य "सेफ" एआई विधियों से की।

परिणाम

  • स्थिरता: रोबोट बिना टकराए या भ्रमित हुए सुचारू रूप से सीखा।
  • बेहतर मानचित्र: रोबोट का "मानसिक मानचित्र" (क्यू-वैल्यूज़) बहुत अधिक सटीक था। इसने खतरनाक चालों को कितना अच्छा माना जाए, इसका अत्यधिक आकलन नहीं किया। अन्य विधियाँ अक्सर खतरनाक चालों को ठीक मान लेती थीं, जिससे दुर्घटनाएँ होती थीं।
  • सुरक्षा बनाम प्रदर्शन: रोबोट ने सुरक्षित और तेज़ दोनों होना सीखा। कई परीक्षणों में, इसने अन्य विधियों के समान (या बेहतर) प्रदर्शन किया, लेकिन बहुत कम "बाल-बाल बचने" वाली या असुरक्षित व्यवहारों के साथ।

कमी (सीमाएं)

यह विधि काफी हद तक उस शुरुआती "गार्जियन" पर निर्भर करती है।

  • यदि गार्जियन बहुत खराब है (उदाहरण के लिए, वह केवल स्थिर खड़ा रहना जानता है और कभी आगे नहीं बढ़ता), तो रोबोट भी बहुत अधिक रूढ़िवादी होगा और कुछ भी उपयोगी नहीं सीख पाएगा।
  • पेपर स्वीकार करता है कि यदि "सेफ ज़ोन" बहुत छोटा है या गार्जियन अपूर्ण है, तो रोबोट कार्य करने का सबसे अच्छा तरीका नहीं खोज पाएगा, लेकिन वह निश्चित रूप से एक सुरक्षित तरीका जरूर खोज लेगा।

सारांश

संक्षेप में, यह पेपर एआई को लाइनों के भीतर रहकर सीखना सिखाता है। एआई को पूरी दुनिया को खोजने देने और गलती करने पर उसे दंडित करने के बजाय, वे उसे एक सुरक्षित खेल का मैदान और एक सावधान मार्गदर्शक देते हैं। एआई केवल उन सुरक्षित चालों को देखकर विशेषज्ञ बनना सीखता है जो मार्गदर्शक करता है, जिससे यह सुनिश्चित होता है कि वह गलती से कभी भी कोई खतरनाक ट्रिक न सीख ले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →