Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data
यह शोध पत्र PROCO को प्रस्तुत करता है, जो एक मॉडल-आधारित ऑफलाइन सुरक्षित सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो प्राकृतिक भाषा ज्ञान को एक रूढ़िवादी लागत फलन (conservative cost function) में स्थापित करने के लिए बड़े भाषा मॉडलों का लाभ उठाता है, जिससे काउंटरफैक्चुअल असुरक्षित नमूनों का निर्माण और उन मामलों में भी सुरक्षित नीतियों को सीखना सक्षम होता है जहाँ प्रशिक्षण डेटा में देखे गए उल्लंघन मौजूद नहीं होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखाने की कोशिश कर रहे हैं। रोबोट को सिखाने का सामान्य तरीका यह है कि उसे गाड़ी चलाने दें, गलतियाँ करने दें, चीजों से टकराने दें और उन टक्करों से सीखने दें। लेकिन वास्तविक दुनिया में, आप यह देखने के लिए कि क्या होता है, रोबोट को दीवार या पैदल यात्री से टकराने नहीं दे सकते। यह बहुत खतरनाक है।
इसलिए, इसके बजाय, आप रोबोट को एक मानव चालक द्वारा एकत्र किए गए ड्राइविंग लॉग का एक डेटासेट देते हैं जो बहुत सावधान था और जिसने कभी दुर्घटना नहीं की। रोबोट केवल "सुरक्षित" ड्राइविंग ही देखता है।
समस्या: "लगभग-दुर्घटना" का जाल (The "Almost-Crash" Trap)
यहाँ पेचीदा बात यह है: सिर्फ इसलिए कि रोबोट ने डेटा में कभी दुर्घटना नहीं देखी है, इसका मतलब यह नहीं है कि वह जानता है कि दुर्घटना होने से पहले वह कैसी दिखती है।
कल्पना कीजिए कि एक कार दीवार की ओर बढ़ रही है। डेटासेट में, मानव चालक दीवार से टकराने से ठीक पहले ब्रेक लगा देता है। रोबोट कार को सुरक्षित रूप से रुकते हुए देखता है। लेकिन रोबोट को यह समझ नहीं आता कि यदि उसने ब्रेक नहीं लगाया होता, तो वह दो सेकंड में टकरा जाता। वह सोचता है, "ओह, इस गति से गाड़ी चलाना ठीक है!" क्योंकि उसने कभी दुर्घटना नहीं देखी है।
यह वही मूल समस्या है जिसे यह पेपर संबोधित करता है: आप सुरक्षा कैसे सिखाते हैं जब आपके पास खतरे के कोई उदाहरण नहीं हैं, केवल लोगों द्वारा बाल-बाल बचने के उदाहरण हैं?
समाधान: PROCO (द "व्हाट-इफ" सिम्युलेटर)
लेखक PROCO नामक एक नई विधि प्रस्तावित करते हैं। इसे एक "सुरक्षा कोच" के रूप में सोचें जो दो मुख्य उपकरणों का उपयोग करता है: एक क्रिस्टल बॉल (दुनिया कैसे काम करती है इसका एक मॉडल) और एक सेफ्टी मैनुअल (एक सुपर-स्मार्ट AI द्वारा लिखा गया)।
यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:
1. क्रिस्टल बॉल (द डायनेमिक्स मॉडल)
सबसे पहले, रोबोट सुरक्षित ड्राइविंग लॉग से एक "क्रिस्टल बॉल" सीखता है। यह जादू नहीं है; यह एक गणितीय मॉडल है जो भविष्यवाणी करता है: "यदि मैं यहाँ हूँ, और मैं पहिया इस तरह घुमाता हूँ, तो अगले एक सेकंड में मैं कहाँ होऊँगा?"
- उपमा: यह एक फ्लाइट सिम्युलेटर की तरह है। रोबक कार के भौतिक विज्ञान (physics) को सीखता है ताकि वह वास्तविक दुनिया में गाड़ी चलाए बिना भविष्य की स्थितियों की कल्पना कर सके।
2. सेफ्टी मैनुअल (द LLM कॉस्ट फंक्शन)
इसके बाद, रोबोट को यह जानने की आवश्यकता है कि "असुरक्षित" का क्या अर्थ है। चूंकि उसके पास दुर्घटना का डेटा नहीं है, शोधकर्ता एक लार्ज लैंग्वेज मॉडल (LLM)—एक सुपर-स्मार्ट AI जो मानव भाषा को पढ़ और समझ सकता है—से एक "सेफ्टी मैनुअल" लिखने के लिए कहते हैं।
- प्रॉम्प्ट: वे LLM को बताते हैं: "यहाँ नियम है: दीवार से मत टकराओ। लेकिन कृपया अत्यधिक सावधान रहें। यदि आप दीवार के करीब हैं, तो इसे ऐसे व्यवहार करें जैसे कि आप पहले ही उससे टकरा चुके हैं।"
- परिणाम: LLM एक कंप्यूटर फंक्शन (कोड का एक टुकड़ा) लिखता है जो एक "कॉस्ट फंक्शन" के रूप में कार्य करता है। यह न केवल दीवार से टकराने पर, बल्कि उसके खतरनाक रूप से करीब होने पर भी एक उच्च "पेनल्टी स्कोर" असाइन करता है। यह एक "सेफ्टी बफर" बनाता है।
3. "व्हाट-इफ" गेम (प्रोएक्टिव रोलआउट्स)
अब चालाकी वाला हिस्सा आता है। रोबोट अपने क्रिस्टल बॉल का उपयोग करके अपने पास मौजूद सुरक्षित डेटा से आगे की ड्राइविंग का अनुकरण (simulate) करता है। वह पूछता है: "यदि मैं इस सुरक्षित स्थान से सीधा चलता रहा, तो क्या होगा?"
- क्योंकि सेफ्टी मैनुअल के कारण, सिम्युलेटर जानता है कि दीवार के करीब जाना बुरा है।
- सिम्युलेटर इन "व्हाट-इफ" परिदृश्यों को चलाता है और नकली दुर्घटना डेटा उत्पन्न करता है। यह हजारों ऐसे उदाहरण बनाता जो "बाल-बाल बचे" या "दुर्घटनाएं" हैं, जो वास्तव में वास्तविक दुनिया में कभी नहीं हुईं लेकिन गणितीय रूप से भविष्यवाणी की गई हैं कि होंगी।
4. नकली डेटा से सीखना
अंत में, रोबोट इस नए, मिश्रित डेटासेट पर प्रशिक्षण लेता है:
- मूल वास्तविक सुरक्षित डेटा।
- सिम्युलेटेड "दुर्घटना" डेटा जो क्रिस्टल बॉल और सेफ्टी मैनुअल द्वारा उत्पन्न किया गया है।
इस सिम्युलेटेड खतरों पर प्रशिक्षण लेकर, रोबमा "खतरे के क्षेत्र" (वे स्थितियाँ जो दुर्घटना का कारण बन सकती हैं) को पहचानना सीख जाता है और उनसे दूर रहना सीख जाता है, भले ही उसने वास्तविक जीवन में कभी दुर्घटना न देखी हो।
यह बेहतर क्यों है?
- पुराना तरीका: यदि आप केवल रोबोट को सुरक्षित डेटा दिखाते हैं, तो वह सोच सकता है कि "दीवार के पास तेजी से गाड़ी चलाना सुरक्षित है" क्योंकि उसने कभी दुर्घटना नहीं देखी। वह खतरे के क्षेत्र में जा सकता है और तैनात होने पर दुर्घटनाग्रस्त हो सकता है।
- PROCO तरीका: यह सक्रिय रूप से उन खतरे वाले परिदृश्यों को बनाता है जिनसे उसे सीखने की आवश्यकता है। यह प्रभावी रूप से कहता है, "मुझे पता है कि मैं अभी तक दुर्घटनाग्रस्त नहीं हुआ हूँ, लेकिन मेरी क्रिस्टल बॉल कहती है कि अगर मैं अभी धीमा नहीं हुआ तो मैं टकरा जाऊँगा।"
परिणाम
लेखकों ने इसका परीक्षण 17 विभिन्न रोबोट कार्यों पर किया (जैसे कार चलाना, रोबोट आर्म हिलाना, या तैरना)।
- उन्होंने PROCO की तुलना अन्य उन्नत तरीकों से की जिन्होंने उसी "केवल-सुरक्षित" डेटा से सुरक्षा सीखने की कोशिश की थी।
- परिणाम: PROCO नाटकीय रूप से बेहतर था। कई मामलों में, इसने अन्य तरीकों की तुलना में सुरक्षा उल्लंघनों (दुर्घटनाओं) को 400% से अधिक कम कर दिया। इसने बहुत अधिक विश्वसनीयता के साथ सुरक्षित रहना सीखा क्योंकि यह उन भविष्य के खतरों को "देख" सका जिन्हें अन्य तरीके नहीं देख सके।
संक्षेप में: PROCO एक तरीका है जिससे आप रोबोट को सिम्युलेटर और एक स्मार्ट लैंग्वेज गाइड का उपयोग करके एक "व्हाट-इफ" गेम खिलाकर सुरक्षित रहना सिखाते हैं, ताकि वह उन आपदाओं से बचना सीख सके जिनका उसने वास्तव में कभी अनुभव नहीं किया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।