← नवीनतम पेपर
🤖 machine learning

Latent Q-Barrier Shielding for Safe In-Context Reinforcement Learning

यह शोध पत्र एक लेटेंट क्यू-बैरियर शील्डिंग (Latent Q-Barrier Shielding) फ्रेमवर्क प्रस्तावित करता है जो आउट-ऑफ-डिस्ट्रीब्यूशन शिफ्ट्स के तहत सुरक्षित इन-कॉन्टेक्स्ट सुदृढीकरण शिक्षण (in-context reinforcement learning) को बढ़ाता है, जो टेस्ट-टाइम पैरामीटर अपडेट की आवश्यकता के बिना संदर्भ का अनुमान लगाकर और भविष्य की लागतों एवं शेष सुरक्षा बजटों के आधार पर कार्यों को फ़िल्टर करके किया जाता है, जिससे कई बेंचमार्क में बेहतर रिवॉर्ड-सेफ्टी ट्रेडऑफ़ प्राप्त होता है।

मूल लेखक: Minjae Kwon, Amir Moeini, Shangtong Zhang, Lu Feng

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minjae Kwon, Amir Moeini, Shangtong Zhang, Lu Feng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को भूलभुलैया (maze) में रास्ता खोजना सिखा रहे हैं। पुराने दिनों में, आप रोबोट को महीनों तक प्रशिक्षित करते, उसकी हर गलती पर उसके "मस्तिष्क" (इसके पैरामीटर्स) को थोड़ा-थोड़ा बदलते रहते, जब तक कि वह दीवारों से बचना और सुरक्षित रूप से बाहर निकलना न सीख जाए।

इन-कॉन्टेक्स्ट रीइन्फोर्समेंट लर्निंग (ICRL) एक नया और स्मार्ट तरीका है। रोबोट के मस्तिष्क को हर बार फिर से प्रशिक्षित करने के बजाय, आप उसे एक "याददाश्त" देते हैं जो उसने अभी-अभी क्या किया है। जैसे-जैसे वह भूलभुलैया में चलता है, वह अपने इतिहास को देखता है: "मैंने बाएँ मुड़ने की कोशिश की और दीवार से टकरा गया; मैंने दाएँ मुड़ा और मुझे एक सिक्का मिल गया।" वह बिना अपने मस्तिष्क को बदले, तुरंत ढलने के लिए इस इतिहास का उपयोग करता है।

समस्या:
कभी-कभी, रोबोट बहुत अधिक आत्मविश्वासी हो जाता है। वह एक ऐसा शॉर्टकट देख सकता है जो इनाम (एक सिक्का) पाने के लिए बहुत अच्छा दिखता है, लेकिन उसे यह एहसास नहीं होता कि उस रास्ते को चुनने से उसका सारा "सुरक्षा ईंधन" (बजट) खत्म हो जाएगा और बाद में वह दुर्घटनाग्रस्त हो जाएगा। मौजूदा तरीके ट्रेनिंग के दौरान रोबोट को सुरक्षित रहने के लिए सिखाने की कोशिश करते हैं, लेकिन एक बार जब रोबोट वास्तविक दुनिया में होता है, तो उसके पास कोई अंतर्निहित "सुरक्षा जांच" नहीं होती जो उसे केवल इसलिए जोखिम भरा कदम उठाने से रोक सके क्योंकि उसे ऐसा लग रहा है।

समाधान: "लेटेंट Q-बैरियर शील्ड" (The Latent Q-Barrier Shield)
लेखकों ने एक सुरक्षा गार्ड (शील्ड) बनाया है जो रोबोट के मस्तिष्क और उसके कार्यों के बीच बैठता है। इसे एक ट्रैफिक पुलिस या को-पायलट की तरह समझें जो गाड़ी नहीं चलाता, बल्कि सड़क और ईंधन के गेज (fuel gauge) पर नज़र रखता है।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. दो आँखें (लेटेंट व्यूज़ - Latent Views)

रोबोट के पास दुनिया को देखने के दो तरीके हैं, जो एक विशेष "अनुवादक" (एनकोडर) द्वारा बनाए गए हैं:

  • ड्राइवर की आँख: यह स्थिति को देखती है ताकि यह तय किया जा सके कि क्या करना है (जैसे, "बाएँ मुड़ो!")।
  • सुरक्षा अधिकारी की आँख: यह उसी स्थिति को देखती है लेकिन पूछती है, "क्या यह सुरक्षित है, यह देखते हुए कि हमारे पास कितना ईंधन बचा है?"

शील्ड ड्राइवर के विचारों को होने से पहले ही जाँचने के लिए सुरक्षा अधिकारी के दृश्य का उपयोग करती है।

2. ईंधन गेज और क्रिस्टल बॉल (कॉस्ट क्रिटिक और डायनेमिक्स)

शील्ड के पास दो महाशक्तियाँ हैं जो उसने ट्रेनिंग के दौरान सीखी हैं:

  • क्रिस्टल बॉल (लेटेंट डायनेमिक्स): यह एक कदम आगे की दुनिया कैसी दिखेगी, इसका अनुमान लगाती है। "यदि मैं बाएँ मुड़ता हूँ, तो मैं एक अंधेरे कोने में रहूँगा।"
  • लागत के लिए क्रिस्टल बॉल (कॉस्ट क्रिटिक): यह अनुमान लगाती है कि उस चाल में भविष्य में कितना "सुरक्षा ईंधन" खर्च होगा। "बाएँ मुड़ने से हमें भूलभुलैया के बाकी हिस्से में जाने के लिए 5 यूनिट ईंधन खर्च करना पड़ेगा।"

3. "बैरियर" (सुरक्षा जांच)

शील्ड बचा हुआ ईंधन और अनुमानित भविष्य की लागत की तुलना करती है।

  • बैरियर: कल्पना कीजिए कि रेत पर एक रेखा खींची गई है। यदि अनुमानित लागत आपके पास बचे ईंधन से अधिक है, तो रेखा पार हो जाती है।
  • Q-बैरियर: यह वह गणित है जो आपकी वर्तमान ईंधन और अनुमानित लागत के बीच की दूरी की गणना करता है।
    • यदि संख्या धनात्मक (positive) है, तो आपके पास सुरक्षा मार्जिन है। आप जाने के लिए तैयार हैं।
    • यदि संख्या ऋणात्मक (negative) है, तो आप ईंधन खत्म होने वाले हैं।

4. कोमल हाथ (रीवेटिंग, बैन करना नहीं)

पुराने सुरक्षा सिस्टम एक बाउंसर की तरह थे जो आपको क्लब से बाहर निकाल देते थे यदि आप जोखिम भरे दिखते थे। यह नया शील्ड एक कोमल कोच की तरह है।

  • यह यह कहने के बजाय कि "नहीं, आप यह नहीं कर सकते," कहता है, "यह चाल जोखिम भरी है। आइए इसे इस तरह बनाएं कि इसकी संभावना कम हो जाए कि आप इसे चुनें।"
  • यह रोबोट की मूल योजना लेता है और विकल्पों को रीवेट (reweight) करता है। सुरक्षित विकल्पों को बड़ा स्पॉटलाइट मिलता है; जोखिम भरे विकल्पों को धुंधला कर दिया जाता है। इस तरह, रोबोट अभी भी अन्वेषण (explore) कर सकता है, लेकिन इसकी संभावना बहुत कम हो जाती है कि वह दुर्घटनाग्रस्त हो जाए।

उन्होंने क्या पाया?

शोधकर्ताओं ने इस शील्ड का परीक्षण पांच अलग-अलग "भूलभुलैया" (बेंचमार्क) पर किया जहाँ रोबोट को नई, कठिन स्थितियों (आउट-ऑफ-डिस्ट्रीब्यूशन) में ढलना था।

  • बेहतर संतुलन: पाँच में से चार मामलों में, शील्ड वाले रोबोट ने बिना शील्ड वाले रोबोट की तुलना में अधिक इनाम (सिक्के) प्राप्त किए और कम सुरक्षा ईंधन खर्च किया।
  • "रूढ़िवादी" मामला: एक विशिष्ट वातावरण (हाफचीटा नामक दौड़ता हुआ रोबोट) में, शील्ड इतनी सावधान थी कि उसने अतिरिक्त सुरक्षा के लिए रोबोट की गति को थोड़ा धीमा कर दिया। इसने गति के बदले सुरक्षा में बड़ी बढ़त हासिल की।
  • पुनः प्रशिक्षण की आवश्यकता नहीं: सबसे अच्छी बात? शील्ड रोबोट के मस्तिष्क को बदले बिना काम करती है। यह बस निर्णय लेने के समय एक स्मार्ट पर्यवेक्षण की परत जोड़ देती है।

सारांश में:
यह पेपर AI एजेंटों के लिए एक "सुरक्षा को-पायलट" पेश करता है। यह एजेंट को अपने इतिहास से सीखने और तेजी से ढलने की अनुमति देता है, लेकिन साथ ही एक स्मार्ट, गणित-आधारित गार्ड जोड़ता है जो हर चाल से पहले ईंधन गेज की जाँच करता है। यह सुनिश्चित करता है कि एजेंट लालची न हो जाए और सुरक्षा बजट खत्म न कर दे, जिससे कठिन और नई स्थितियों में बेहतर प्रदर्शन होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →