Latent Q-Barrier Shielding for Safe In-Context Reinforcement Learning
यह शोध पत्र एक लेटेंट क्यू-बैरियर शील्डिंग (Latent Q-Barrier Shielding) फ्रेमवर्क प्रस्तावित करता है जो आउट-ऑफ-डिस्ट्रीब्यूशन शिफ्ट्स के तहत सुरक्षित इन-कॉन्टेक्स्ट सुदृढीकरण शिक्षण (in-context reinforcement learning) को बढ़ाता है, जो टेस्ट-टाइम पैरामीटर अपडेट की आवश्यकता के बिना संदर्भ का अनुमान लगाकर और भविष्य की लागतों एवं शेष सुरक्षा बजटों के आधार पर कार्यों को फ़िल्टर करके किया जाता है, जिससे कई बेंचमार्क में बेहतर रिवॉर्ड-सेफ्टी ट्रेडऑफ़ प्राप्त होता है।