Robust Shielding for Safe Reinforcement Learning
यह शोध पत्र रोबस्ट मार्कोव निर्णय प्रक्रियाओं (Markov decision processes) के लिए एक नवीन, सुदृढ़ और इष्टतम शिल्डिंग फ्रेमवर्क प्रस्तुत करता है जो सैंपलिंग विधियों के साथ संयोजन करते हुए, सीखी गई मॉडलों के लिए प्रोबेबली एप्रोक्सिमेटली करेक्ट (PAC) सुरक्षा गारंटी प्रदान करने के लिए, सबसे खराब स्थिति वाली ट्रांज़िशन अनिश्चितताओं के तहत सुदृढीकरण लर्निंग (reinforcement learning) एजेंटों की सुरक्षा सुनिश्चित करता है।