Learning When to Act: Communication-Efficient Reinforcement Learning via Run-Time Assurance
यह शोध पत्र एक संचार-कुशल सुरक्षित सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो नियंत्रण नीतियों के साथ अनुकूलन योग्य क्रियान्वयन समय (एक्चुएशन टाइमिंग) को सीखता है, जिसमें स्थिरता की गारंटी देने के लिए लाइपुनोव-आधारित बैकअप के साथ एक रन-टाइम आश्वासन परत का उपयोग किया गया है, जो विभिन्न रोबोटिक प्रणालियों में फिक्स्ड-रेट और एक्सपेक्टेशन-आधारित सुरक्षा विधियों से काफी बेहतर प्रदर्शन करता है।