Reinforcement Learning Towards Broadly and Persistently Beneficial Models
यह शोध पत्र यह प्रदर्शित करता है कि स्वास्थ्य जैसे यथार्थवादी डोमेन के भीतर लाभकारी व्यवहारों पर सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) मॉडलों को प्रशिक्षित करना, उनके आउट-ऑफ-डिस्ट्रीब्यूशन संरेखण (अलाइनमेंट) में महत्वपूर्ण सुधार करता है, धोखे जैसी मिसअलाइनमेंट रणनीतियों को कम करता है, और विविध उच्च-जोखिम वाले परिवेशों में प्रतिकूल हेरफेर के विरुद्ध उनकी निरंतरता को बढ़ाता है।