Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning
यह शोध पत्र सिमिलैरिटी एज़ रिवॉर्ड अलाइनमेंट (SARA) को प्रस्तुत करता है, जो प्राथमिकता-आधारित सुदृढीकरण शिक्षण (preference-based reinforcement learning) के लिए एक सुदृढ़ कंट्रास्टिव फ्रेमवर्क है जो रिवॉर्ड्स की गणना समानता के रूप में करने के लिए लेटेंट रिप्रेजेंटेशन सीखता है, और निरंतर नियंत्रण बेंचमार्क (continuous control benchmarks) पर बेसलाइन्स की तुलना में बेहतर स्थिरता और शोर प्रतिरोध (noise resilience) प्रदर्शित करता है।