When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift
यह शोध पत्र प्रकट करता है कि 'वीक-टू-स्ट्रॉन्ग प्रेफरेंस लर्निंग' अक्सर वितरण बदलावों (डिस्ट्रीब्यूशन शिफ्ट्स) के दौरान रिप्रेजेंटेशनल ड्रिफ्ट के कारण विफल हो जाता है, और प्रीट्रेन मॉडल के स्पेस से अत्यधिक विचलन को नियंत्रित करने के लिए एक "रिप्रेजेंटेशन एंकरिंग" रेगुलराइज़र का प्रस्ताव करता है, जिससे इन-डिस्ट्रीब्यूशन प्रदर्शन को बनाए रखते हुए आउट-ऑफ-डिस्ट्रीब्यूशन ट्रांसफर में सुधार होता है।