Normalized Rewards for Preference Optimization
यह शोध पत्र DPO और SimPO जैसे डायरेक्ट एलाइनमेंट एल्गोरिदम (DAAs) के लिए एक नॉर्मलाइजेशन-आधारित रेगुलेराइज़ेशन तकनीक का प्रस्ताव करता है ताकि ओवर-ऑप्टिमाइज़ेशन और लाइकलीहुड कोलैप्स को कम किया जा सके, जो यह प्रदर्शित करता है कि यह टोकन-लेवल प्रोबेबिलिटी डिस्ट्रीब्यूशंस को स्थिर करके जनरेशन क्वालिटी और जनरल बेंचमार्क परफॉरमेंस में महत्वपूर्ण सुधार करता है।