Adaptive Margin RLHF via Preference over Preferences
यह शोध पत्र 'अडेप्टिव मार्जिन RLHF' (Adaptive Margin RLHF) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो रिवॉर्ड मॉडलिंग और एलाइनमेंट के लिए गतिशील, डेटा-विशिष्ट मार्जिन को अनुमानित करने हेतु "प्रेफरेंस-ओवर-प्रेफरेंस" (preference-over-preference) एनोटेशन का लाभ उठाता है, और विशेष सैंपलिंग रणनीतियों के माध्यम से दोनों के बीच के ट्रेड-ऑफ को संबोधित करते हुए डिस्क्रिमिनेटिव और जनरेटिव प्रदर्शन दोनों को बढ़ाने के लिए DPO-PoP एल्गोरिदम पेश करता है।