Distributionally Robust Reinforcement Learning with Human Feedback
यह शोध पत्र लार्ज लैंग्वेज मॉडल्स को फाइन-ट्यून करने के लिए रिवॉर्ड-आधारित RLHF और रिवॉर्ड-फ्री DPO के डिस्ट्रीब्यूशनली रोबस्ट वेरिएंट्स पेश करता है, जो कन्वर्जेंस गारंटी के साथ मिनीबैच ग्रेडिएंट डिसेंट एल्गोरिदम का प्रस्ताव देते हैं जो मानक तरीकों की तुलना में आउट-ऑफ-डिस्ट्रीब्यूशन कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार करते हैं।