IRIS: Interpolative Rényi Iterative Self-play for Large Language Model Fine-Tuning
यह शोध पत्र IRIS का प्रस्ताव करता है, जो एक एकीकृत सेल्फ-प्ले फाइन-ट्यूनिंग फ्रेमवर्क है जो प्रशिक्षण चरणों के दौरान महत्व भारण (इम्पॉर्टेंस वेटिंग) को गतिशील रूप से अनुकूलित करने के लिए निरंतर समायोज्य रेनी डायवर्जेंस पैरामीटर का लाभ उठाता है, जिससे यह मौजूदा विधियों से बेहतर प्रदर्शन करता है और काफी कम एनोटेटेड नमूनों के साथ उत्कृष्ट परिणाम प्राप्त करता है।