Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution
यह शोध पत्र PEPO को प्रस्तुत करता है, जो एक सिंगल-स्टेप डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन एल्गोरिदम है जो डेटा वितरण के ज्ञान या एक स्पष्ट रिवॉर्ड मॉडल की आवश्यकता के बिना, विलगित (disjoint) डेटा उपसमुच्चयों पर प्रशिक्षित नीतियों के एक निराशावादी समूह (pessimistic ensemble) का लाभ उठाकर ओवर-ऑप्टिमाइज़ेशन को कम करता है, जिससे DPO की व्यावहारिक सरलता को बनाए रखते हुए बेहतर सैंपल कॉम्प्लेक्सिटी गारंटी प्राप्त की जाती है।