Dual-Difficulty Curriculum Learning for Direct Preference Optimization
यह शोध पत्र डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन (Direct Preference Optimization) के लिए एक नवीन द्वि-आयामी कठिनाई ढांचे का प्रस्ताव करता है, जो GSP-Curri-DPO पद्धति को पेश करता है जो मॉडलों को बेहतर डेटा दक्षता और सुदृढ़ता के साथ अत्याधुनिक संरेखण (alignment) प्राप्त करने के लिए प्रॉम्प्ट जटिलता और युग्मवार विशिष्टता (pairwise distinguishability) के ग्रिड में स्वायत्त रूप से नेविगेट करने में सक्षम बनाता है।