Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap
تقدم هذه الورقة استراتيجية مبتكرة لاختيار البيانات بناءً على الصعوبة لعملية التحسين المباشر للتفضيلات (DPO)، والتي تحدد أمثلة التفضيل الصعبة عبر فجوات مكافأة ضمنية أصغر، مما يحسن كفاءة وأداء محاذاة النموذج بشكل كبير باستخدام 10% فقط من البيانات الأصلية مقارنة بالنماذج المرجعية الحالية.