Reward Learning from Best-of- Preference Data: Targets, Tradeoffs, and Design Principles
تحلل هذه الورقة تعلم المكافأة من بيانات التفضيل من نوع "الأفضل من N" عبر اشتقاق أهداف ذات صيغة مغلقة للمتغيرات المستقلة، وتوصيف المقايضة بين الهامش والاتصال التي تملي الاختيار الأمثل لـ N، واقتراح مبادئ تصميمية لموازنة تكاليف التوليد مقابل كفاءة التسمية.