Back to Blackwell: Closing the Loop on Intransitivity in Multi-Objective Preference Fine-Tuning
यह योगदान को प्रस्तुत करता है, जो बिना स्केलिंग के मल्टी-ऑब्जेक्टिव प्रेफरेंसेस को फाइन-ट्यून करने में इंट्रान्ज़िटिव प्रेफरेंसेस (intransitive preferences) को संबोधित करने के लिए मैक्सिमम-एन्ट्रॉपी ब्लैकवेल विनर (Maximum-Entropy Blackwell Winner) की गेम-थ्योरेटिक अवधारणा पर आधारित एक प्रमाणित रूप से कुशल एल्गोरिदम है, जो मल्टी-ऑब्जेक्टिव इवैल्यूएशन फीडबैक का उपयोग करके लार्ज लैंग्वेज मॉडल्स पर बेहतर प्रदर्शन प्रदर्शित करता है।