Distributionally Robust Listwise Preference Optimization
यह शोध पत्र एक प्लैकेट-लूस (Plackett-Luce) उद्देश्य पर आधारित एक सुलभ, वितरण रूप से सुदृढ़ (distributionally robust) लिस्टवाइज प्रेफरेंस ऑप्टिमाइज़ेशन फ्रेमवर्क प्रस्तावित करता है जो सबसे खराब स्थिति के सुधार (worst-case correction) को जटिलता तक कम करके रैंकिंग-लेबल अनिश्चितता को कुशलतापूर्वक संभालता है, जिससे ऑफलाइन और ऑनलाइन दोनों भाषा मॉडल संरेखण (language model alignment) में मजबूती और प्रदर्शन में सुधार होता है।