MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge
यह शोध पत्र MaPPO को प्रस्तुत करता है, जो एक प्राथमिकता अनुकूलन (preference optimization) विधि है जो पूर्व रिवॉर्ड ज्ञान को मैक्सिमम अ पोस्टीरियर (Maximum a Posteriori) उद्देश्य में शामिल करके DPO जैसे मौजूदा दृष्टिकोणों का सामान्यीकरण करती है, जिससे बिना किसी हाइपरपैरामीटर को जोड़े या दक्षता से समझौता किए विभिन्न बेंचमार्क पर LLM संरेखण (alignment) में सुधार होता है।