MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge
تقدم الورقة البحثية MaPPO، وهي طريقة لتحسين التفضيلات تعمم النهج الحالية مثل DPO من خلال دمج معرفة المكافأة المسبقة في هدف "الاحتمال الأقصى اللاحق" (Maximum a Posteriori)، مما يحسن محاذاة النماذج اللغوية الكبيرة عبر مختلف المعايير دون إضافة معلمات فائقة أو التضحية بالكفاءة.