Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models
تقدم هذه الورقة البحثية Diffusion LAIR، وهي طريقة مبتكرة لتحسين التفضيل القائم على القوائم (listwise preference optimization) تستفيد من درجات المكافأة المستمرة والانحدار الموزون بالميزة (advantage-weighted regression) لمواءمة نماذج الانتشار من نص إلى صورة بشكل أكثر فعالية من النهج التقليدي القائم على الأزواج (pairwise approaches)، مما يظهر أداءً فائقاً عبر مختلف معايير التوليد والتحرير.