Bayesian Preference Learning for Test-Time Steerable Reward Models
تقترح هذه الورقة نموذج نمذجة المكافأة داخل السياق المتغير (ICRM)، وهو إطار عمل بايزي مبتكر يتيح إمكانية التوجيه في وقت الاختبار لنماذج المكافأة من خلال التكيف مع توزيعات التفضيلات غير المرئية عبر نماذج توضيحية داخل السياق، مما يحسن الدقة، والمعايرة، والمواءمة متعددة الأهداف مع توفير ضمانات نظرية ضد الإفراط في التحسين.