Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria
تقدم هذه الورقة "النموذج التلقائي للتقييم كعقاب" (Auto-Rubric as Reward - ARR)، وهو إطار عمل يعمل على مواءمة النماذج التوليدية متعددة الوسائط عبر تحويل التفضيلات الضمنية إلى معايير تقييم صريحة وقابلة للتحقق، وتحسينها عبر "تحسين سياسة معايير التقييم" (Rubric Policy Optimization - RPO)، مما يحقق مواءمة أكثر موثوقية وقابلية للتفسير وكفاءة في البيانات مقارنة بطرق المكافأة التقليدية القائمة على القيم القياسية.