Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression
تقدم هذه الورقة البحثية "المكافأة المدركة للتوزيع" (Distribution-Aware Reward)، وهي هدف للتعلم التعزيزي يعمل على تحسين النماذج اللغوية الكبيرة لتوليد توزيعات تنبؤية معايرة لمهام الانحدار من خلال تقييم عينات متعددة تم فك تشفيرها باستخدام درجة الاحتمالية المستمرة المرتبة (Continuous Ranked Probability Score)، مما يؤدي إلى تحسين تقدير عدم اليقين، وأداء التصنيف، والمتانة مقارنة بطرق تدريب التقدير النقطي التقليدية.