Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty
تقدم هذه الورقة البحثية RLCR (التعلم التعزيزي مع مكافآت المعايرة)، وهو نهج تدريب مبتكر يعزز مكافآت الصحة الثنائية بنتيجة "براير" (Brier score) لتحسين الدقة والثقة المعايرة للنماذج اللغوية في آن واحد، مما يقلل من الهلوسة وتدهور المعايرة الذي غالباً ما يسببه التعلم التعزيزي القياسي.