Reinforcement Learning with Conditional Expectation Reward
تقترح هذه الورقة "مكافأة التوقع الشرطي" (CER)، وهي طريقة جديدة للتعلم التعزيزي تستخدم النموذج اللغوي الكبير نفسه كمدقق ضمني لتوفير إشارات مكافأة ناعمة ومتدرجة، مما يتغلب على قيود التحقق القائم على القواعد ويُمكّن من تدريب الاستدلال الفعال عبر كل من مجالات الرياضيات والمجالات العامة للإجابات الحرة.