Likelihood-Based Reward Designs for General LLM Reasoning
تُثبت هذه الورقة بشكل منهجي أن استخدام لوغاريتم الاحتمالية للإجابة المرجعية كإشارة للمكافأة هو أسلوب متفوق ومتعدد الاستخدامات لضبط النماذج اللغوية الكبيرة في مهام الاستنتاج عبر سلسلة الأفكار، حيث يتفوق على المكافآت الثنائية في الإعدادات القابلة للتحقق ويضاهي الضبط الدقيق الخاضع للإشراف في السيناريوهات غير القابلة للتحقق مع تجنب عيوب البدائل القائمة على الاحتمالات.