Credit Assignment with Resets in Language Model Reasoning
تقترح هذه الورقة تحسين الاستدلال في النماذج اللغوية من خلال "تحسين السياسة بالاستعادة العشوائية" (RRPO) و"تحسين السياسة بالاستعادة الذاتية" (SRPO)، وذلك عبر تمكين التخصيص الدقيق للمسؤولية من خلال الاستعادة إلى حالات وسيطة وإعادة أخذ عينات للتكملات، حيث يحقق SRPO أداءً فائقاً من خلال تحديد الأخطاء وتصحيحها ذاتياً دون إشراف خارجي.