Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
تقدم هذه الورقة VIGOR، وهو أسلوب تعلّم تعزيزي خالٍ من المُحقِّق (verifier-free) يستفيد من مكافآت معيار التدرج الجوهري المستمدة من نموذج السياسة نفسه لتحسين أداء النماذج اللغوية الكبيرة في الاستدلال الرياضي وتوليد الكود بشكل فعال دون الاعتماد على مُحقِّقات خارجية أو تسميات ذهبية.