Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
यह शोधपत्र VIGOR को प्रस्तुत करता है, जो एक वर्िफायर-मुक्त (verifier-free) सुदृढीकरण लर्निंग (reinforcement learning) विधि है जो बाहरी वर्िफायर या गोल्ड लेबल पर निर्भर हुए बिना गणितीय तर्क और कोड जनरेशन में LLM के प्रदर्शन को प्रभावी ढंग से सुधारने के लिए स्वयं पॉलिसी मॉडल से प्राप्त आंतरिक ग्रेडिएंट-नॉर्म रिवार्ड्स का लाभ उठाता है।