Future-KL Regularized GRPO: Process-Level Credit Assignment from -Divergence Regularization
यह शोध पत्र फ्यूचर-केएल रेगुलराइज्ड पॉलिसी ऑप्टिमाइज़ेशन (FRPO) को प्रस्तुत करता है, जो एक क्रिटिक-फ्री विधि है जो -डाइवर्जेंस से व्युत्पन्न एक कॉज़ल फ्यूचर-रेगुलराइजेशन रिटर्न-टू-गो को शामिल करके GRPO के टोकन-लेवल KL रेगुलराइजेशन को ठीक करती है, जिससे उच्च एंट्रॉपी और कम पॉलिसी ड्रिफ्ट बनाए रखते हुए गणितीय तर्क प्रदर्शन में सुधार होता है।