Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling
यह शोध पत्र डीप डेंस एक्सप्लोरेशन (DDE) का प्रस्ताव करता है, जो DEEP-GRPO के रूप में स्थापित एक नवीन रणनीति है जो असफल प्रक्षेप पथों (trajectories) के भीतर "पिवट" अवस्थाओं की पहचान करके और उन्हें सघन रूप से पुन: नमूनाकरण (resampling) करके LLM सुदृढीकरण शिक्षण (reinforcement learning) को उन्नत करती है ताकि उच्च गुणवत्ता वाले समाधानों को कुशलतापूर्वक खोजा जा सके, जिससे यह गणितीय तर्क संबंधी बेंचमार्क पर मौजूदा GRPO और ट्री-आधारित विधियों से बेहतर प्रदर्शन करती है।