Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models
यह शोध पत्र ट्रांसफॉर्मेशन-ऑगमेंटेड GRPO (TA-GRPO) का प्रस्ताव करता है, जो एक ऐसी विधि है जो मिश्रित रिवॉर्ड्स और विविध तर्क पथों (reasoning paths) को बनाने के लिए समस्या-तुल्य प्रश्न पुनर्रचनाओं (problem-equivalent question rephrasings) को उत्पन्न करके बड़े भाषा मॉडल के तर्क में ग्रेडिएंट वैनिशिंग और डाइवर्सिटी कोलैप्स को कम करती है, जिससे जटिल गणितीय और वैज्ञानिक बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार होता है।