MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following
यह शोध पत्र MDP-GRPO को प्रस्तुत करता है, जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (Group Relative Policy Optimization) का एक स्थिर संस्करण है, जो डिस्क्रीट (discrete), लो-डिस्पर्शन रिवॉर्ड सेटिंग्स में अस्थिरता को दूर करने के लिए मल्टी-टेम्परेचर सैंपलिंग, ड्यूल-एंकर एडवांटेज, प्रॉस्पेक्ट-थ्योरेटिक शेपिंग और एसिमेट्रिक KL रेगुलराइजेशन का उपयोग करता है, जिससे मल्टी-कन्स्ट्रेंट इंस्ट्रक्शन फॉलोइंग प्रदर्शन में महत्वपूर्ण सुधार होता है।