Hölder Policy Optimisation
यह शोध पत्र HölderPO प्रस्तुत करता है, जो एक सामान्यीकृत पॉलिसी ऑप्टिमाइज़ेशन फ्रेमवर्क है जो ग्रेडिएंट एकाग्रता और वेरिएंस स्थिरता को संतुलित करने के लिए होल्डर मीन पैरामीटर को गतिशील रूप से समायोजित करता है, जिससे ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) में फिक्स्ड एग्रीगेशन की सीमाओं को हल किया जाता है और गणितीय एवं कार्य-उन्मुख बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया जाता है।