← नवीनतम पेपर
🤖 machine learning

Hölder Policy Optimisation

यह शोध पत्र HölderPO प्रस्तुत करता है, जो एक सामान्यीकृत पॉलिसी ऑप्टिमाइज़ेशन फ्रेमवर्क है जो ग्रेडिएंट एकाग्रता और वेरिएंस स्थिरता को संतुलित करने के लिए होल्डर मीन पैरामीटर को गतिशील रूप से समायोजित करता है, जिससे ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) में फिक्स्ड एग्रीगेशन की सीमाओं को हल किया जाता है और गणितीय एवं कार्य-उन्मुख बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया जाता है।

मूल लेखक: Yuxiang Chen, Dingli Liang, Yihang Chen, Ziqin Gong, Chenyang Le, Zhaokai Wang, Jiachen Zhu, Lingyu Yang, Jianghao Lin, Weinan Zhang, Jun Wang

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxiang Chen, Dingli Liang, Yihang Chen, Ziqin Gong, Chenyang Le, Zhaokai Wang, Jiachen Zhu, Lingyu Yang, Jianghao Lin, Weinan Zhang, Jun Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े भ्रमित छात्र (एक Large Language Model) को जटिल गणित की समस्याओं को हल करना या एक वीडियो गेम की दुनिया में नेविगेट करना सिखा रहे हैं। आप उन्हें अभ्यास के कई प्रयास देते हैं, और प्रत्येक प्रयास के लिए, आपको यह तय करना होता है: "उनके उत्तर में कौन से विशिष्ट शब्द सही होना सबसे महत्वपूर्ण थे?"

यह वह मुख्य चुनौती है जिसे यह शोध पत्र संबोधित करता है। लेखक एक नई शिक्षण पद्धति प्रस्तावित करते हैं जिसे HölderPO (Hölder Policy Optimisation) कहा जाता है।

सरल उपमाओं का उपयोग करके इसका विवरण यहाँ दिया गया है:

1. समस्या: "एक ही नियम वाला" शिक्षक

पिछले तरीकों (जैसे GRPO) ने एक ऐसे शिक्षक की तरह व्यवहार किया जो हमेशा एक छात्र के निबंध को ग्रेड देने के लिए एक ही नियम का उपयोग करता था।

  • अंकगणितीय माध्य (Arithmetic Mean - मानक GRPO): यह शिक्षक हर शब्द को समान रूप से औसत निकालता है। यदि छात्र 90% शब्द सही लिखता है लेकिन एक कठिन गणित की समस्या में एक महत्वपूर्ण "अहा!" क्षण (aha! moment) को छोड़ देता है, तो शिक्षक उस छूटे हुए क्षण को औसत में केवल एक मामूली सी चूक की तरह मानता है। छात्र उस विशिष्ट गलती से पर्याप्त नहीं सीख पाता है।
  • ज्यामितीय माध्य (Geometric Mean - अन्य विधियाँ): यह शिक्षक बहुत उदार है। वे ग्रेड को इस तरह सुचारू बनाते हैं कि कोई भी एक शब्द बहुत अधिक महत्वपूर्ण न हो जाए। यह उन आसान कार्यों के लिए अच्छा है जहाँ छात्र को बस निरंतर रहने की आवश्यकता होती है, लेकिन कठिन कार्यों पर, यह उन दुर्लभ, महत्वपूर्ण क्षणों को अनदेखा कर देता है जहाँ छात्र ने अंततः कुछ समझ लिया था।

मुद्दा: शोध पत्र ने पाया कि कोई एक "परफेक्ट" नियम नहीं है।

  • कठिन, विरल कार्यों पर (जैसे AIME गणित प्रतियोगिता): सही उत्तर कुछ दुर्लभ, शानदार चरणों पर निर्भर करता है। आपको एक ऐसे शिक्षक की आवश्यकता है जो उन विशिष्ट चरणों पर ज़ूम इन (zoom in) करे और बाकी को अनदेखा करे।
  • सघन कार्यों पर (जैसे मानक गणित का होमवर्क): सही उत्तर कई शब्दों में फैला हुआ होता है। आपको एक ऐसे शिक्षक की आवश्यकता है जो पूरी तस्वीर को देखे ताकि शोर (noise) से भ्रमित न हो।

2. समाधान: "डायल वाला" शिक्षक (HölderPO)

लेखकों ने एक नया सिस्टम बनाया है जिसमें एक एकल डायल (जिसे पैरामीटर pp कहा जाता है) है जो यह नियंत्रित करता है कि शिक्षक छात्र को ग्रेड कैसे देता है।

  • डायल को ऊपर घुमाने पर (High pp): शिक्षक एक स्पॉटलाइट बन जाता है। वे उबाऊ, औसत शब्दों को अनदेखा करते हैं और तीव्रता से उन कुछ शब्दों पर ध्यान केंद्रित करते हैं जो "बेहद सही" या "बेहद गलत" थे। यह एक कोच की तरह है जो चिल्लाकर कहता है, "वह एक चाल जो तुमने चली वह एकदम सही थी! इसे फिर से करो!" यह छात्र को दुर्लभ, कठिन कौशल सीखने में मदद करता है।
  • डायल को नीचे घुमाने पर (Low pp): शिक्षक एक वाइड-एंगल लेंस बन जाता है। वे शब्दों के पूरे क्रम को समान रूप से देखते हैं। यह छात्र को एक छोटी सी चीज़ को परफेक्ट करने के चक्कर में पागल होने से रोकता है और बाकी को अनदेखा करने से बचाता है। यह प्रशिक्षण को स्थिर और शांत रखता है।

3. गुप्त नुस्खा: "डायनेमिक शेड्यूल" (Dynamic Schedule)

शोध पत्र की सबसे बड़ी सफलता यह समझने में है कि आपको डायल को हमेशा एक ही स्थान पर नहीं रखना चाहिए।

एक मैराथन धावक के प्रशिक्षण की कल्पना करें:

  1. प्रारंभिक चरण (द स्प्रिंट): जब धावक नया होता है, तो उसे शुरू करने के लिए विशिष्ट, विस्फोटक गतिविधियों को सीखने की आवश्यकता होती है। आप डायल को ऊपर (High pp) घुमाते हैं। आप चिल्लाते हैं, "उस एक सटीक कदम पर ध्यान केंद्रित करो!" यह दुर्लभ, अच्छे संकेतों को बढ़ाता है ताकि वे आगे बढ़ सकें।
  2. अंतिम चरण (द एंड्योरेंस): एक बार जब वे दौड़ना सीख जाते हैं, तो उन्हें अपने पैरों को लड़खड़ाने से बचाने के लिए एक स्थिर, सुचारू गति बनाए रखने की आवश्यकता होती है। आप डायल को नीचे (Low pp) घुमाते हैं। आप कहते हैं, "अपने पूरे शरीर को संतुलित और सुचारू रखें।" यह उन्हें अत्यधिक सुधार करने और गिरने से रोकता है।

HölderPO स्वचालित रूप से प्रशिक्षण के दौरान डायल को "उच्च" से "निम्न" की ओर ले जाता है। यह "अहा!" क्षणों की आक्रामक रूप से तलाश करने से शुरू होता है और एक स्थिर समापन के लिए सब कुछ सुचारू बनाने के साथ समाप्त होता है।

4. परिणाम: दौड़ जीतना

लेखकों ने इस "डायल शिक्षक" का परीक्षण दो प्रकार की चुनौतियों पर किया:

  • गणित प्रतियोगिताएं (AIME, MATH, आदि): इस डायनेमिक पद्धति ने 54.9% औसत सटीकता प्राप्त की, जिसने पिछले सर्वश्रेष्ठ तरीकों को महत्वपूर्ण अंतर से पीछे छोड़ दिया। इसने सबसे कठिन गणित की समस्याओं (AIME) पर रिकॉर्ड तोड़ दिए क्योंकि यह सफलतापूर्वक उन दुर्लभ, सही तर्क चरणों को बढ़ा सका।
  • रोबोट/एजेंट कार्य (ALFWorld): एक सिम्युलेटेड दुनिया में जहाँ एक एजेंट को वस्तुओं को खोजने, साफ करने और गर्म करने का काम करना होता है, इस पद्धति ने 93.8% सफलता दर हासिल की। यह बहुत बड़ी बात है क्योंकि इसका मतलब है कि एजेंट लंबे, बहु-चरणीय कार्यों के दौरान शायद ही कभी खो जाता है या भ्रमित होता है।

सारांश

HölderPO को एक स्मार्ट प्रशिक्षण कोच के रूप में समझें जो जानता है कि कब छात्र को एक विशिष्ट सफलता पर ध्यान केंद्रित करने के लिए चिल्लाना है और कब उन्हें गलतियाँ करने से बचने के लिए शांत करना है। इन दोनों मोडों के बीच स्वचालित रूप से स्विच करके, यह AI मॉडल को पहले से कहीं अधिक तेज़ी से और अधिक विश्वसनीय रूप से कठिन समस्याओं को हल करना सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →