← नवीनतम पेपर
🤖 machine learning

Sharpness-Guided Group Relative Policy Optimization via Probability Shaping

यह शोध पत्र शार्पनेस-गाइडेड GRPO (GRPO-SG) का प्रस्ताव करता है, जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (Group Relative Policy Optimization) का एक टोकन-वेटेड वेरिएंट है, जो शार्पनेस को कम करने और प्रशिक्षण को स्थिर करने के लिए बड़े ग्रेडिएंट्स उत्पन्न करने वाले टोकन्स को डाउनवेट करके, सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) में सामान्यीकरण (generalization) में सुधार करता है।

मूल लेखक: Tue Le, Linh Ngo Van, Trung Le

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tue Le, Linh Ngo Van, Trung Le

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान छात्र (एक लार्ज लैंग्वेज मॉडल) को कठिन पहेलियाँ, जैसे गणित के सवाल या तर्क संबंधी पहेलियाँ हल करना सिखा रहे हैं। आप उन्हें हर एक कदम पर ग्रेड देने के लिए कोई शिक्षक नहीं देते; इसके बजाय, आप अंत में एक "चेकलिस्ट" देते हैं। यदि अंतिम उत्तर सही है, तो उन्हें एक गोल्ड स्टार (इनाम) मिलता है। यदि यह गलत है, तो उन्हें कुछ नहीं मिलता। इसे रिनफोर्समेंट लर्निंग विद वेरिफिएबल रिवार्ड्स (RLVR) कहा जाता है।

वर्तमान में, इस बुद्धिमान छात्र को सिखाने का सबसे लोकप्रिय तरीका GRPO है। GRPO को एक कोच की तरह समझें जो कहता है, "ठीक है, इस समस्या को हल करने के 5 अलग-अलग तरीके आजमाओ। वे जिन्हें गोल्ड स्टार मिला, वे अच्छे हैं; वे जो विफल रहे, वे बुरे हैं। आइए छात्र के मस्तिष्क को विजेताओं जैसा बनाने और हारने वालों से कम करने के लिए इसे एडजस्ट करें।"

समस्या: "अति-उत्साही" छात्र

पेपर का तर्क है कि जबकि GRPO अच्छी तरह से काम करता है, यह कभी-कभी थोड़ा अधिक आक्रामक हो सकता है। कल्पना कीजिए कि छात्र सीखने की कोशिश कर रहा है। जब वह किसी विशिष्ट शब्द या चरण में गलती करता है, तो कोच उसे सुधारने के लिए बहुत ज़ोर से चिल्ला सकता है। गणित के शब्दों में, यह एक "शार्प" अपडेट बनाता है—छात्र के मस्तिष्क में एक बहुत बड़ा, झटकेदार बदलाव।

हालांकि यह तत्काल गलती को ठीक कर सकता है, लेकिन यह छात्र को अस्थिर बना सकता है। वे उन समान समस्याओं को हल करने का तरीका भूल सकते हैं जिन्हें वे पहले से जानते थे, या वे उन छोटी बारीकियों पर अत्यधिक प्रतिक्रिया दे सकते हैं जो महत्वपूर्ण नहीं हैं। पेपर की भाषा में, इसे हाई शार्पनेस (high sharpness) कहा जाता है, जिससे खराब जनरलाइजेशन (generalization) होता है (अनदेखी, नई समस्याओं को संभालने की क्षमता)।

समाधान: "कॉन्फिडेंस मीटर" (GRPO-SG)

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे GRPO-SG (शार्पनेस-गाइडेड GRPO) कहा जाता है।

यहाँ सरल उपमा दी गई है:
कल्पना कीजिए कि छात्र एक कहानी लिख रहा है।

  • उच्च-विश्वास वाले शब्द (High-Confidence Words): ये वे शब्द हैं जिनमें छात्र 100% आश्वस्त है, जैसे "the" या "and," या महत्वपूर्ण गणितीय प्रतीक जैसे "+" या "="। छात्र जानता है कि वाक्य को अर्थपूर्ण बनाने के लिए ये अत्यंत महत्वपूर्ण हैं।
  • कम-विश्वास वाले शब्द (Low-Confidence Words): ये वे शब्द हैं जिनका छात्र अनुमान लगा रहा है, जैसे कोई फैंसी विशेषण या कोई विशिष्ट संख्या जिसके बारे में वह सुनिश्चित नहीं है।

पुराने तरीके (GRPO) में, यदि छात्र एक कम-विश्वास वाले शब्द का अनुमान लगाता है और गलत हो जाता है, तो कोच चिल्लाता है, "नहीं! अपने पूरे मस्तिष्क को बदल डालो!" इससे एक बड़ा, "शार्प" अपडेट होता है जो अन्य चीजों को तोड़ सकता है।

GRPO-SG एक बुद्धिमान कोच की तरह कार्य करता है जो छात्र के "कॉन्फिडेंस मीटर" को देखने के बाद ही चिल्लाता है।

  • यदि छात्र अनिश्चित है (कम विश्वास) और गलती करता है, तो कोच धीरे से कहता है, "ठीक है, अगली बार थोड़ा अधिक सावधान रहने की कोशिश करते हैं," लेकिन कोई बड़ा बदलाव नहीं करता है। यह छात्र को घबराने और अत्यधिक सुधार करने से रोकता है।
  • यदि छात्र निश्चित है (उच्च विश्वास) और सही होता है, तो कोच उस अच्छी आदत को पुख्ता करने के लिए एक मजबूत सकारात्मक धक्का देता है।

यह कैसे काम करता है (प्रॉबेबिलिटी शेपिंग)

पेपर प्रॉबेबिलिटी शेपिंग (Probability Shaping) नामक एक गणितीय ट्रिक का उपयोग करता है।

  1. सिस्टम यह जांचता है कि मॉडल ने अभी जो शब्द चुना है उसके बारे में वह कितना आश्वस्त है (यह "लॉगिट" के आधार पर होता है, जो केवल एक स्कोर है कि उस शब्द की कितनी संभावना है)।
  2. यदि स्कोर कम है (मॉडल अनुमान लगा रहा है), तो सिस्टम सबक के महत्व को डाउनवेट (downweight) कर देता है। यह कहता है, "इस एक गलती को अपनी पूरी नींव को हिलाने न दें।"
  3. यदि स्कोर उच्च है (मॉडल आश्वस्त है), तो सिस्टम सबक को अपवेट (upweight) करता है। यह कहता है, "यह एक ठोस कदम है; आइए सुनिश्चित करें कि हम इसे करते रहें।"

परिणाम: सुगम यात्रा

पेपर ने इस नए तरीके का परीक्षण तीन प्रकार की चुनौतियों पर किया:

  1. गणित: ओलंपियाड-स्तर की गणित की समस्याओं को हल करना।
  2. तर्क (Logic): "नाइट्स एंड केव्स" (Knights and Knaves) पहेलियों को हल करना (जहाँ कुछ लोग हमेशा झूठ बोलते हैं और कुछ हमेशा सच बोलते हैं)।
  3. टूल यूज़ (Tool Use): उत्तर खोजने के लिए सर्च इंजन का उपयोग करने के लिए AI को कहना।

क्या हुआ?

  • बेहतर स्कोर: नया तरीका (GRPO-SG) इन सभी परीक्षणों पर पुराने तरीके (GRPO) की तुलना में लगातार उच्च स्कोर प्राप्त करता है। उदाहरण के लिए, तर्क पहेलियों पर, सफलता दर काफी बढ़ गई।
  • सुचारू शिक्षण: यदि आप "ग्रेडिएंट नॉर्म" (छात्र के मस्तिष्क में होने वाले बदलाव का एक माप) को देखते, तो नया तरीका बहुत सुचारू था। इसमें अत्यधिक सुधार के वे जंगली स्पाइक्स (spikes) नहीं थे। यह शीर्ष तक पहुँचने के लिए एक स्थिर, शांत यात्रा थी।

सारांश

पेपर का दावा है कि केवल AI को कम-विश्वास वाले अनुमानों के "पैनिक" को अनदेखा करने और उच्च-विश्वास वाले कदमों को पुख्ता करने पर ध्यान केंद्रित करने के लिए कहकर, हम स्मार्ट, अधिक स्थिर और अधिक जनरलाइज़ेबल रीजनिंग मॉडल को प्रशिक्षित कर सकते हैं। यह एक छात्र को यह सिखाने जैसा है कि वह जो जानता है उस पर अपने अंतर्ज्ञान पर भरोसा करे और उन चीजों के लिए घबराए नहीं जिनके बारे में वह अभी भी केवल अनुमान लगा रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →