← नवीनतम पेपर
🤖 machine learning

CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning

यह शोध पत्र CE-GPPO को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो उन क्लिप्ड टोकन से सीमित ग्रेडिएंट्स को पुन: पेश करके पॉलिसी एंट्रॉपी को स्थिर करता है जिन्हें मानक PPO में आमतौर पर त्याग दिया जाता है, जिससे बड़े भाषा मॉडलों में तर्क प्रदर्शन में सुधार होता है।

मूल लेखक: Zhenpeng Su, Leiyu Pan, Minxuan Lv, Yuntao Li, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenpeng Su, Leiyu Pan, Minxuan Lv, Yuntao Li, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: AI को सोचना सिखाना

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान छात्र (AI मॉडल) को कठिन गणित के सवाल हल करने के लिए प्रशिक्षित कर रहे हैं। आप चाहते हैं कि वे नए, अनोखे समाधान खोजने के लिए रचनात्मक (Creative) हों (Exploration), लेकिन साथ ही वे जो काम करता है उस पर टिके रहने के लिए केंद्रित (Focused) भी हों (Exploitation)।

AI की दुनिया में, इस संतुलन को एन्ट्रॉपी (Entropy) कहा जाता है।

  • उच्च एन्ट्रॉपी (High Entropy): छात्र बेतहाशा अंदाज़े लगा रहा है, हर संभव उत्तर आज़मा रहा है। यह नए रास्ते खोजने के लिए अच्छा है, लेकिन परीक्षा पूरी करने के लिए बुरा है।
  • निम्न एन्ट्रॉपी (Low Entropy): छात्र एक विशिष्ट उत्तर पर अटक गया है और कुछ और आज़माने से इनकार कर रहा है। इसे "एन्ट्रॉपी कोलैप्स" (Entropy Collapse) कहा जाता है। यह उस छात्र की तरह है जिसने एक फॉर्मूला रट लिया है और हर उस सवाल में फेल हो जाता है जो उससे मेल नहीं खाता।

समस्या: वह "सुरक्षा जाल" जो अच्छे विचारों को काट देता है

इन AI छात्रों को प्रशिक्षित करने का मानक तरीका PPO (प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन) नामक एक विधि है। PPO को एक सख्त शिक्षक के रूप में समझें जिसके पास एक "सुरक्षा जाल" (Safety Net) है।

  • यह कैसे काम करता है: यदि छात्र ऐसा उत्तर सुझाता है जो उनके सामान्य उत्तरों से बहुत अलग है (एक लो-प्रोबेबिलिटी टोकन), तो शिक्षक जाँच करता है: "क्या यह बहुत जोखिम भरा है?"
  • समस्या: यदि उत्तर बहुत अलग है, तो शिक्षक फीडबैक को क्लिप (Clip) कर देता है (यानी काट देता है)। वे कहते हैं, "नहीं, हम इससे नहीं सीखेंगे।"
  • गलती: शोध में पाया गया कि यह सुरक्षा जाल बहुत अधिक आक्रामक है। यह दो प्रकार के मूल्यवान फीडबैक को काट देता है:
    1. "प्रतिभाशाली" अंदाज़े (The "Genius" Guesses): कभी-कभी, छात्र एक जंगली अंदाज़ा लगाता है जो बहुत शानदार साबित होता है। शिक्षक इसे काट देता है, जिससे छात्र कभी रचनात्मक बनना नहीं सीख पाता। (परिणाम: एन्ट्रॉपी कोलैप्स)।
    2. "बुरी" आदतें (The "Bad" Habits): कभी-कभी, छात्र एक बुरी आदत पर अटक जाता है। शिक्षक को उन्हें इसे छोड़ने के लिए मजबूती से कहना चाहिए। लेकिन यदि शिक्षक इस फीडबैक को काट देता है, तो छात्र बिना किसी दिशा के भटकता रहता है। (परिणाम: एन्ट्रॉपी एक्सप्लोजन)।

समाधान: CE-GPPO (एक "कोमल मार्गदर्शक")

लेखक CE-GPPO नामक एक नई विधि प्रस्तावित करते हैं। "जोखिम भरे" उत्तरों से फीडबैक को काटने के बजाय, वे शिक्षक को उन्हें सुनने देते हैं, लेकिन केवल आवाज़ (Volume) को एडजस्ट करते हैं।

इसे एक स्टीरियो के वॉल्यूम नॉब (Volume Knob) की तरह समझें:

  • "प्रतिभाशाली" अंदाज़े (PA&LP टोकन): ये जंगली, रचनात्मक विचार हैं। CE-GPPO इनकी आवाज़ बढ़ा (UP) देता है। यह कहता है, "हे, भले ही यह एक जोखिम भरा अंदाज़ा था, लेकिन यह अच्छा हो सकता है! आइए इसे ध्यान से सुनें ताकि हम बहुत उबाऊ न हो जाएं।" यह छात्र को रचनात्मक बनाए रखता है।
  • "बुरी" आदतें (NA&LP टोकन): ये गलतियाँ हैं। CE-GPPO इनकी आवाज़ को थोड़ा कम (DOWN) कर देता है। यह कहता है, "हम जानते हैं कि यह एक गलती है, लेकिन आइए घबराएं नहीं और अत्यधिक सुधार करने की कोशिश न करें। बस छात्र को वापस सही रास्ते पर लाएं।" यह छात्र को भ्रमित होने और बहुत दूर भटकने से रोकता है।

यह बेहतर क्यों है?

पुरानी विधि (PPO/GRGRO) में, शिक्षक एक क्लब के बाउंसर की तरह था जो उन सभी को बाहर निकाल देता था जो बहुत अलग दिखते थे।

  • परिणाम: क्लब उबाऊ हो गया (एन्ट्रॉपी कोलैप्स), या बाउंसर ने उन सभी को बाहर निकाल दिया जिन्होंने जाने की कोशिश की, जिससे दंगा हो गया (एन्ट्रॉपी एक्सप्लोजन)।

CE-GPPO के साथ, शिक्षक एक कोमल मार्गदर्शक (Gentle Guide) है:

  1. वे आउटलेयर्स (Outliers) को सुनते हैं: वे अजीब विचारों को अनदेखा नहीं करते; वे बस उन्हें सावधानी से तौलते हैं।
  2. वे संतुलन बनाए रखते हैं: वे सुनिश्चित करते हैं कि छात्र नए समाधान खोजने के लिए पर्याप्त जिज्ञासु बना रहे, लेकिन समस्या को वास्तव में हल करने के लिए पर्याप्त केंद्रित भी रहे।

परिणाम: स्मार्ट AI

शोधकर्ताओं ने इसका परीक्षण गणित और कोडिंग की समस्याओं पर किया।

  • पुराना तरीका: AI या तो एक ही ढर्रे में फंस जाता था या पागलों की तरह अंदाज़े लगाने लगता था।
  • नया तरीका (CE-GPPO): AI स्थिर रहा। वह न तो उबाऊ हुआ और न ही भ्रमित।
  • परिणाम: AI ने पिछली विधियों की तुलना में काफी कठिन गणितीय समस्याओं (जैसे AIME और HMMT प्रतियोगिताएं) को हल किया। यह छोटे और बड़े दोनों प्रकार के AI मॉडल पर बेहतर काम कर गया।

सारांश उपमा (Summary Analogy)

कल्पना कीजिए कि आप साइकिल चलाना सीख रहे हैं।

  • पुरानी विधि (PPO): यदि आप बहुत अधिक बाईं या दाईं ओर झुकते हैं, तो कोई हैंडल पकड़ लेता है और आपको तुरंत सीधा कर देता है। आप कभी भी अपने दम पर संतुलन बनाना नहीं सीख पाते, और आप झुकने की कोशिश करने से डर जाते हैं।
  • CE-GPPO: यदि आप बहुत अधिक झुकते हैं, तो कोई आपको धीरे से वापस लाता है लेकिन आपको झुकने का अनुभव भी करने देता है। वे कहते हैं, "ओह, यह थोड़ा ज़्यादा था, लेकिन आपने लगभग कर लिया था! अगली बार थोड़ा कम झुकने की कोशिश करें।" आप संतुलन बनाना, स्थिर रहना और अंततः तेज़ी से और दूर तक चलना सीखते हैं।

संक्षेप में: CE-GPPO "आउटलेयर" विचारों को अनदेखा करने के बजाय उन्हें सुनकर AI के प्रशिक्षण को ठीक करता है, जिससे AI रचनात्मक और स्थिर दोनों बना रहता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →