← नवीनतम पेपर
💬 NLP

MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following

यह शोध पत्र MDP-GRPO को प्रस्तुत करता है, जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (Group Relative Policy Optimization) का एक स्थिर संस्करण है, जो डिस्क्रीट (discrete), लो-डिस्पर्शन रिवॉर्ड सेटिंग्स में अस्थिरता को दूर करने के लिए मल्टी-टेम्परेचर सैंपलिंग, ड्यूल-एंकर एडवांटेज, प्रॉस्पेक्ट-थ्योरेटिक शेपिंग और एसिमेट्रिक KL रेगुलराइजेशन का उपयोग करता है, जिससे मल्टी-कन्स्ट्रेंट इंस्ट्रक्शन फॉलोइंग प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili, Mohammad Javad Dousti

प्रकाशित 2026-06-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili, Mohammad Javad Dousti

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली लेकिन थोड़े अराजक शेफ (AI) को एक बहुत ही विशिष्ट रेसिपी का पालन करना सिखा रहे हैं। वह रेसिपी केवल "केक बनाएं" जैसी नहीं है; यह नियमों की एक सख्त सूची है: "ठीक 3 अंडे उपयोग करें," "चॉकलेट का उपयोग न करें," "निर्देशों को सभी बड़े अक्षरों (ALL CAPS) में लिखें," और "नोट को 'Bon Appétit' वाक्यांश के साथ समाप्त करें।"

AI की दुनिया में, इसे Multi-Constraint Instruction Following कहा जाता है। समस्या यह है कि मानक AI प्रशिक्षण विधियां अक्सर भ्रमित हो जाती हैं जब नियम इतने सख्त होते हैं।

यहाँ पेपर के समाधान, MDP-GRPO का रोजमर्रा के उदाहरणों का उपयोग करते हुए एक सरल विवरण दिया गया है।

समस्या: "ग्रुप ग्रेड" का जाल (The "Group Grade" Trap)

पेपर यह समझाते हुए शुरू करता है कि वर्तमान AI प्रशिक्षण (जिसे GRPO कहा जाता है) कैसे काम करता है। कल्पना कीजिए कि एक शिक्षक 8 छात्रों (AI के प्रयासों) के एक समूह को एक साथ क्विज़ दे रहा है। प्रत्येक छात्र को एक आदर्श मानक के विरुद्ध ग्रेड देने के बजाय, शिक्षक उन्हें एक-दूसरे के सापेक्ष ग्रेड देता है।

  • यदि 7 छात्रों को "C" मिलता है और 1 छात्र को "B" मिलता है, तो "B" वाले छात्र को बहुत बड़ा बोनस मिलता है, और "C" वाले छात्रों को बहुत बड़ी पेनल्टी मिलती है।
  • द ग्लिच (The Glitch): सख्त नियम पालन में, यह आम है कि समूह में सभी को एक ही स्कोर मिले (उदाहरण के लिए, सभी ने "all caps" नियम का पालन करने में विफल रहे)।
    • जीरो-वैरिएंस कोलैप्स (Zero-Variance Collapse): यदि सभी को "0" मिलता है, तो शिक्षक के पास यह बताने का कोई तरीका नहीं है कि किसने बेहतर किया। "ग्रेड" सभी के लिए शून्य हो जाता है, और AI कुछ भी नहीं सीख पाता।
    • मीन-सेंटरिंग ब्लाइंडनेस (Mean-Centering Blindness): यदि छात्रों का एक समूह बुरी तरह विफल होता है, और दूसरे समूह का भी बुरी तरह विफल होता है, तो शिक्षक उन्हें समान मानता है क्योंकि वे अपने स्वयं के समूह के सापेक्ष "समान रूप से बुरे" हैं। AI को पता नहीं चलता कि उसने कौन सा विशिष्ट नियम तोड़ा है।
    • लो-वैरिएंस एम्प्लीफिकेशन (Low-Variance Amplification): यदि स्कोर 99, 100, 100, 100 हैं, तो 99 और 100 के बीच के मामूली अंतर को बहुत बड़ा बना दिया जाता है, जिससे AI अत्यधिक प्रतिक्रिया करता है और अस्थिर हो जाता है।

समाधान: MDP-GRPO

लेखक इन ग्लिच को ठीक करने के लिए चार "उपकरणों" के साथ एक नया प्रशिक्षण तरीका प्रस्तावित करते हैं। इसे शिक्षक के ग्रेडिंग सिस्टम को अपग्रेड करने के रूप में समझें।

1. "फ्लेवर मिक्सर" (Multi-Temperature Sampling)

  • समस्या: यदि आप AI को एक कहानी के 8 संस्करण लिखने के लिए कहते हैं, तो वह 8 लगभग एक जैसे ही संस्करण लिख सकता है। यदि वे सभी समान हैं, तो उन सभी को एक ही स्कोर मिलेगा, और प्रशिक्षण रुक जाएगा।
  • समाधान: लेखक AI को ये 8 कहानियाँ अलग-अलग "रचनात्मकता स्तरों" (creativity levels) का उपयोग करके लिखने के लिए कहते हैं। कुछ बहुत ही सख्त (low temperature) तरीके से लिखी जाती हैं, और कुछ बहुत ही जंगली और रचनात्मक (high temperature) तरीके से।
  • परिणाम: यह सुनिश्चित करता है कि भले ही नियम कठिन हों, 8 प्रयास इतने अलग होंगे कि उनके स्कोर अलग-अलग हों। यह "सभी को शून्य मिला" वाली समस्या को रोकता है।

2. "दो-एंकर" प्रणाली (Dual-Anchor Advantages)

  • समस्या: जब समूह अस्त-व्यस्त होता है (सब विफल हो जाते हैं), तो "सापेक्ष ग्रेडिंग" प्रणाली टूट जाती है।
  • समाधान: छात्रों की आपस में तुलना करने के बजाय, शिक्षक एक निश्चित, काल्पनिक "तटस्थ छात्र" (Neutral Student) के साथ भी उनकी तुलना करता है।
    • कल्पना कीजिए कि एक "तटस्थ छात्र" जो भाग्यवश नियमों के 50% को सही करता है।
    • यदि AI का समूह इस तटस्थ छात्र से भी खराब प्रदर्शन कर रहा है, तो AI को एक स्पष्ट संकेत मिलता है: "आप औसत से भी खराब कर रहे हैं, और मेहनत करें!"
    • यह AI को एक लर्निंग सिग्नल देता है भले ही पूरा समूह विफल हो रहा हो, जिससे "पूर्ण प्रदर्शन के प्रति अंधापन" दूर होता है।

3. "मानवीय नुकसान का डर" (Prospect-Theoretic Shaping)

  • समस्या: मानक प्रशिक्षण एक छोटी जीत और एक छोटे नुकसान को समान लेकिन विपरीत मानता है। लेकिन वास्तविक जीवन में, मनुष्य जीतने की खुशी से कहीं अधिक हारने के दर्द को महसूस करते हैं।
  • समाधान: लेखक अर्थशास्त्र की एक अवधारणा प्रॉस्पेक्ट थ्योरी (Prospect Theory) का उपयोग करते हैं। वे AI को इस तरह प्रोग्राम करते हैं कि वह नियम तोड़ने के "दर्द" को नियम का पालन करने की "खुशी" की तुलना में बहुत अधिक तीव्रता से महसूस करे।
    • यदि AI एक नियम तोड़ता है, तो दंड बहुत बड़ा और तीखा होता है।
    • यदि AI एक नियम का पालन करता है, तो इनाम सीमित और सौम्य होता है।
    • यह AI को बहुत लापरवाह होने से रोकता है और उसे सख्त बाधाओं के प्रति बहुत सावधान रहने के लिए मजबूर करता है।

4. "असिमेट्रिक सीटबेल्ट" (Asymmetric KL Regularization)

  • समस्या: कभी-कभी, नियमों का पालन करने के प्रयास में, AI सामान्य रूप से बोलना भूल जाता है या बहुत अधिक कठोर हो जाता है।
  • समाधान: वे AI के बदलावों पर एक "सीटबेल्ट" लगाते हैं।
    • यदि AI सुधार कर रहा है (नियमों का बेहतर पालन कर रहा है), तो सीटबेल्ट ढीली होती है, जिससे बड़े बदलावों की अनुमति मिलती है।
    • यदि AI खराब हो रहा है (नियम तोड़ रहा है), तो सीटबेल्ट तुरंत कस जाती है, जिससे बड़ी और हानिकारक गलतियों को रोका जा सके।

परिणाम

लेखकों ने Llama-3.2 और Gemma-2 जैसे मॉडलों पर इस नई पद्धति का परीक्षण किया।

  • नियमों में बेहतर: AI सख्त, बहु-चरणीय निर्देशों का पालन करने में काफी बेहतर हो गया (सख्त सफलता दर में 5% तक सुधार)।
  • स्थिर शिक्षण: जब AI विफलताओं की दीवार से टकराया, तब भी प्रशिक्षण क्रैश या भ्रमित नहीं हुआ।
  • अभी भी स्मार्ट: महत्वपूर्ण बात यह है कि इन सख्त नियमों को सीखते समय AI ने अपना सामान्य ज्ञान (जैसे सामान्य ज्ञान के प्रश्नों का उत्तर देना या तर्क पहेलियाँ सुलझाना) नहीं खोया।

सारांश

यह पेपर तर्क देता है कि AI को सख्त, कई नियमों का पालन करना सिखाना एक शेफ को 10 छोटे, विशिष्ट प्रतिबंधों वाली रेसिपी सिखाने जैसा है। मानक विधियां विफल हो जाती हैं क्योंकि वे भ्रमित हो जाती हैं जब पूरी क्लास विफल हो जाती है। MDP-GRPO इसे निम्न प्रकार से ठीक करता है:

  1. अभ्यास प्रयासों को अधिक विविध बनाना।
  2. एक निश्चित संदर्भ बिंदु देना ताकि विफल होने पर भी AI जान सके कि वह कैसा प्रदर्शन कर रहा है।
  3. AI को गलतियों से "डरना" सिखाना बजाय इसके कि वह सफलता को "प्यार" करे।
  4. जब AI फिसल जाए, तो उसे बहुत अधिक नाटकीय बदलाव करने से रोकना।

परिणामस्वरूप, एक ऐसा AI प्राप्त होता है जो अपनी सामान्य बुद्धिमत्ता को खोए बिना जटिल, सख्त निर्देशों का पालन करने में बहुत अधिक विश्वसनीय है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →