Leveraging Error Diversity in Group Rollouts for Reinforcement Learning
यह शोध पत्र एरर डाइवर्सिटी एडवांटेज शेपिंग (EDAS) को प्रस्तुत करता है, जो एक हल्का पोस्ट-हॉक तकनीक है जो इंट्रा-ग्रुप एरर डाइवर्सिटी के आधार पर एडवांटेज सिग्नल्स को मॉड्युलेट करके रिइन्फोर्समेंट लर्निंग फ्रॉम वेरिफिएबल रिवार्ड्स (RLVR) को बेहतर बनाता है ताकि बार-बार होने वाली विफलताओं को दंडित किया जा सके और खोजपूर्ण तर्क (एक्सप्लोरेटरी रीजनिंग) को प्रोत्साहित किया जा सके, जिसके परिणामस्वरूप कई बेंचमार्क पर निरंतर प्रदर्शन सुधार प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक छात्र को एक बहुत कठिन गणितीय समस्या हल करना सिखा रहे हैं। आप उनसे कहते हैं कि वे इसे लगातार 10 बार हल करने की कोशिश करें।
पुराने तरीके में (स्टैंडर्ड रीइन्फोर्समेंट लर्निंग), यदि छात्र उत्तर गलत देता है, तो आप बस कहते हैं, "यह गलत है, फिर से प्रयास करें।" आप हर गलती के साथ एक जैसा व्यवहार करते हैं, चाहे उन्होंने वह गलती किसी भी तरह से की हो।
लेकिन इस शोध पत्र के लेखकों ने कुछ दिलचस्प देखा: सभी गलतियाँ एक समान नहीं होतीं।
बड़ी खोज: "मिस्टेक पार्टी" बनाम "ब्रोकन रिकॉर्ड"
शोधकर्ताओं ने एक ही समस्या के 10 प्रयासों के समूहों का अध्ययन किया। उन्होंने दो बहुत अलग परिदृश्य देखे:
- ब्रोकन रिकॉर्ड (समरूप त्रुटियाँ - Homogeneous Errors): छात्र 10 बार प्रयास करता है, और हर बार, वह बिल्कुल एक ही गलती करता है। शायद वे सभी एक ही जगह पर 'कैरी' करना भूल जाते हैं, या वे सभी एक ही तरह से प्रश्न को गलत पढ़ लेते हैं।
- परिणाम: छात्र अटक जाता है। वह एक ही दीवार से टकराता रहता है, और वह बहुत कम सीख पाता है क्योंकि वह विफल होने के नए तरीके खोजने में सक्षम नहीं होता।
- मिस्टेक पार्टी (विविध त्रुटियाँ - Diverse Errors): छात्र 10 बार प्रयास करता है, और वे 10 अलग-अलग तरीकों से विफल होता है। एक बार वे एक चरण भूल जाते हैं, दूसरी बार वे गलत फॉर्मूला का उपयोग करते हैं, और तीसरी बार वे गणना में गलती करते हैं।
- परिणाम: यह सीखने के लिए एक खजाना है! क्योंकि छात्र ने कई अलग-अलग रास्तों को अपनाया, भले ही वे गलत थे, शिक्षक (AI ट्रेनिंग सिस्टम) ठीक से देख सकता है कि तर्क कहाँ टूट रहा है और वह छात्र का बेहतर मार्गदर्शन कर सकता है।
इस शोध पत्र का मुख्य दावा: यदि प्रयासों के एक समूह में गलत उत्तरों की एक विस्तृत विविधता है, तो AI बहुत तेज़ी से सीखता है। यदि सभी एक ही गलती करते हैं, तो सीखना रुक जाता है।
समाधान: EDAS (एक "स्मार्ट कोच")
इसे ठीक करने के लिए, लेखकों ने EDAS (एरर डाइवर्सिटी एडवांटेज शेपिंग) नामक एक नई तकनीक बनाई। EDAS को एक सुपर-स्मार्ट कोच के रूप में समझें जो छात्र के 10 प्रयासों को देखता है और गलतियों की विविधता के आधार पर फीडबैक को एडजस्ट करता है।
EDAS कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:
- "ब्रोकन रिकॉर्ड" पेनल्टी: यदि छात्र लगातार 10 बार एक ही गलती करता है (एक टूटे हुए रिकॉर्ड की तरह), तो EDAS कहता है, "ठीक है, तुम एक लूप में फंस गए हो। हमें तुम्हें इससे बाहर निकालने के लिए इस पर भारी दंड देने की आवश्यकता है।" यह उस विशिष्ट बार-बार होने वाली गलती को दूर धकेलने के लिए एक बड़ा "नेगेटिव स्कोर" देता है।
- "मिस्टेक पार्टी" रिवॉर्ड: यदि छात्र 10 अलग-अलग प्रकार की गलतियाँ करता है, तो EDAS कहता है, "बहुत बढ़िया! तुम अन्वेषण (explore) कर रहे हो। भले ही तुम गलत थे, लेकिन तुमने कुछ नया आज़माया।" यह उन दुर्लभ, अद्वितीय गलतियों के लिए दंड को कम कर देता है। यह छात्र को बताता है, "इस विशिष्ट दुर्लभ गलती के बारे में इतना चिंता न करें; नई चीजें आज़माना जारी रखें।"
यह क्यों महत्वपूर्ण है
इस शोध पत्र का परीक्षण दो बहुत कठिन कार्यों पर किया गया: गणित प्रतियोगिताएं (जैसे AIME और AMC) और कोडिंग (कंप्यूटर प्रोग्राम लिखना)।
उन्होंने एक लोकप्रिय AI मॉडल (Qwen3) का उपयोग किया और पुराने तरीके के मुकाबले नए EDAS मेथड की तुलना की।
- गणित में: EDAS पद्धति ने AI को काफी अधिक कठिन समस्याओं को हल करने में मदद की। औसतन, इसने AI के स्कोर में लगभग 6 अंकों का सुधार किया (100 के पैमाने पर), जो इस क्षेत्र में एक बहुत बड़ी छलांग है।
- कोडिंग में: इसने AI को बेहतर कोड लिखने में भी मदद की, विशेष रूप से उन पेचीदा समस्याओं पर जहाँ AI आमतौर पर गलतियों के एक ही लूप में फंस जाता है।
"सीक्रेट सॉस" (गुप्त नुस्खा)
सबसे शानदार बात यह है कि EDAS को AI के सोचने या सीखने के तरीके को मौलिक रूप से बदलने की आवश्यकता नहीं है। यह एक पोस्ट-गेम एडजस्टमेंट की तरह है।
कल्प_ना कीजिए कि एक स्पोर्ट्स टीम खेल रही है। कोच खिलाड़ियों की मांसपेशियों या खेल के नियमों को नहीं बदलता है। इसके बजाय, खेल के बाद, कोच आंकड़ों को देखता है और कहता है, "हे, तुम बार-बार एक ही रक्षात्मक गलती कर रहे थे, इसलिए हम उस पर अतिरिक्त ध्यान देंगे। लेकिन तुमने कुछ नई आक्रामक चालें चलीं जो विफल रहीं, तो चलो उन्हें साहसी होने के लिए थोड़ा श्रेय देते हैं।"
यह सरल बदलाव AI को उन "बेवकूफी भरे लूप्स" में फंसने से रोकता है जहाँ वह एक ही गलती दोहराता रहता है, और इसके बजाय उसे सही उत्तर खोजने के लिए विभिन्न पथों को खोजने के लिए प्रोत्साहित करता है।
सारांश
- समस्या: AI अक्सर एक ही गलती को बार-बार दोहराने के लूप में फंस जाता है।
- अंतर्दृष्टि: गलतियों के विभिन्न प्रकारों वाले प्रयासों के समूह, उन समूहों की तुलना में बहुत बेहतर होते हैं जहाँ सभी एक ही गलती करते हैं।
- समाधान: EDAS एक ऐसा टूल है जो बार-बार होने वाली गलतियों को भारी दंड देता है लेकिन अद्वितीय, दुर्लभ गलतियों को पुरस्कृत करता है (या कम से कम उतना दंडित नहीं करता)।
- परिणाम: AI तेज़ी से सीखता है, कठिन गणितीय समस्याओं को हल करता है, और बेहतर कोड लिखता है क्योंकि यह सफल होने से पहले विफल होने के विविध तरीकों का पता लगाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।