GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
GoLongRL एक ओपन-सोर्स फ्रेमवर्क है जो 23K विविध RLVR सैंपल्स के क्षमता-उन्मुख (capability-oriented) डेटासेट और विषम मल्टीटास्क ऑप्टिमाइज़ेशन के लिए एक नवीन TMN-Reweight एल्गोरिदम के माध्यम से लॉन्ग-कॉन्टेक्स्ट सुदृढीकरण लर्निंग (reinforcement learning) को बढ़ाता है, जो अग्रणी क्लोज्ड-सोर्स मॉडल्स के तुलनीय प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन कम ध्यान देने वाले छात्र को केवल एक पन्ने को नहीं, बल्कि किताबों की एक विशाल लाइब्रेरी को पढ़ने और समझने का तरीका सिखाने की कोशिश कर रहे हैं। यह "लॉन्ग-कॉन्टेक्स्ट" (long-context) AI की चुनौती है। GoLongRL नामक शोध पत्र इन AI मॉडलों को प्रशिक्षित करने के लिए एक नया नुस्खा प्रस्तुत करता है, जो दो मुख्य समस्याओं पर केंद्रित है: उन्हें क्या सिखाना है (डेटा) और उनके होमवर्क को कैसे ग्रेड करना है (एल्गोरिदम)।
यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:
1. समस्या: पुराना तरीका बहुत सीमित था
AI को लंबी किताबें पढ़ने के लिए प्रशिक्षित करने के पिछले तरीके "घास के ढेर में सुई कहाँ है?" जैसे पहेलियों पर आधारित थे।
- समस्या: उन्होंने डेटा इस तरह बनाया जिससे AI लंबे टेक्स्ट में छिपे विशिष्ट तथ्यों को खोज सके। हालांकि इससे AI को सुइयां खोजने में मदद मिली, लेकिन इसने उसे पूरे घास के ढेर का सारांश बनाने, सबसे महत्वपूर्ण हिस्सों को रैंक करने या जटिल कहानियों को समझने के लिए नहीं सिखाया।
- परिणाम: AI विशिष्ट तथ्यों को खोजने में तो अच्छा हो गया, लेकिन वह सारांश लिखने या रिपोर्ट को व्यवस्थित करने जैसे अन्य कौशल में कमजोर रह गया। यह एक ऐसे छात्र की तरह था जो शब्दकोश में एक विशिष्ट शब्द तो ढूंढ सकता है लेकिन निबंध नहीं लिख सकता।
2. समाधान: एक "क्षमता-उन्मुख" पाठ्यक्रम (Capability-Oriented Syllabus)
GoLongRL के लेखकों ने केवल "सुई खोजने" के बजाय एक व्यापक पाठ्यक्रम बनाने का निर्णय लिया, जो 9 अलग-अलग कौशलों पर आधारित है जिनकी एक बुद्धिमान पाठक को आवश्यकता होती है।
- डेटासेट (पाठ्यपुस्तकें): उन्होंने 23,000 अभ्यास समस्याओं का एक नया डेटासेट बनाया।
- असली किताबें, नकली नहीं: नकली कहानियाँ बनाने के बजाय, उन्होंने वास्तविक पुस्तकों, शैक्षणिक शोध पत्रों और कानूनी दस्तावेजों का उपयोग किया। उन्होंने AI से इन वास्तविक ग्रंथों के बारे में प्रश्न उत्पन्न करने के लिए कहा। यह सुनिश्चित करता है कि AI इंसानों के लिखने के स्वाभाविक और जटिल तरीके को संभालना सीखे।
- 9 कौशल: डेटासेट विविध कार्यों को कवर करता है जैसे:
- सटीक रिट्रीवल (Precise Retrieval): एक विशिष्ट तथ्य खोजना।
- सारांशीकरण (Summarization): एक लंबे अध्याय को कुछ वाक्यों में समेटना।
- रैंकिंग (Ranking): यह तय करना कि कई खोज परिणामों में से कौन सा सबसे उपयोगी है।
- तर्क (Reasoning): किसी वित्तीय रिपोर्ट के भीतर गणितीय समस्याओं को हल करना।
- उपमा: कल्पना करें कि एक छात्र को 10,000 एक जैसे "लाल गेंद ढूंढो" वाले टेस्ट देने के बजाय, आप उन्हें 10,000 मिश्रित टेस्ट देते हैं: कुछ उनसे लाल गेंद खोजने के लिए कहते हैं, कुछ उनसे खेल का सारांश लिखने के लिए कहते हैं, कुछ उन्हें खिलाड़ियों को रैंक करने के लिए कहते हैं, और कुछ उनसे स्कोर के बारे में गणित का सवाल हल करने के लिए कहते हैं।
परिणाम: बिना किसी फैंसी नई गणितीय ट्रिक के, केवल इस बेहतर "पाठ्यक्रम" का उपयोग करने से AI एक शीर्ष-स्तरीय क्लोज्ड-सोर्स प्रतिस्पर्धी (QwenLong-L1.5) से बेहतर प्रदर्शन करने लगा।
3. एल्गोरिदम: एक "निष्पक्ष ग्रेडिंग" प्रणाली (TMN-Reweight)
एक बार जब आपके पास एक विविध पाठ्यक्रम हो जाता है, तो आपको छात्र को निष्पक्ष रूप से ग्रेड करने के तरीके की आवश्यकता होती है। मानक ग्रेडिंग विधि (जिसे GRPO कहा जाता है) में विभिन्न प्रकार के प्रश्नों के मामले में एक दोष था।
- समस्या: कल्पना कीजिए कि एक गणित के टेस्ट में सही उत्तर देने पर 100 अंक मिलते हैं, और एक रीडिंग कॉम्प्रिहेनशन टेस्ट में सही उत्तर देने पर 1 अंक मिलता है। यदि आप इन्हें मिला देते हैं, तो गणित के प्रश्न छात्र के दिमाग पर हावी हो जाएंगे, और वह रीडिंग को अनदेखा कर देगा। इसके अलावा, यदि कोई प्रश्न बहुत कठिन है, तो मानक ग्रेडिंग भ्रमित हो सकती है और छात्र को एक भाग्यशाली अनुमान के लिए बहुत अधिक श्रेय दे सकती है या एक मामूली चूक के लिए बहुत कम श्रेय दे सकती है।
- समाधान (TMN-Reweight): लेखकों ने दो चरणों वाली एक नई ग्रेडिंग प्रणाली बनाई:
- मैदान को समान बनाना (Task-Level Normalization): उन्होंने स्कोर को इस तरह समायोजित किया कि गणित की समस्या पर "परफेक्ट" स्कोर, रैंकिंग समस्या पर "परफेक्ट" स्कोर के समान महसूस हो। यह AI को कठिन कार्यों को इसलिए अनदेखा करने से रोकता है क्योंकि उनके नंबर छोटे दिखते हैं।
- संघर्ष पर ध्यान देना (Difficulty-Adaptive Reweight):
- यदि छात्र एक आसान प्रश्न सही करता है, तो शिक्षक कहता है, "अच्छा काम किया, लेकिन तुम यह पहले से जानते थे," और कम इनाम देता है।
- यदि छात्र एक कठिन प्रश्न सही करता है (जो दुर्लभ है), तो शिक्षक कहता है, "वाह, यह कठिन था! इसे सुलझाने के लिए बहुत बढ़िया काम किया!" और एक बड़ा इनाम देता है।
- यदि छात्र एक कठिन प्रश्न गलत करता है, तो शिक्षक गुस्सा नहीं होता; वह बस कहता है, "चलिए फिर से कोशिश करते हैं," और दंड (penalty) को कम कर देता है ताकि छात्र हतोत्साहित न हो।
उपमा: यह एक ऐसे कोच की तरह है जो केवल अंक नहीं गिनता। कोच यह देखते हुए स्कोर को समायोजित करता है कि खेल कितना कठिन था और उन खेलों पर अतिरिक्त प्रशंसा देता है जिन्हें निष्पादित करना कठिन था। यह AI को सभी कौशलों में तेजी से और समान रूप से सीखने में मदद करता है।
4. परिणाम: एक बहुमुखी छात्र
जब उन्होंने इस नई पद्धति का परीक्षण किया:
- हर चीज़ में बेहतर: AI सभी 9 कौशलों पर काफी सुधार हुआ, न कि केवल "सुई खोजने" वाले कौशलों पर।
- कोई समझौता नहीं (No Trade-offs): आमतौर पर, जब आप एक छात्र को एक चीज़ (जैसे लंबी किताबें पढ़ना) में महान बनाने के लिए प्रशिक्षित करते हैं, तो वे अन्य चीज़ों (जैसे सामान्य तर्क या स्मृति) में कमजोर हो जाते हैं। इस पद्धति ने वास्तव में AI के सामान्य तर्क और स्मृति कौशल में सुधार किया जबकि उसे लॉन्ग-कॉन्टेक्स्ट रीडिंग भी सिखाई।
- ओपन सोर्स: लेखकों ने पूरा "पाठ्यक्रम" (डेटासेट), "शिक्षण योजना" (कोड), और "ग्रेडिंग रूब्रिक" (एल्गोरिदम) को किसी के भी उपयोग के लिए जारी किया है।
सारांश
GoLongRL एक AI की शिक्षा को एक उबाऊ, दोहराव वाले अभ्यास (सुई ढूंढना) से एक समृद्ध, विविध पाठ्यक्रम (पढ़ना, सारांश बनाना, रैंक करना और तर्क करना) और एक निष्पक्ष, स्मार्ट ग्रेडिंग प्रणाली के साथ अपग्रेड करने जैसा है जो जानता है कि छात्र को कब अधिक कठिन परिश्रम करने के लिए प्रेरित करना है और कब उन्हें ब्रेक देना है। परिणाम एक ऐसा AI है जो न केवल एक तथ्य-खोजकर्ता है, बल्कि एक वास्तविक दीर्घकालिक विचारक (long-form thinker) है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।