← नवीनतम पेपर
💬 NLP

GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment

GoLongRL एक ओपन-सोर्स फ्रेमवर्क है जो 23K विविध RLVR सैंपल्स के क्षमता-उन्मुख (capability-oriented) डेटासेट और विषम मल्टीटास्क ऑप्टिमाइज़ेशन के लिए एक नवीन TMN-Reweight एल्गोरिदम के माध्यम से लॉन्ग-कॉन्टेक्स्ट सुदृढीकरण लर्निंग (reinforcement learning) को बढ़ाता है, जो अग्रणी क्लोज्ड-सोर्स मॉडल्स के तुलनीय प्रदर्शन प्राप्त करता है।

मूल लेखक: Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen, Ziqi Wang, Zhennan Wu, Ruotong Pan, jian Liang, Ruiming Tang, Han Li

प्रकाशित 2026-05-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen, Ziqi Wang, Zhennan Wu, Ruotong Pan, jian Liang, Ruiming Tang, Han Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन कम ध्यान देने वाले छात्र को केवल एक पन्ने को नहीं, बल्कि किताबों की एक विशाल लाइब्रेरी को पढ़ने और समझने का तरीका सिखाने की कोशिश कर रहे हैं। यह "लॉन्ग-कॉन्टेक्स्ट" (long-context) AI की चुनौती है। GoLongRL नामक शोध पत्र इन AI मॉडलों को प्रशिक्षित करने के लिए एक नया नुस्खा प्रस्तुत करता है, जो दो मुख्य समस्याओं पर केंद्रित है: उन्हें क्या सिखाना है (डेटा) और उनके होमवर्क को कैसे ग्रेड करना है (एल्गोरिदम)।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: पुराना तरीका बहुत सीमित था

AI को लंबी किताबें पढ़ने के लिए प्रशिक्षित करने के पिछले तरीके "घास के ढेर में सुई कहाँ है?" जैसे पहेलियों पर आधारित थे।

  • समस्या: उन्होंने डेटा इस तरह बनाया जिससे AI लंबे टेक्स्ट में छिपे विशिष्ट तथ्यों को खोज सके। हालांकि इससे AI को सुइयां खोजने में मदद मिली, लेकिन इसने उसे पूरे घास के ढेर का सारांश बनाने, सबसे महत्वपूर्ण हिस्सों को रैंक करने या जटिल कहानियों को समझने के लिए नहीं सिखाया।
  • परिणाम: AI विशिष्ट तथ्यों को खोजने में तो अच्छा हो गया, लेकिन वह सारांश लिखने या रिपोर्ट को व्यवस्थित करने जैसे अन्य कौशल में कमजोर रह गया। यह एक ऐसे छात्र की तरह था जो शब्दकोश में एक विशिष्ट शब्द तो ढूंढ सकता है लेकिन निबंध नहीं लिख सकता।

2. समाधान: एक "क्षमता-उन्मुख" पाठ्यक्रम (Capability-Oriented Syllabus)

GoLongRL के लेखकों ने केवल "सुई खोजने" के बजाय एक व्यापक पाठ्यक्रम बनाने का निर्णय लिया, जो 9 अलग-अलग कौशलों पर आधारित है जिनकी एक बुद्धिमान पाठक को आवश्यकता होती है।

  • डेटासेट (पाठ्यपुस्तकें): उन्होंने 23,000 अभ्यास समस्याओं का एक नया डेटासेट बनाया।
    • असली किताबें, नकली नहीं: नकली कहानियाँ बनाने के बजाय, उन्होंने वास्तविक पुस्तकों, शैक्षणिक शोध पत्रों और कानूनी दस्तावेजों का उपयोग किया। उन्होंने AI से इन वास्तविक ग्रंथों के बारे में प्रश्न उत्पन्न करने के लिए कहा। यह सुनिश्चित करता है कि AI इंसानों के लिखने के स्वाभाविक और जटिल तरीके को संभालना सीखे।
    • 9 कौशल: डेटासेट विविध कार्यों को कवर करता है जैसे:
      • सटीक रिट्रीवल (Precise Retrieval): एक विशिष्ट तथ्य खोजना।
      • सारांशीकरण (Summarization): एक लंबे अध्याय को कुछ वाक्यों में समेटना।
      • रैंकिंग (Ranking): यह तय करना कि कई खोज परिणामों में से कौन सा सबसे उपयोगी है।
      • तर्क (Reasoning): किसी वित्तीय रिपोर्ट के भीतर गणितीय समस्याओं को हल करना।
    • उपमा: कल्पना करें कि एक छात्र को 10,000 एक जैसे "लाल गेंद ढूंढो" वाले टेस्ट देने के बजाय, आप उन्हें 10,000 मिश्रित टेस्ट देते हैं: कुछ उनसे लाल गेंद खोजने के लिए कहते हैं, कुछ उनसे खेल का सारांश लिखने के लिए कहते हैं, कुछ उन्हें खिलाड़ियों को रैंक करने के लिए कहते हैं, और कुछ उनसे स्कोर के बारे में गणित का सवाल हल करने के लिए कहते हैं।

परिणाम: बिना किसी फैंसी नई गणितीय ट्रिक के, केवल इस बेहतर "पाठ्यक्रम" का उपयोग करने से AI एक शीर्ष-स्तरीय क्लोज्ड-सोर्स प्रतिस्पर्धी (QwenLong-L1.5) से बेहतर प्रदर्शन करने लगा।

3. एल्गोरिदम: एक "निष्पक्ष ग्रेडिंग" प्रणाली (TMN-Reweight)

एक बार जब आपके पास एक विविध पाठ्यक्रम हो जाता है, तो आपको छात्र को निष्पक्ष रूप से ग्रेड करने के तरीके की आवश्यकता होती है। मानक ग्रेडिंग विधि (जिसे GRPO कहा जाता है) में विभिन्न प्रकार के प्रश्नों के मामले में एक दोष था।

  • समस्या: कल्पना कीजिए कि एक गणित के टेस्ट में सही उत्तर देने पर 100 अंक मिलते हैं, और एक रीडिंग कॉम्प्रिहेनशन टेस्ट में सही उत्तर देने पर 1 अंक मिलता है। यदि आप इन्हें मिला देते हैं, तो गणित के प्रश्न छात्र के दिमाग पर हावी हो जाएंगे, और वह रीडिंग को अनदेखा कर देगा। इसके अलावा, यदि कोई प्रश्न बहुत कठिन है, तो मानक ग्रेडिंग भ्रमित हो सकती है और छात्र को एक भाग्यशाली अनुमान के लिए बहुत अधिक श्रेय दे सकती है या एक मामूली चूक के लिए बहुत कम श्रेय दे सकती है।
  • समाधान (TMN-Reweight): लेखकों ने दो चरणों वाली एक नई ग्रेडिंग प्रणाली बनाई:
    1. मैदान को समान बनाना (Task-Level Normalization): उन्होंने स्कोर को इस तरह समायोजित किया कि गणित की समस्या पर "परफेक्ट" स्कोर, रैंकिंग समस्या पर "परफेक्ट" स्कोर के समान महसूस हो। यह AI को कठिन कार्यों को इसलिए अनदेखा करने से रोकता है क्योंकि उनके नंबर छोटे दिखते हैं।
    2. संघर्ष पर ध्यान देना (Difficulty-Adaptive Reweight):
      • यदि छात्र एक आसान प्रश्न सही करता है, तो शिक्षक कहता है, "अच्छा काम किया, लेकिन तुम यह पहले से जानते थे," और कम इनाम देता है।
      • यदि छात्र एक कठिन प्रश्न सही करता है (जो दुर्लभ है), तो शिक्षक कहता है, "वाह, यह कठिन था! इसे सुलझाने के लिए बहुत बढ़िया काम किया!" और एक बड़ा इनाम देता है।
      • यदि छात्र एक कठिन प्रश्न गलत करता है, तो शिक्षक गुस्सा नहीं होता; वह बस कहता है, "चलिए फिर से कोशिश करते हैं," और दंड (penalty) को कम कर देता है ताकि छात्र हतोत्साहित न हो।

उपमा: यह एक ऐसे कोच की तरह है जो केवल अंक नहीं गिनता। कोच यह देखते हुए स्कोर को समायोजित करता है कि खेल कितना कठिन था और उन खेलों पर अतिरिक्त प्रशंसा देता है जिन्हें निष्पादित करना कठिन था। यह AI को सभी कौशलों में तेजी से और समान रूप से सीखने में मदद करता है।

4. परिणाम: एक बहुमुखी छात्र

जब उन्होंने इस नई पद्धति का परीक्षण किया:

  • हर चीज़ में बेहतर: AI सभी 9 कौशलों पर काफी सुधार हुआ, न कि केवल "सुई खोजने" वाले कौशलों पर।
  • कोई समझौता नहीं (No Trade-offs): आमतौर पर, जब आप एक छात्र को एक चीज़ (जैसे लंबी किताबें पढ़ना) में महान बनाने के लिए प्रशिक्षित करते हैं, तो वे अन्य चीज़ों (जैसे सामान्य तर्क या स्मृति) में कमजोर हो जाते हैं। इस पद्धति ने वास्तव में AI के सामान्य तर्क और स्मृति कौशल में सुधार किया जबकि उसे लॉन्ग-कॉन्टेक्स्ट रीडिंग भी सिखाई।
  • ओपन सोर्स: लेखकों ने पूरा "पाठ्यक्रम" (डेटासेट), "शिक्षण योजना" (कोड), और "ग्रेडिंग रूब्रिक" (एल्गोरिदम) को किसी के भी उपयोग के लिए जारी किया है।

सारांश

GoLongRL एक AI की शिक्षा को एक उबाऊ, दोहराव वाले अभ्यास (सुई ढूंढना) से एक समृद्ध, विविध पाठ्यक्रम (पढ़ना, सारांश बनाना, रैंक करना और तर्क करना) और एक निष्पक्ष, स्मार्ट ग्रेडिंग प्रणाली के साथ अपग्रेड करने जैसा है जो जानता है कि छात्र को कब अधिक कठिन परिश्रम करने के लिए प्रेरित करना है और कब उन्हें ब्रेक देना है। परिणाम एक ऐसा AI है जो न केवल एक तथ्य-खोजकर्ता है, बल्कि एक वास्तविक दीर्घकालिक विचारक (long-form thinker) है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →