← नवीनतम पेपर
💬 NLP

LongR: Unleashing Long-Context Reasoning via Reinforcement Learning with Dense Utility Rewards

LongR एक एकीकृत ढांचा (unified framework) है जो एक गतिशील "सोचें-और-पढ़ें" (Think-and-Read) तंत्र को सापेक्ष सूचना लाभ (relative information gain) पर आधारित संदर्भ घनत्व पुरस्कारों (contextual density rewards) के साथ एकीकृत करके LLMs में दीर्घ-संदर्भ तर्क (long-context reasoning) को बढ़ाता है, जिससे विविध बेंचमार्क और सुदृढीकरण लर्निंग (reinforcement learning) एल्गोरिदम में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होता है।

मूल लेखक: Bowen Ping, Zijun Chen, Yiyao Yu, Tingfeng Hui, Junchi Yan, Baobao Chang

प्रकाशित 2026-02-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bowen Ping, Zijun Chen, Yiyao Yu, Tingfeng Hui, Junchi Yan, Baobao Chang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ LongR पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों में विभाजित किया गया है।

बड़ी समस्या: "घास के ढेर में सुई" (Needle in a Haystack) का जाल

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन सुराग लाखों किताबों वाले एक पुस्तकालय (एक "लॉन्ग कॉन्टेक्स्ट") के अंदर छिपे हुए हैं।

  • पुराना तरीका (Standard AI): AI एक ही बार में पूरे पुस्तकालय को पढ़ने की कोशिश करता है। यह अक्सर अभिभूत (overwhelmed) हो जाता है। जब कोई विशिष्ट प्रश्न पूछा जाता है, तो यह उन कुछ शब्दों के आधार पर अनुमान लगा सकता है जो इसने शुरुआत में देखे थे, या यह केवल इसलिए उत्तर बना सकता है क्योंकि इसने वास्तव में सही पन्ना नहीं ढूँढा। यह एक उपन्यास में किसी विशिष्ट वाक्य को केवल उसके कवर और पहले अध्याय को देखकर खोजने की कोशिश करने जैसा है।
  • वर्तमान AI का संघर्ष: यहाँ तक कि 'रीइन्फोर्समेंट लर्निंग' (जहाँ AI परीक्षण और त्रुटि से सीखता है) के साथ भी, इसे आमतौर पर अंत में केवल तभी "रिवॉर्ड" मिलता है जब अंतिम उत्तर सही होता है। यह एक छात्र को यह बताने जैसा है कि, "यदि तुम अंतिम गणित का सवाल सही हल कर लेते हो तो तुम्हें 'A' ग्रेड मिलेगा," लेकिन उन्हें उस समीकरण के 50 चरणों के दौरान संघर्ष करते समय कोई मदद नहीं दी जाती। AI को यह नहीं पता होता कि कौन सा चरण अच्छा था या बुरा, इसलिए इसे लंबे दस्तावेज़ को प्रभावी ढंग से पढ़ना सीखने में संघर्ष करना पड़ता है।

समाधान: LongR (सोचो-और-पढ़ो / Think-and-Read)

लेखकों ने LongR नामक एक नई प्रणाली बनाई है। इसे AI को एक नई अध्ययन आदत सिखाने के रूप में समझें जिसे "सोचो-और-पढ़ो" (Think-and-Read) कहा जाता है।

बिना सोचे-समझे सब कुछ पढ़ने या केवल अनुमान लगाने के बजाय, LongR AI को सिखाता है:

  1. सोचें: "मुझे यह पता लगाना है कि बेका कहाँ रहती है।"
  2. पढ़ें: "ठीक है, मुझे उस हिस्से पर जाना चाहिए जहाँ बेका का ज़िक्र है।"
  3. फिर से सोचें: "आह, मुझे मिल गया। वह चौथी मंजिल पर रहती है, दूसरी पर नहीं।"

यह एक निरंतर लूप में चलता है। AI अपने तर्क (reasoning) को रोकने के लिए दस्तावेज़ की जाँच करता है, फिर वापस तर्क करने पर जाता है, और उत्तर मिलने तक इसे दोहराता रहता है।

असली सफलता का सूत्र: "डेंस रिवॉर्ड" (The Dense Reward)

AI यह कैसे सीखता है? पेपर एक विशेष रिवॉर्ड सिस्टम पेश करता है।

  • पुराना रिवॉर्ड (Sparse): "क्या आपने उत्तर सही दिया? हाँ? बहुत अच्छे। नहीं? फिर से कोशिश करें।" लंबे दस्तावेज़ों के लिए यह बहुत अस्पष्ट है।
  • LongR रिवॉर्ड (Dense Utility): पेपर एक चतुर तकनीक का उपयोग करता है जिसे रिलेटिव इंफॉर्मेशन गेन (Relative Information Gain) कहा जाता है।
    • उदाहरण: कल्पना कीजिए कि AI "शब्द पहचानो" (Guess the Word) खेल खेल रहा है।
      • यदि AI एक ऐसा शब्द चुनता है जो पहले से ही स्पष्ट था (जैसे "आसमान नीला है"), तो उसे शून्य अंक मिलते हैं क्योंकि दस्तावेज़ ने उसे कुछ भी नया नहीं सिखाया।
      • यदि AI एक ऐसा शब्द चुनता है जो दस्तावेज़ के उस विशिष्ट वाक्य को पढ़ने तक पूरी तरह रहस्यमय था (जैसे "बेका चौथी मंजिल पर रहती है"), तो उसे उच्च अंक मिलते हैं।
    • यह क्यों मायने रखता है: यह AI को उबाऊ, स्पष्ट चीज़ें पढ़ने में समय बर्बाद करने के बजाय, टेक्स्ट में छिपे विशिष्ट, अद्वितीय तथ्यों की सक्रिय रूप से तलाश करने के लिए प्रोत्साहित करता है। यह AI को केवल घास के ढेर को पकड़े रहने के लिए नहीं, बल्कि उस "सुई" को खोजने के लिए पुरस्कृत करता है।

उन्होंने इसे कैसे सिखाया (The Curriculum)

आप एक बच्चे को सीधे गहरे पूल में नहीं फेंक सकते। पेपर एक करिकुलम लर्निंग (Curriculum Learning) दृष्टिकोण का वर्णन करता है:

  1. छोटी शुरुआत: उन्होंने पहले AI को छोटी कहानियाँ (जैसे 16,000 शब्द) पढ़ना सिखाया।
  2. कठिनाई बढ़ाना: एक बार जब AI छोटी कहानियों में कुशल हो गया, तो उन्होंने धीरे-धीरे लंबाई बढ़ाकर 32,000 शब्द कर दी, और इसी तरह आगे बढ़ते गए।
  3. कोई विशेष ट्रेनिंग डेटा नहीं: उन्हें विशेष "लॉन्ग-डॉक्यूमेंट" उदाहरण लिखने के लिए इंसानों को काम पर रखने की आवश्यकता नहीं थी। AI ने केवल गेम खेलकर (Reinforcement Learning) और सही रिवॉर्ड प्राप्त करके "सोचो-और-पढ़ो" की आदत सीखी।

परिणाम: क्या हुआ?

पेपर ने कई "लॉन्ग-कॉन्टेक्स्ट" टेस्ट्स (जैसे LongBench, RULER, और InfiniteBench) पर इसका परीक्षण किया।

  • बेहतर सटीकता: LongR ने पिछले तरीकों की तुलना में लगभग 9% बेहतर प्रदर्शन किया। यह विशाल टेक्स्ट में विशिष्ट तथ्यों को खोजने में बहुत बेहतर रहा।
  • कोई "चीटिंग" नहीं: एक बड़ी चिंता यह थी कि AI रिवॉर्ड सिस्टम को "धोखा" देने के लिए टेक्स्ट के बड़े हिस्से को कॉपी करने की कोशिश कर सकता है। पेपर दिखाता है कि ऐसा नहीं हुआ। AI ने सटीक होना सीखा, और केवल आवश्यक वाक्यों (सुइयों) को ही उद्धृत (quote) किया, न कि पूरी किताब को डाल दिया।
  • हर जगह कारगर: यह तरीका विभिन्न प्रकार के AI मॉडल्स और विभिन्न लर्निंग एल्गोरिदम के साथ अच्छी तरह से काम किया, जिससे सिद्ध होता है कि यह एक मजबूत टूल है।

सारांश

LongR एक छात्र को केवल अंतिम ग्रेड देने के बजाय, उसे एक हाइलाइटर और एक चेकलिस्ट देने जैसा है। यह AI को सिखाता है कि जब भी वह अनिश्चित हो, तो स्रोत सामग्री को रोकना और उसकी जाँच करना, और उसे विशेष रूप से उस उपयोगी जानकारी को खोजने के लिए पुरस्कृत करना जो पहेली को सुलझाती है। यह AI को बिना खोए या बिना गलत जानकारी बनाए, भारी मात्रा में टेक्स्ट को संभालने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →