← नवीनतम पेपर
🤖 AI

Evidence-State Rewards for Long-Context Reasoning

यह शोध पत्र मेवेन (Maven) को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो साक्ष्य अवस्था परिवर्तनों—जैसे कि जानकारी जोड़ने, जोड़ने या हटाने—को क्रिया-स्तर के पुरस्कारों को सौंपकर दीर्घ-संदर्भ तर्क (long-context reasoning) को बढ़ाता है, जिससे कई बेंचमार्क पर पारंपरिक केवल-परिणाम (outcome-only) विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Ya Gao, Pekka Marttinen

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ya Gao, Pekka Marttinen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक जटिल रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन आपके पास डेस्क पर रखे कुछ सुरागों के बजाय, हजारों किताबों, समाचार पत्रों और नोट्स से भरी एक लाइब्रेरी है। आपका लक्ष्य उन विशिष्ट तथ्यों को खोजना है जो केस को सुलझाने के लिए आवश्यक हैं।

यह वह चुनौती है जिसका सामना AI (आर्टिफिशियल इंटेलिजेंस) MAVEN करता है।

समस्या: लाइब्रेरी में खो जाना

वर्तमान AI मॉडल विशाल मात्रा में टेक्स्ट (लंबे कॉन्टेक्स्ट) को पढ़ने में बेहतर हो रहे हैं, लेकिन वे इसके माध्यम से तर्क करने में अक्सर संघर्ष करते हैं।

  • पुराना तरीका: कल्पना कीजिए कि एक जासूस को एक ऐसा सुराग मिलता है जो उम्मीद जगाता हुआ दिखता है, वह उसे उठा लेता है, और तुरंत समाधान लिख देता है। यदि वह पहला सुराग एक 'रेड हेरिंग' (भटकाने वाला गलत सुराग) था, तो जासूस गलत उत्तर के साथ फंस जाता है।
  • सीमा: पिछले AI प्रशिक्षण तरीके एक ऐसे शिक्षक की तरह थे जो केवल अंतिम उत्तर का ग्रेड देता था। यदि जासूस ने सही उत्तर दिया, तो उसे "A" ग्रेड मिलता था, भले ही उसने आधे सुरागों को अनदेखा कर दिया हो या वह भाग्यशाली रहा हो। यदि वह गलत हुआ, तो उसे "F" मिलता था, लेकिन शिक्षक ने यह नहीं समझाया कि उसने गलत सुराग क्यों चुना या उसे सही सुराग क्यों छोड़ दिया।

समाधान: MAVEN (स्मार्ट जासूस)

लेखक MAVEN (Marginal-Value Evidence Navigation) का प्रस्ताव करते हैं। केवल अंतिम उत्तर को ग्रेड देने के बजाय, MAVEN AI को एक "एविडेंस मेमोरी" (साक्ष्य स्मृति) प्रबंधित करना सिखाता है—एक मानसिक रफ कार्यक्षेत्र (scratchpad) जहाँ वह सोचते समय सक्रिय रूप से सुरागों को एकत्र, जोड़ और हटा सकता है।

MAVEN को एक ऐसे जासूस के रूप में सोचें जिसे प्रशिक्षित किया गया है:

  1. एक सुराग को अपने बोर्ड पर जोड़ने के लिए।
  2. दो सुरागों को एक साथ जोड़ने के लिए ताकि वे कैसे फिट होते हैं, यह देखा जा सके।
  3. एक सुराग को हटाने के लिए यदि उसे एहसास होता है कि वह भटकाने वाला है।
  4. केवल तभी उत्तर देने के लिए जब बोर्ड साफ हो जाए।

MAVEN AI को कैसे सिखाता है (पुरस्कार/रिवॉर्ड्स)

MAVEN का जादू इस बात में है कि यह केवल अंतिम परिणाम के लिए नहीं, बल्कि इस बात के लिए AI को पुरस्कृत करता है कि वह अपने स्क्रैचपैड का उपयोग कैसे करता है। यह एक "फ्रोजन वेरीफायर" (एक स्मार्ट, प्री-ट्रेंड AI जज) का उपयोग करता है जो हर कदम पर साक्ष्य की स्थिति की जांच करता है।

यहाँ तीन प्रकार के "पॉइंट्स" हैं जो AI अर्जित करता है:

  • "Add" रिवॉर्ड (सोना खोजना):

    • उपमा: आपको एक नया सुराग मिलता है। क्या इसने आपको अभी इसी वक्त सच्चाई के करीब पहुँचने में मदद की? या, भले ही इसने तुरंत मदद नहीं की, क्या यह बाद में पहेली सुलझाने के लिए बिल्कुल आवश्यक था?
    • MAVEN की ट्रिक: यह उन सुरागों के लिए अंक देता है जो तुरंत मदद करते हैं, लेकिन यह उन सुरागों के लिए भी "हिंडसाइट पॉइंट्स" (पिछली जानकारी के आधार पर मिलने वाले अंक) देता है जो अंतिम समाधान के लिए अनिवार्य थे, भले ही वे शुरू में बेकार लग रहे हों।
  • "Drop" रिवॉर्ड (बोर्ड की सफाई करना):

    • उपमा: आपको एहसास होता है कि आपने पहले जो सुराग उठाया था, वह वास्तव में एक गलत सुराग है। उसे जिद के साथ रखने के बजाय, आप उसे फेंक देते हैं।
    • MAVEN की ट्रिक: यदि किसी सुराग को हटाने से उत्तर अधिक स्पष्ट हो जाता है, तो AI को पुरस्कार मिलता है। यह मॉडल को अपनी गलतियों को स्वीकार करने और अपने तर्क को सुधारने के लिए प्रशिक्षित करता है, न कि एक गलत रास्ते पर चिपके रहने के लिए।
  • "Link" रिवॉर्ड (बिंदुओं को जोड़ना):

    • उपमा: आपके पास दो सुराग हैं जो अकेले समझ में नहीं आते, लेकिन जब आप उन्हें एक साथ रखते हैं, तो वे पूरी कहानी प्रकट कर देते हैं।
    • MAVEN की ट्रिक: यह AI को यह स्पष्ट रूप से समझाने के लिए पुरस्कृत करता है कि दो साक्ष्य एक साथ मिलकर कैसे काम करते हैं। यह AI को केवल यादृच्छिक तथ्य एकत्र करने से रोकता है; यह उसे तथ्यों का संश्लेषण (synthesize) करने के लिए मजबूर करता है।

परिणाम: एक बेहतर जासूस

शोधकर्ताओं ने विभिन्न AI मॉडलों (जैसे Llama और Qwen) पर कठिन रीडिंग कॉम्प्रिहेन्शन टेस्ट का उपयोग करके MAVEN का परीक्षण किया।

  • बेहतर सटीकता: MAVEN-प्रशिक्षित मॉडलों ने केवल अंतिम उत्तरों या केवल "प्रासंगिक" टेक्स्ट खोजने के लिए प्रशिक्षित मॉडलों की तुलना में अधिक समस्याओं को सही ढंग से हल किया।
  • कम अव्यवस्था: MAVEN मॉडल ने अपनी मेमोरी में कम "डिस्ट्रैक्टर्स" (भटकाने वाले सुराग) रखे। वे यह समझने में बेहतर थे कि उनका कोई सुराग गलत है और उसे कब हटाना है।
  • अधिक पूर्णता: उन्होंने आंशिक जानकारी के आधार पर अनुमान लगाने के बजाय, पहेली को हल करने के लिए आवश्यक अधिक साक्ष्य एकत्र किए।

निष्कर्ष

MAVEN खेल को "सही उत्तर खोजें" से बदलकर "सही उत्तर बनाना सीखें" में बदल देता है। यह लंबे कॉन्टेक्स्ट वाले तर्क को एक बार की खोज के रूप में नहीं, बल्कि साक्ष्य की स्थिति को नेविगेट करने की एक गतिशील प्रक्रिया के रूप में देखता है—जब तक कि तस्वीर स्पष्ट न हो जाए, तब तक लगातार जानकारी जोड़ना, जोड़ना और हटाना।

शोध का निष्कर्ष है कि यदि AI को वास्तव में लंबे टेक्स्ट पर तर्क करना है, तो उसे केवल तथ्यों की एक स्थिर सूची निकालने के बजाय, अपने स्वयं के साक्ष्य को प्रबंधित करना और संशोधित करना सीखना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →