← नवीनतम पेपर
💻 computer science

Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning

यह शोध पत्र यह प्रदर्शित करता है कि रिट्रीवल (retrieval), मल्टी-एविडेंस सिंथेसिस (multi-evidence synthesis) और रीजनिंग कार्यों को कवर करने वाली एक सावधानीपूर्वक क्यूरेट की गई, डेटा-केंद्रित रेसिपी, जो एक न्यूनतम आउटकम-आधारित GRPO सेटअप के साथ संयुक्त है, जटिल रिवॉर्ड इंजीनियरिंग पर निर्भर हुए बिना, लार्ज लैंग्वेज मॉडल्स में लॉन्ग-कॉन्टेक्स्ट रीजनिंग और एजेंटिक क्षमताओं को महत्वपूर्ण रूप से बढ़ाती है।

मूल लेखक: Xiaoyue Xu, Sikui Zhang, Xiaorong Wang, Xu Han, Chaojun Xiao

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoyue Xu, Sikui Zhang, Xiaorong Wang, Xu Han, Chaojun Xiao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली छात्र (AI मॉडल) है जो गणित की समस्याओं को हल करने या सवालों के जवाब देने में बहुत अच्छा है जब जानकारी छोटी और व्यवस्थित होती है, जैसे कि नोट्स का एक एकल पृष्ठ। लेकिन जब आप उसे किताबों से भरी एक लाइब्रेरी, बिखरे हुए नोट्स और हजारों पन्नों का टेक्स्ट थमा देते हैं, तो वह घबरा जाता है। वह अनुमान लगाने लगता है, महत्वपूर्ण पन्नों को छोड़ देता है, या शोर-शराबे में खो जाता है।

यह शोध पत्र इस बारे में है कि उस छात्र को "लाइब्रेरी" को संभालने के लिए प्रशिक्षित करने का एक नया तरीका, बिना किसी बहुत जटिल या महंगे शिक्षक के जो हर एक कदम पर उसे सुधारने के लिए लगातार निर्देश दे, कैसे विकसित किया जाए।

यहाँ उनके दृष्टिकोण का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "रिवॉर्ड इंजीनियर" बनाम "डेटा शेफ"

पहले, शोधकर्ताओं ने इसे ठीक करने के लिए एक बहुत ही जटिल "रिवॉर्ड सिस्टम" (जैसे एक सख्त शिक्षक जो सबूत खोजने के लिए अंक देता है, सारांश बनाने के लिए अंक देता है, और अंतिम उत्तर के लिए अंक देता है) बनाने की कोशिश की। उन्होंने सोचा कि समस्या "ग्रेडिंग सिस्टम" में है।

इस शोध पत्र के लेखक कहते हैं: "रुकिए। शायद समस्या ग्रेडिंग सिस्टम नहीं है; शायद समस्या पाठ्यपुस्तकों (textbooks) की है।" उनका तर्क है कि यदि आप छात्र को अभ्यास समस्याओं का एक विविध और उच्च गुणवत्ता वाला सेट देते हैं, तो वे एक बहुत ही सरल ग्रेडिंग सिस्टम (केवल यह जाँचकर कि अंतिम उत्तर सही है या नहीं) के साथ भी लंबी किताबें संभालने में सक्षम हो सकते हैं।

2. "डेटा रेसिपी": तीन विशिष्ट अभ्यास

छात्र को यादृच्छिक (random) किताबें फेंकने के बजाय, लेखकों ने एक विशिष्ट "प्रशिक्षण मेनू" बनाया जिसमें तीन प्रकार के अभ्यास हैं। उनका मानना है कि लॉन्ग-कॉन्टेक्स्ट रीजनिंग (long-context reasoning) वास्तव में तीन कौशलों का एक साथ काम करना है:

  • अभ्यास A: "भूसे के ढेर में सुई" (Retrieval/खोज)

    • उपमा: एक भूसे के ढेर की कल्पना करें जहाँ सुई छिपी हुई है, लेकिन भूसे का ढेर ऐसी अन्य चीजों से भरा है जो सुइयों जैसी दिखती हैं (डिस्ट्रैक्टर्स)।
    • लक्ष्य: छात्र को उस विशिष्ट सुई को खोजना होगा भले ही उसका वर्णन अजीब तरीके से किया गया हो (उदाहरण के लिए, "सुई" कहने के बजाय, टेक्स्ट कहता है "सिलाई के लिए उपयोग की जाने वाली नुकीली धातु की वस्तु") और भले ही वहां 50 नकली सुइयां मिली हुई हों। यह मॉडल को केवल कीवर्ड्स के बजाय अर्थ खोजने के लिए प्रशिक्षित करता है।
  • अभ्यास B: "पहेली सुलझाना" (Multi-evidence Synthesis/बहु-साक्ष्य संश्लेषण)

    • उपमा: एक रहस्य की कल्पना करें जहाँ संदिग्ध के स्थान के बारे में सुराग पेज 10 पर है, संदिग्ध के मकसद के बारे में सुराग पेज 400 पर है, और उसके बहाने (alibi) के बारे में सुराग पेज 800 पर है। कोई भी एक पेज उत्तर नहीं देता।
    • लक्ष्य: छात्र को उन तीनों पेजों को पढ़ना होगा, कड़ियों को जोड़ना होगा, और यह समझना होगा कि संदिग्ध वास्तव में पेरिस में है। यह मॉडल को केवल एक वाक्य को कॉपी करने के बजाय बिखरी हुई जानकारी को जोड़ने के लिए प्रशिक्षित करता है।
  • अभ्यास C: "मैथ मैराथन" (Reasoning/तर्क)

    • उपमा: एक गणित की समस्या जहाँ संख्याएं एक अंतरिक्ष यान की यात्रा की लंबी, उबाऊ कहानी के भीतर छिपी हुई हैं। आपको पहले संख्याओं को खोजना होगा, फिर गणित करना होगा।
    • लक्ष्य: छात्र को फालतू बातों को नजरअंदाज करना होगा, संख्याओं को खोजना होगा, और समीकरण को हल करना होगा। यह मॉडल को यह सिखाता है कि बहुत लंबा टेक्स्ट होने पर भी अपना "सोचने वाला मस्तिष्क" सक्रिय रखे।

3. परिणाम: एक सरल रेसिपी सबसे अच्छा काम करती है

लेखकों ने इन तीन प्रकार के अभ्यासों को लिया, उन्हें मिलाकर लगभग 14,000 उदाहरणों का एक डेटासेट बनाया, और तीन अलग-अलग AI मॉडल (छोटे, मध्यम और बड़े) को प्रशिक्षित किया।

  • परिणाम: भले ही उन्होंने एक बहुत ही सरल "ग्रेडिंग सिस्टम" (केवल यह जाँचकर कि अंतिम उत्तर सही था या नहीं) का उपयोग किया, मॉडल लंबे टेक्स्ट को संभालने में काफी बेहतर हो गए। उन्होंने पिछले तरीकों को पीछे छोड़ दिया जिन्होंने बहुत अधिक जटिल रिवॉर्ड सिस्टम का उपयोग किया था।
  • आश्चर्य: जब उन्होंने एक ऐसे मॉडल को लिया जो पहले से ही एक "डिजिटल असिस्टेंट" (एक एजेंट जो वेब सर्च जैसे टूल्स का उपयोग करता है) होने में अच्छा था और उसे यह अतिरिक्त प्रशिक्षण दिया, तो वह असिस्टेंट अपने काम में बहुत बेहतर हो गया। वह वेब सर्च कर सकता था, लंबे लेख पढ़ सकता था, और जटिल वास्तविक दुनिया के कार्यों (जैसे विशिष्ट यात्रा जानकारी ढूंढना या कोड को डीबग करना) को बहुत अधिक सटीकता से हल कर सकता था।

सारांश

यह शोध पत्र दावा करता है कि AI को लंबे दस्तावेज़ पढ़ने में स्मार्ट बनाने के लिए, आपको उन्हें ग्रेड करने का एक जटिल नया तरीका आविष्कार करने की आवश्यकता नहीं है। इसके बजाय, आपको बस उन्हें अभ्यास समस्याओं का एक बेहतर, अधिक विविध सेट देना होगा जो विशेष रूप से उन्हें निम्नलिखित के लिए प्रशिक्षित करे:

  1. छिपी हुई जानकारी खोजना।
  2. जानकारी के विभिन्न टुकड़ों को जोड़ना।
  3. चरण-दर-चरण समस्याओं पर विचार करना।

AI को इस विशिष्ट "डेटा रेसिपी" के माध्यम से फीड करके, वह इंटरनेट और विशाल दस्तावेजों के "लाइब्रेरी" को बहुत अधिक प्रभावी ढंग से नेविगेट करना सीख जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →