← नवीनतम पेपर
💬 NLP

A Decomposition Perspective to Long-context Reasoning for LLMs

यह शोध पत्र कार्यों को मौलिक परमाणु कौशल (atomic skills) में विभाजित करके, लक्षित छद्म डेटासेट (pseudo datasets) को संश्लेषित करके, और कई बेंचमार्क पर महत्वपूर्ण प्रदर्शन सुधार प्राप्त करने के लिए सुदृढीकरण aprendizaje (reinforcement learning) को लागू करके, एलएलएम (LLMs) में दीर्घ-संदर्भ तर्क (long-context reasoning) को बढ़ाने के लिए एक अपघटन-आधारित दृष्टिकोण का प्रस्ताव करता है।

मूल लेखक: Yanling Xiao, Huaibing Xie, Guoliang Zhao, Shihan Dou, Shaolei Wang, Yiting Liu, Nantao Zheng, Cheng Zhang, Pluto Zhou, Zhisong Zhang, Lemao Liu

प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanling Xiao, Huaibing Xie, Guoliang Zhao, Shihan Dou, Shaolei Wang, Yiting Liu, Nantao Zheng, Cheng Zhang, Pluto Zhou, Zhisong Zhang, Lemao Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास "LLM" नाम का एक सुपर-स्मार्ट रोबोट लाइब्रेरियन है। यह रोबोट एक सेकंड में दस लाख किताबों को पढ़ सकता है। लेकिन समस्या यह है कि हालांकि यह उन सभी किताबों को पढ़ सकता है, लेकिन इसे उन पहेलियों को सुलझाने में बहुत बुरा है जिनमें अलग-अलग पन्नों के बीच संबंध जोड़ने की आवश्यकता होती है। यदि आप इससे पूछेंगे, "2024 की पहली छमाही में शीर्ष 10 दवाओं की बिक्री पिछले वर्ष की तुलना में कितनी थी?" तो यह टेक्स्ट के बीच में खो सकता है, नंबरों को मिला सकता है, या समान दिखने वाले गलत उत्तरों से विचलित हो सकता है।

यह शोध पत्र उस रोबोट लाइब्रेरियन के लिए एक नया प्रशिक्षण मैनुअल (training manual) है। बजाय इसके कि वे रोबोट को सीधे "जटिल पहेलियाँ सुलझाना" सिखाने की कोशिश करें (जो कठिन है और अक्सर विफल हो जाता है), लेखकों ने इस काम को पाँच छोटे, प्रबंधनीय परमाणु कौशल (atomic skills) में तोड़ने का निर्णय लिया।

यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. समस्या: "मोनोलिथिक" (एकल) गलती

पहले, शोधकर्ता रोबोट को विशाल, अस्त-व्यस्त पहेलियाँ देकर प्रशिक्षित करने की कोशिश करते थे। उन्हें उम्मीद थी कि यदि वे इसे पर्याप्त उदाहरण दिखाएंगे, तो यह जादुई रूप से तर्क करना सीख जाएगा।

  • उपमा: यह किसी को पूरी सिम्फनी (symphony) की शीट म्यूजिक थमाकर यह कहने जैसा है, "बस इसे बजाओ!" वे खो सकते हैं, गलत सुर लगा सकते हैं, या हार मान सकते हैं।

2. समाधान: इसे तोड़ना ( "परमाणु कौशल")

लेखकों ने महसूस किया कि लॉन्ग-कॉन्टेक्स्ट रीजनिंग (long-context reasoning) वास्तव में कौशलों की एक सीढ़ी है। आप नीचे के पायदानों में महारत हासिल किए बिना ऊपर नहीं चढ़ सकते। उन्होंने पाँच विशिष्ट कौशलों की पहचान की:

  • कौशल 1: ढेर में सुई (रिट्रीवल/खोज)।
    • यह क्या है: दस लाख शब्दों में से एक विशिष्ट तथ्य ढूँढना।
    • उपमा: कपड़ों के एक विशाल ढेर में एक विशिष्ट लाल मोज़े को ढूँढना।
  • कौशल 2: शोर को अनदेखा करना (एंटी-इंटरफेरेंस)।
    • यह क्या है: नकली या समान दिखने वाले तथ्यों से धोखा न खाना।
    • उपमा: एक लाल मोज़ा देखना जो सही वाले जैसा दिखता है, लेकिन यह महसूस करना कि वह वास्तव में एक लाल स्कार्फ है, और असली मोज़े को खोजने के लिए उसे अनदेखा करना।
  • कौशल 3: पहेली को जोड़ना (ग्लोबल इंटीग्रेशन)।
    • यह क्या है: एक उत्तर बनाने के लिए टेक्स्ट के विभिन्न हिस्सों से जानकारी एकत्र करना।
    • उपमा: एक रहस्य को सुलझाने के लिए घर के तीन अलग-अलग कमरों से सुराग इकट्ठा करना। आप केवल एक कमरे को देखकर इसे हल नहीं कर सकते।
  • कौशल 4: नियमों को समझना (रिलेशनल रीजनिंग)।
    • यह क्या है: तथ्य एक-दूसरे से कैसे संबंधित हैं यह समझना (जैसे, "यदि A, B से बड़ा है, और B, C से बड़ा है...")।
    • उपमा: एक फैमिली ट्री या फ्लोचार्ट को समझना, न कि केवल नाम याद करना।
  • कौशल 5: गणित वाला दिमाग (डायनेमिक स्टेट ट्रैकिंग)।
    • यह क्या है: मध्यवर्ती संख्याओं को याद रखते हुए मल्टी-स्टेप गणित करना।
    • उपमा: केक बनाना जहाँ आपको आटा मापना होता है, फिर अंडे डालने होते हैं, और फिर बेकिंग का समय निकालने के लिए कुल वजन को याद रखना होता है। आपको काम करते समय संख्याओं को अपने दिमाग में रखना पड़ता है।

3. प्रशिक्षण विधि: "एंकर" फैक्ट्री

इन कौशलों को कैसे सिखाया जाता है? आप केवल पढ़ नहीं सकते; आपको अभ्यास ड्रिल की आवश्यकता होती है।

  • पुराना तरीका: मनुष्य मैन्युअल रूप से हजारों जटिल प्रश्न लिखते हैं। यह धीमा, महंगा और त्रुटियों (जैसे कि प्रश्नों में गलत गणित) के प्रति संवेदनशील है।
  • नया तरीका (AbR फ्रेमवर्क): लेखकों ने एक स्वचालित "फैक्ट्री" बनाई। वे "एंकर" (विशेष कोड जैसे Anchor_1, Anchor_2) से भरे नकली दस्तावेज़ बनाते हैं और ऐसे प्रश्न उत्पन्न करते हैं जो रोबोट को विशिष्ट कौशल का उपयोग करने के लिए मजबूर करते हैं।
    • उदाहरण: "दस्तावेज़ A में Anchor_1 का मान खोजें, दस्तावेज़ B में Anchor_2 खोजें, और उन्हें आपस में जोड़ दें।"
    • क्योंकि उत्तर एक कंप्यूटर स्क्रिप्ट द्वारा उत्पन्न किए जाते हैं, वे 100% सही होते हैं। कोई मानवीय त्रुटि नहीं।

4. गुप्त सूत्र: रीइन्फोर्समेंट लर्निंग (RL)

एक बार जब उनके पास ये सटीक अभ्यास ड्रिल आ गए, तो उन्होंने केवल रोबोट को "फाइन-ट्यून" नहीं किया (जो कि एक लेक्चर देने जैसा है)। उन्होंने रीइन्फोर्समेंट लर्निंग का उपयोग किया।

  • उपमा: एक वीडियो गेम की कल्पना करें। हर बार जब रोबोट एक ड्रिल सही करता है, तो उसे एक "पॉइंट" (इनाम) मिलता है। हर बार जब वह गलत करता है, तो उसे "गेम ओवर" मिलता है। वह इन हजारों ड्रिल्स को खेलता है, और अपने पॉइंट्स को अधिकतम करने के लिए सीखता है।
  • उन्हें इन परफेक्ट ड्रिल्स की केवल लगभग 4,000 की आवश्यकता थी जिससे एक बड़ा अंतर आया। यह लाखों अस्त-व्यस्त वेब पेजों पर प्रशिक्षण की तुलना में बहुत कुशल है।

5. परिणाम: एक सुपर-रीडर

उन्होंने अपने नए रोबोट का छह अलग-अलग कठिन बेंचमार्क (जैसे "Loogle" और "LongBench" टेस्ट) पर परीक्षण किया।

  • परिणाम: रोबोट काफी बेहतर हो गया। औसतन, इसमें 7.7% का सुधार हुआ।
  • यह क्यों मायने रखता है: इसने साबित कर दिया कि यदि आप छोटे, विशिष्ट कौशलों (जैसे शोर को अनदेखा करना या गणित करना) को ठीक करते हैं, तो रोबोट स्वाभाविक रूप से बड़े, डरावने और जटिल कार्यों में बेहतर हो जाता है।

सारांश

इस पेपर को एक ऐसे कोच के रूप में देखें जो चिल्लाना बंद कर देता है, "बस स्मार्ट बनो!" और इसके बजाय कहता है, "चलो पहले तुम्हारे फुटवर्क का अभ्यास करते हैं, फिर तुम्हारी पासिंग का, और फिर तुम्हारी शूटिंग का।" इन छोटे, सटीक बिल्डिंग ब्लॉक्स पर AI को प्रशिक्षित करके, AI पूरे खेल का मास्टर बन जाता है।

सीख: AI को लंबे दस्तावेज़ पढ़ने में स्मार्ट बनाने के लिए, उसे केवल अधिक टेक्स्ट न खिलाएं। उसे वे विशिष्ट, छोटे कौशल सिखाएं जिनकी उसे उस टेक्स्ट को प्रोसेस करने के लिए आवश्यकता है, एक-एक करके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →