NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models
यह शोध पत्र नीडलचेन (NeedleChain) का परिचय देता है, जो एक कठोर बेंचमार्क है यह प्रदर्शित करता है कि वर्तमान एलएलएम (LLMs) संक्षिप्त, पूर्णतः प्रासंगिक संदर्भों को एकीकृत करने में संघर्ष करते हैं, और पूर्ण-संदर्भ समझ में सुधार के लिए एक प्रशिक्षण-मुक्त 'रोप कॉन्ट्रैक्शन' (ROPE contraction) रणनीति प्रस्तावित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे एक जासूस हैं। आपके पास 200 सुरागों का एक ढेर है, और हर एक सुराग अपराधी को खोजने के लिए अनिवार्य है। यदि आप एक भी चूक गए, तो आपको गलत उत्तर मिलेगा।
यह बिल्कुल वही परीक्षण है जो "NEEDLECHAIN" के पीछे के शोधकर्ता GPT-4o या Llama जैसे लार्ज लैंग्वेज मॉडल्स (LLMs) के साथ कर रहे हैं।
यहाँ उनकी खोज का विवरण दिया गया है, सरल उपमाओं का उपयोग करते हुए:
1. समस्या: "हेस्टैक" (भूसे का ढेर) बनाम "चेन" (कड़ी)
लंबे समय से, हम लंबे दस्तावेज़ों को पढ़ने की AI की क्षमता का परीक्षण "नीडल इन अ हेस्टैक" (भूसे के ढेर में सुई) नामक खेल का उपयोग करके करते आए हैं।
- खेल: आप एक विशाल और उबाऊ, अप्रासंगिक टेक्स्ट की किताब (हेस्टैक) के अंदर एक छोटी सी, महत्वपूर्ण वाक्य (सुई) छिपा देते हैं।
- परिणाम: AI मॉडल इसमें बहुत अच्छे हैं। वे मेटल डिटेक्टर की तरह काम करते हैं, किताब को स्कैन करते हैं, उबाऊ हिस्सों को अनदेखा करते हैं, और उस एक सुई को ढूंढ लेते हैं।
- खामी: शोधकर्ताओं का तर्क है कि यह एक चाल है। यह इस बात का परीक्षण करता है कि क्या AI किसी विशिष्ट जानकारी को ढूंढ सकता है, न कि यह कि वह सब कुछ को कैसे समझ और जोड़ सकता है।
नया परीक्षण: NEEDLECHAIN
शोधकर्ताओं ने NEEDLECHAIN नामक एक नया परीक्षण बनाया।
- सेटअप: हेस्टैक के बजाय, एक 200 कड़ियों की चेन की कल्पना करें।
- नियम: हर कड़ी अगली कड़ी से जुड़ी हुई है। अंतिम कड़ी का मान जानने के लिए, आपको पहली, दूसरी, तीसरी और प्रत्येक एक का मान जानना होगा जो उनके बीच में है।
- चुनौती: यहाँ कोई "उबाऊ" टेक्स्ट नहीं है। हर वाक्य एक महत्वपूर्ण सुराग है। यदि AI चेन की एक भी कड़ी छोड़ देता है, तो पूरा उत्तर बिगड़ जाता है।
2. चौंकाने वाली खोज
शोधकर्ताओं ने एक सरल प्रश्न पूछा: "क्या ये सुपर-स्मार्ट AI मॉडल एक छोटी कहानी (केवल 200 शब्द लंबी) पढ़ सकते हैं जहाँ हर वाक्य मायने रखता है?"
उत्तर: नहीं, वास्तव में नहीं।
यहाँ तक कि GPT-4o जैसे उन्नत मॉडल भी विफल होने लगे जब चेन 10 या 20 कड़ियों से लंबी हो गई।
- उपमा: यह एक इंसान को एक ऐसा फोन नंबर याद रखने के लिए कहने जैसा है जहाँ प्रत्येक अंक पिछले अंक पर निर्भर करता है। यदि वे 5वां अंक भूल जाते हैं, तो वे 6वें अंक का अनुमान नहीं लगा सकते। AI चेन में कड़ियाँ "ड्रॉप" कर रहा था, बहुत छोटे टेक्स्ट में भी महत्वपूर्ण विवरण भूल रहा था।
3. दिशा मायने रखती है ("बैकवर्ड्स" की समस्या)
शोधकर्ताओं ने चेन का तीन अलग-अलग तरीकों से परीक्षण किया:
- फॉरवर्ड चेन (Forward Chain): सुराग क्रम में हैं (A से B होता है, B से C होता है)।
- बैकवर्ड चेन (Backward Chain): सुराग उलटे हैं (C से B होता है, B से A होता है)।
- मिक्सड चेन (Mixed Chain): सुराग बेतरतीब ढंग से बिखरे हुए हैं।
परिणाम:
- फॉरवर्ड: AI ठीक था। यह बाएँ-से-दाएँ पढ़ने में सहज है, ठीक वैसे ही जैसे एक किताब।
- बैकवर्ड और मिक्सड: AI क्रैश हो गया। जब इसे पीछे की ओर तर्क करने या बिखरे हुए क्रम में तर्क करने के लिए मजबूर किया गया, तो यह भटक गया।
- रूपक: एक ऐसे ट्रेन की कल्पना करें जो एक सीधे ट्रैक पर पूरी तरह से चलती है (फॉरवर्ड)। लेकिन यदि आप इसे रिवर्स में चलाने की कोशिश करते हैं (बैकवर्ड) या टेढ़े-मेढ़े ट्रैक पर चलाते हैं (मिक्सड), तो इंजन रुक जाता है। AI केवल "भूल" नहीं रहा है; यह सूचना को प्रोसेस करने में संघर्ष कर रहा है जब तार्किक प्रवाह इसके स्वाभाविक स्वभाव के विरुद्ध जाता है।
4. AI कहाँ खो जाता है?
आमतौर पर, लोग सोचते हैं कि AI लंबे टेक्स्ट के बीच में चीजें भूल जाता है ( "लॉस्ट इन द मिडिल" की समस्या)।
- निष्कर्ष: शोधकर्ताओं ने पाया कि AI केवल टेक्स्ट के बीच में नहीं खो जाता; यह तर्क के बीच में खो जाता है।
- उपमा: यदि आप एक ऐसी कहानी सुनाते हैं जहाँ बीच में प्लॉट ट्विस्ट आता है, तो AI कहानी का सूत्र खो देता है, भले ही टेक्स्ट स्वयं छोटा हो। यह "लॉजिकल चेन" को थामे रखने में संघर्ष करता है जब क्रम जटिल हो जाता है।
5. समाधान: "ROPE कॉन्ट्रैक्शन"
शोधकर्ताओं ने एक चतुर सुधार आजमाया। AI मॉडल ROPE (एक स्केल या रूलर की तरह) नामक एक गणितीय उपकरण का उपयोग करते हैं ताकि वे समझ सकें कि वाक्य में शब्द कहाँ स्थित हैं।
- वर्तमान चलन: अधिकांश शोधकर्ता इस स्केल को खींचने (ROPE Extension) की कोशिश कर रहे हैं ताकि AI लंबी किताबें पढ़ सके।
- पेपर का विचार: उन्होंने स्केल को सिकोड़ने (ROPE Contraction) की कोशिश की।
- उपमा: कल्पना कीजिए कि AI एक मानचित्र देख रहा है। यदि मानचित्र बहुत अधिक फैला हुआ है, तो विवरण धुंधले हो जाते हैं। मानचित्र को "संकुचित" (Contracting) करके, विवरण अधिक स्पष्ट और पहचानने में आसान हो जाते हैं।
- परिणाम: इस सरल ट्रिक ने AI को पूरे सुरागों की चेन को याद रखने में बहुत बेहतर बना दिया, जिससे यह साबित हुआ कि गहराई से समझना केवल लंबा पढ़ने से अधिक महत्वपूर्ण है।
सारांश
पेपर का दावा है कि जबकि AI हेस्टैक में सुई ढूंढ सकता है, यह अभी तक 200 जुड़े हुए सुरागों की चेन का विश्वसनीय रूप से पालन नहीं कर सकता। यह संघर्ष करता है जब तर्क उल्टा या बिखरा हुआ होता है, और यह अक्सर पहेली के टुकड़ों को छोड़ देता है। लेखक सुझाव देते हैं कि केवल AI को लंबी किताबें पढ़ाने के बजाय, हमें इसे उन किताबों में डॉट्स (बिंदुओं) को जोड़ने में अधिक तेज बनाने पर ध्यान केंद्रित करना चाहिए जिन्हें यह पहले से ही पढ़ रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।