← नवीनतम पेपर
💬 NLP

Intelligence Degradation in Long-Context LLMs: Critical Threshold Determination via Natural Length Distribution Analysis

यह शोध पत्र Qwen2.5-7B में एक "उथली लंबी-संदर्भ अनुकूलन" (shallow long-context adaptation) घटना की पहचान करता है, जहाँ प्राकृतिक टोकन लंबाई विश्लेषण और क्रॉस-वैलिडेशन का उपयोग करके लंबी-संदर्भ प्रदर्शन की सीमाओं को व्यवस्थित रूप से लक्षणबद्ध और परिभाषित करते हुए, अधिकतम संदर्भ लंबाई के 40-50% के महत्वपूर्ण थ्रेशोल्ड के आगे बुद्धिमत्ता में विनाशकारी गिरावट आती है।

मूल लेखक: Weiwei Wang, Jiyong Min, Weijie Zou

प्रकाशित 2026-01-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weiwei Wang, Jiyong Min, Weijie Zou

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके शोध पत्र (paper) का स्पष्टीकरण दिया गया है।

मुख्य विचार: बीच में एक "खड़ी ढलान" (Cliff)

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट सहायक (एक AI मॉडल) है जिसे लंबी कहानियाँ पढ़ने और उनके बारे में सवालों के जवाब देने के लिए बनाया गया है। आप सोच सकते हैं कि यदि वह रोबोट 100 पन्नों की किताब पढ़ सकता है, तो वह 200 पन्नों की किताब को भी उतनी ही अच्छी तरह से संभाल लेगा, शायद बस थोड़ा अधिक समय लेगा।

इस शोध पत्र ने यह खोजा है कि यह सच नहीं है। कहानी लंबी होने पर रोबोट केवल थोड़ा धीमा या थोड़ा खराब होने के बजाय, एक निश्चित बिंदु तक तो बिल्कुल ठीक काम करता है, और फिर अचानक, वह गिर जाता है

लेखक इसे "इंटेलिजेंस डिग्रेडेशन" (बुद्धिमत्ता में गिरावट) कहते हैं। यह एक हाईवे पर कार चलाने जैसा है जो पहले 40 मील तक चिकना और सुरक्षित दिखता है, लेकिन फिर अचानक एक विशाल, अदृश्य ढलान (cliff) से टकरा जाता है। एक बार जब आप उस किनारे से नीचे गिर जाते हैं, तो कार केवल धीमी नहीं होती; वह सीधे नीचे की ओर गिरती चली जाती है।

मुख्य खोज: "उथली" अनुकूलन क्षमता (Shallow Adaptation)

शोधकर्ताओं ने पाया कि इन AI मॉडलों में लंबी कहानियों की समझ "उथली" (shallow) होती है।

  • स्थिर क्षेत्र (0% से 40%): यदि कहानी छोटी या मध्यम लंबाई की है, तो रोबोट बेहतरीन काम करता है। वह सब कुछ पूरी तरह से समझ लेता है।
  • ढलान (40% से 50%): जैसे ही कहानी उस सीमा से थोड़ी सी लंबी होती है (विशेष रूप से मॉडल की अधिकतम क्षमता के 40% और 50% के बीच), रोबोट का प्रदर्शन पूरी तरह से ध्वस्त (collapse) हो जाता है।
  • तल (50%+): एक बार जब वह ढलान से नीचे गिर जाता है, तो वह वहीं रहता है। भले ही आप कहानी को और भी लंबा कर दें, रोबोट बेहतर नहीं होता; वह बस भ्रमित रहता है और खराब प्रदर्शन करता है।

उदाहरण: कल्पना कीजिए कि एक छात्र 10 पन्नों का निबंध याद करने में बहुत अच्छा है। यदि आप उसे 15 पन्नों का निबंध देते हैं, तो वह ठीक काम करता है। लेकिन यदि आप उसे 20 पन्नों का निबंध देते हैं, तो वह अचानक वह सब कुछ भूल जाता है जो उसने अभी पढ़ा था और अंदाज़े लगाने लगता है। वह धीरे-धीरे खराब नहीं होता; वह बस काम करना बंद कर देता है।

उन्होंने "ढलान" को कैसे खोजा?

पिछले अध्ययनों ने लंबी कहानियों को टुकड़ों में काटकर या उन्हें एक विशिष्ट लंबाई में फिट करने के लिए नकली शब्दों का उपयोग करके इसे जांचने की कोशिश की थी। इस पेपर के लेखकों ने कहा, "यह धोखाधड़ी है।"

इसके बजाय, उन्होंने नेचुरल लेंथ डिस्ट्रीब्यूशन एनालिसिस (Natural Length Distribution Analysis) नामक विधि का उपयोग किया।

  • पुराना तरीका: एक लंबी किताब लेना, उसके अंत को काट देना, या उसे ठीक 100 पन्ने लंबा बनाने के लिए निरर्थक शब्द जोड़ना। इससे रोबोट भ्रमित हो सकता है क्योंकि कहानी टूट गई है।
  • नया तरीका: उन्होंने अलग-अलग प्राकृतिक लंबाई (कुछ छोटी, कुछ बहुत लंबी) की 1,000 वास्तविक कहानियाँ लीं और रोबोट को उन्हें ठीक वैसे ही पढ़ने दिया जैसे वे थीं, बिना काटे या बिना कुछ जोड़े।

इससे यह सिद्ध हुआ कि रोबोट की विफलता इसलिए नहीं थी क्योंकि कहानियाँ कटी हुई थीं; बल्कि इसलिए थी क्योंकि लंबाई स्वयं रोबोट के संभालने के लिए बहुत अधिक थी।

विशिष्ट संख्याएँ (कहाँ और कितना बुरा)

शोधकर्ताओं ने एक विशिष्ट ओपन-सोर्स मॉडल Qwen2.5-7B (जिसकी अधिकतम क्षमता 128,000 "टोकन" या टेक्स्ट के टुकड़ों को पढ़ने की है) का परीक्षण किया।

  • सुरक्षित क्षेत्र (Safe Zone): लगभग 51,200 टोकन (अधिकतम का 40%) तक, रोबोट ने एक टेस्ट में 0.56 का स्कोर किया (एक अच्छा स्कोर)।
  • क्रैश ज़ोन (Crash Zone): 51,200 से 64,000 टोकन (40% से 50%) के बीच, स्कोर तेजी से गिरकर 0.30 हो गया।
  • परिणाम: यह प्रदर्शन में 45.5% की गिरावट है। इसे ही वे "विनाशकारी" (catastrophic) विफलता कहते हैं।

उन्होंने इस सटीक ब्रेकिंग पॉइंट को खोजने के लिए पांच अलग-अलग गणितीय तरीकों का उपयोग किया, और पांचों ने सहमति जताई: ढलान मॉडल की कुल क्षमता के लगभग 43.2% के आसपास है।

ऐसा क्यों होता है? (क्यों)

पेपर इस बात के तीन मुख्य कारण बताता है कि रोबोट ढलान से क्यों गिरता है:

  1. ट्रेनिंग बायस (प्रशिक्षण पूर्वाग्रह): रोबोट को मुख्य रूप से छोटी और मध्यम कहानियों पर प्रशिक्षित किया गया था। इसने ऐसे शॉर्टकट सीख लिए जो छोटे टेक्स्ट के लिए काम करते हैं लेकिन लंबे टेक्स्ट के लिए विफल हो जाते हैं। यह एक ऐसे धावक जैसा है जो स्प्रिंट (तेज़ दौड़) के लिए प्रशिक्षण लेता है लेकिन मैराथन दौड़ने की कोशिश करता है; उसकी स्प्रिंटिंग तकनीक लंबी दूरी में विफल हो जाती है।
  2. भ्रमित ध्यान (Confused Attention): जैसे-जैसे कहानी लंबी होती है, रोबोट "विचलित" होने लगता है। वह हर एक शब्द पर ध्यान देने की कोशिश करता है, लेकिन क्योंकि शब्द बहुत अधिक हैं, वह अंततः किसी विशेष चीज़ पर ध्यान केंद्रित नहीं कर पाता। वह अपना फोकस खो देता है।
  3. "रूलर" (पैमाना) टूट जाता है: रोबोट वाक्य में शब्दों के स्थान को ट्रैक रखने के लिए एक विशेष गणितीय उपकरण (जिसे RoPE कहा जाता है) का उपयोग करता है। यह उपकरण छोटी दूरियों के लिए बहुत अच्छा काम करता है, लेकिन यदि वाक्य बहुत लंबा हो जाता है, तो यह उपकरण गड़बड़ी करने लगता है, जिससे रोबोट अपना रास्ता भटक जाता है।

उपयोगकर्ताओं के लिए निष्कर्ष

यदि आप लंबी दस्तावेज़ों को पढ़ने के लिए इस विशिष्ट AI मॉडल (Qwen2.5-7B) का उपयोग कर रहे हैं:

  • इसे अपनी सीमा तक न धकेलें। भले ही मॉडल कहता है कि वह 128,000 टोकन संभाल सकता है, आपको टेक्स्ट देना तब तक बंद कर देना चाहिए जब तक आप लगभग 51,200 टोकन (सीमा का 40%) तक पहुँचते हैं।
  • यदि आप उस 40% के निशान को पार करते हैं, तो आपको "अधिक" बुद्धिमत्ता नहीं मिलेगी; बल्कि आप काफी कम बुद्धिमत्ता प्राप्त करेंगे। मॉडल प्रभावी रूप से टूट जाता है।

यह शोध पत्र पहला है जिसने स्पष्ट रूप से मानचित्रित किया है कि ओपन-सोर्स मॉडलों के लिए यह "ढलान" कहाँ है और यह सिद्ध किया है कि विफलता अचानक और गंभीर होती है, क्रमिक (gradual) नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →