← नवीनतम पेपर
💬 NLP

Latent-Condensed Transformer for Efficient Long Context Modeling

यह शोध पत्र लेटेंट-कंडेंस्ड अटेंशन (LCA) प्रस्तुत करता है, जो एक आर्किटेक्चर-अज्ञेय (architecture-agnostic) विधि है जो क्वेरी-अवेयर पूलिंग और एंकर सिलेक्शन के माध्यम से मल्टी-हेड लेटेंट अटेंशन (MLA) के लेटेंट स्पेस के भीतर सीधे संदर्भ को सघन (condense) करके लॉन्ग-कॉन्टेक्स्ट मॉडलिंग के लिए कम्प्यूटेशनल दक्षता और KV कैश न्यूनीकरण को संयुक्त रूप से अनुकूलित करती है, जिससे प्रदर्शन से समझौता किए बिना महत्वपूर्ण गति और मेमोरी की बचत प्राप्त होती है।

मूल लेखक: Zeng You, Yaofo Chen, Qiuwu Chen, Ying Sun, Shuhai Zhang, Yingjian Li, Yaowei Wang, Mingkui Tan

प्रकाशित 2026-04-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zeng You, Yaofo Chen, Qiuwu Chen, Ying Sun, Shuhai Zhang, Yingjian Li, Yaowei Wang, Mingkui Tan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अकेले प्रश्न का उत्तर देने के लिए एक विशाल, 1,00,000 पन्नों के विश्वकोश (encyclopedia) को पढ़ने की कोशिश कर रहे हैं।

समस्या: "अतिभारित लाइब्रेरियन" (The Overwhelmed Librarian)
वर्तमान AI मॉडल (लार्ज लैंग्वेज मॉडल्स) एक प्रतिभाशाली लेकिन अत्यधिक काम के बोझ से दबे लाइब्रेरियन की तरह कार्य करते हैं। जब आप कोई प्रश्न पूछते हैं, तो लाइब्रेरियन ने जो कुछ भी पढ़ा है, उसके हर एक शब्द को याद करने की कोशिश करता है।

  1. मेमोरी की समस्या: जैसे-जैसे किताब लंबी होती जाती है, लाइब्रेरियन के "स्टिकी नोट्स" (जिसे KV Cache कहा जाता है) रैखिक रूप से बढ़ते जाते हैं। 1,00,000 पन्नों की किताब के लिए, उन्हें हर एक पन्ने के लिए एक स्टिकी नोट चाहिए होगा। इससे उनकी डेस्क (मेमोरी) तुरंत भर जाती है।
  2. गति की समस्या: उत्तर खोजने के लिए, लाइब्रेरियन को अपने द्वारा पढ़े गए हर एक पन्ने की आपके प्रश्न के साथ तुलना करनी पड़ती है। यदि किताब 1,00,000 पन्नों की है, तो उन्हें 1,00,000 x 1,00,000 तुलनाएँ करनी होंगी। यह घास के ढेर में सुई खोजने जैसा है, जहाँ आपको हर एक तिनके की दूसरे तिनके से तुलना करनी पड़ती है। यह अविश्वसनीय रूप से धीमा है।

वर्तमान "उपाय" (और वे क्यों विफल होते हैं)
वैज्ञानिकों ने लाइब्रेरियन की मदद के लिए दो मुख्य तरकीबें आजमाई हैं:

  • तरकीब A (MLA): हर पन्ने के लिए एक पूर्ण स्टिकी नोट लिखने के बजाय, वे एक छोटा, संकुचित सारांश लिखते हैं। यह डेस्क की जगह तो बचाता है, लेकिन लाइब्रेरियन को उत्तर खोजने के लिए अभी भी उन सभी छोटे सारांशों को पढ़ना पड़ता है। यह अभी भी धीमा है।
  • तरकीब B (Sparse Attention): लाइब्रेरियन तय करता है कि वह केवल पन्ने 1, 100, 500 और 999 को ही पढ़ेगा, बाकी को अनदेखा कर देगा। यह तेज़ है, लेकिन वे वह महत्वपूर्ण पन्ना (मान लीजिए पन्ना 450) चूक सकते हैं जिसमें वास्तव में उत्तर छिपा है।

नया समाधान: "लेटेंट-कंडेंस्ड अटेंशन" (LCA)
यह पेपर लाइब्रेरियन की डेस्क को व्यवस्थित करने का एक नया तरीका पेश करता है। केवल सारांश बनाने या पन्नों को छोड़ने के बजाय, लाइब्रेरियन किताब को अध्यायों (chapters) में समूहित (group) करता है और प्रत्येक के लिए एक "सुपर-चैप्टर" बनाता है।

यहाँ LCA कैसे काम करता है, एक रचनात्मक उपमा (analogy) का उपयोग करते हुए:

1. "समूहीकरण" की रणनीति (The Grouping Strategy)

कल्पना कीजिए कि 1,00,000 पन्नों को 16 पन्नों के समूहों में विभाजित किया गया है।

  • सिमेंटिक भाग (कहानी - The Story): उन 16 पन्नों की कहानी के कंटेंट के लिए, लाइब्रेरियन केवल एक पन्ना नहीं चुनता है। इसके बजाय, वे उन 16 पन्नों के सबसे महत्वपूर्ण वाक्यों को मिलाकर एक एकल, पूर्ण "सुपर-सेंटेंस" बनाते हैं।
    • उपमा: यदि 16 पन्ने एक बिल्ली के बारे में हैं, तो "सुपर-सेंटेंस" बिना उन सभी 16 पन्नों को अलग से पढ़े, बिल्ली के सार को पूरी तरह से पकड़ लेता है।
  • पोजीशनल भाग (पता - The Address): हालाँकि, कहानी कहाँ हो रही है, यह मायने रखता है। आप 16 अलग-अलग घरों के पते को एक में नहीं मिला सकते। इसलिए, स्थान के लिए, लाइब्रेरियन उस समूह में से एक सबसे महत्वपूर्ण पन्ने को चुनता है और उसका सटीक पता रखता है।
    • उपमा: यदि कहानी रसोई में एक बिल्ली के बारे में है, तो लाइब्रेरियन रसोई का सटीक पता रखता है, जिससे AI को यह पता चलता है कि बिल्ली कहाँ है।

2. "लोकल विंडो" (हालिया स्मृति - The Recent Memory)

लाइब्रेरियन जानता है कि पिछले कुछ पन्ने आमतौर पर वर्तमान प्रश्न के लिए सबसे महत्वपूर्ण होते हैं। इसलिए, वे अंतिम 1,000 पन्नों को बिना किसी बदलाव के, पूर्ण, हाई-डेफिनिशन विवरण में रखते हैं। वे केवल पुराने, दूर के इतिहास को "कंप्रेस" (संकुचित) करना शुरू करते हैं।

3. परिणाम: एक सुपर-एफिशिएंट लाइब्रेरियन

इस प्रकार, लाइब्रेरियन 1,00,000 पन्नों की किताब को इसमें बदल देता है:

  • कुछ हजार "सुपर-सेंटेंस" (पुराने इतिहास का प्रतिनिधित्व करने के लिए)।
  • कुछ हजार "सटीक पते" (यह ट्रैक रखने के लिए कि चीजें कहाँ हुईं)।
  • अंतिम 1,000 पन्ने पूर्ण विवरण में।

यह गेम-चेंजर क्यों है?

  • गति: 1,00,000 पन्नों की तुलना करने के बजाय, लाइब्रेरियन अब केवल कुछ हज़ार "सुपर-ग्रुप्स" के विरुद्ध आपके प्रश्न की तुलना करता है। पेपर दिखाता है कि यह AI को लंबे दस्तावेज़ पढ़ने में 2.5 गुना तेज़ बनाता है।
  • मेमोरी: "स्टिकी नोट्स" (KV Cache) 90% तक सिकुड़ जाते हैं। लाइब्रेरियन अब डेस्क की जगह खत्म हुए बिना विशाल किताबें संभाल सकता है।
  • सटीकता: क्योंकि वे केवल पन्नों को हटाने के बजाय पूरे समूह के अर्थ को मिलाते हैं, वे महत्वपूर्ण जानकारी नहीं खोते हैं। वे यह भी सुनिश्चित करते हैं कि चीजें कहाँ हुईं, इसके लिए सटीक स्थान रखते हैं, ताकि वे भ्रमित न हों।

निचोड़ (The Bottom Line)

LCA को एक स्मार्ट फाइलिंग सिस्टम के रूप में देखें जो न केवल पुरानी फाइलों को फेंक देता है या उन्हें अंधाधुंध सिकोड़ देता है। इसके बजाय, यह अतीत के लिए स्मार्ट सारांश बनाता है और साथ ही यह भी रखता है कि चीजें कहाँ हुईं इसके लिए सटीक निर्देशांक (coordinates), और हाल की खबरों को पूर्ण रंग (full color) में रखता है।

यह AI को एक एकल अध्याय पढ़ने में लगने वाले समय में पूरी लाइब्रेरी पढ़ने की अनुमति देता है, बिना उन विवरणों को भूले जो महत्वपूर्ण हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →