← नवीनतम पेपर
🤖 machine learning

Interdomain Attention: Beyond Token-Level Key-Value Memory

यह शोध पत्र इंटरडोमेन अटेंशन (Interdomain Attention) का प्रस्ताव करता है, जो एक नवीन आर्किटेक्चर है जो कर्नेल विधियों के माध्यम से स्टेट स्पेस मॉडल्स (SSMs) को अटेंशन मैकेनिज्म में एकीकृत करके एक निश्चित आकार के स्टेट पर क्वेरी-कंडीशन्ड अटेंशन प्राप्त करता है, जिससे SSMs की स्केलेबिलिटी और लंबाई-रोबस्टनेस को कंटेंट-आधारित मिलान के प्रदर्शन लाभों के साथ जोड़ा जा सके।

मूल लेखक: Naoki Kiyohara, Harrison Bo Hua Zhu, Riccardo El Hassanin, Zhuo Sun, Wenlong Chen, Samir Bhatt, Yingzhen Li

प्रकाशित 2026-05-26
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Naoki Kiyohara, Harrison Bo Hua Zhu, Riccardo El Hassanin, Zhuo Sun, Wenlong Chen, Samir Bhatt, Yingzhen Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "इंटरडोमेन अटेंशन" (Interdomain Attention) पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "बहुत अधिक सामग्री" की दुविधा (The "Too Much Stuff" Dilemma)

कल्पना कीजिए कि आप एक कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपकी याददाश्त बहुत खराब है।

  • पुराना तरीका (स्टैंडर्ड ट्रांसफॉर्मर): अगला वाक्य लिखने के लिए, आपको अब तक लिखे गए हर एक शब्द को पीछे मुड़कर देखना पड़ता है। यदि आप 100 पन्नों की किताब लिखते हैं, तो सही कनेक्शन खोजने के लिए आपके मस्तिष्क को उन सभी 100 पन्नों को एक साथ अपने दिमाग में रखना होगा। यह अविश्वसनीय रूप से धीमा है और इसके लिए भारी मानसिक ऊर्जा (कंप्यूटिंग पावर) की आवश्यकता होती है। जैसे-जैसे कहानी लंबी होती जाती है, आपका मस्तिष्क अभिभूत (overwhelmed) हो जाता है।
  • वैकल्पिक तरीका (स्टेट स्पेस मॉडल्स/SSMs): ऊर्जा बचाने के लिए, आप पूरी कहानी को एक छोटे से नोट कार्ड में सारांशित (summarize) कर देते हैं। अगला वाक्य लिखने के लिए आप केवल इस नोट कार्ड को देखते हैं। यह कितना भी लंबा हो, यह सुपर फास्ट और कुशल है। हालाँकि, क्योंकि आपके पास केवल एक छोटा सा नोट कार्ड है, आप अक्सर विशिष्ट विवरणों को चूक जाते हैं। आप तीन अध्याय पहले उल्लेखित किसी पात्र का नाम भूल सकते हैं।

लक्ष्य: लेखक एक ऐसा सिस्टम बनाना चाहते थे जिसमें छोटे नोट कार्ड की गति और दक्षता (speed and efficiency) भी हो और पूरी किताब को देखने जैसी याददाश्त और विवरण (memory and detail) भी हो।


समाधान: "इंटरडोमेन अटेंशन" (Interdomain Attention)

लेखकों ने एक नया तरीका बनाया जिसे इंटरडोमेन अटेंशन कहा जाता है। इसे एक स्मार्ट लाइब्रेरियन (पुस्तकालयाध्यक्ष) के रूप में समझें जो एक लाइब्रेरी को एक बहुत ही विशिष्ट तरीके से प्रबंधित करता है।

1. "संकुचित लाइब्रेरी" (The Compressed Library - SSM कोर)

हर एक किताब (टोकन) को शेल्फ पर रखने के बजाय, लाइब्रेरियन कहानी के पूरे इतिहास को संकुचित करने के लिए एक विशेष मशीन (एक SSM) का उपयोग करता है, जिससे "समरी कोएफिशिएंट्स" (summary coefficients) का एक निश्चित आकार का सेट बनता है।

  • उपमा: कल्पना कीजिए कि आपके पास 1,000 पन्नों का उपन्यास है। सभी 1,000 पन्ने रखने के बजाय, आप कहानी को कुछ विशिष्ट "थीम्स" या "वाइब्स" (जैसे "नायक की यात्रा," "खलनायक का मकसद," "सेटिंग का मूड") में सान (distill) देते हैं। ये 64 थीम्स आपकी "स्टेट" (state) हैं। चाहे कहानी 10 पन्नों की हो या 10,000 पन्नों की, आपको हमेशा केवल इन 64 थीम्स को ही अपने हाथ में रखने की आवश्यकता होगी।

2. "स्मार्ट क्वेरी" (The Smart Query - अटेंशन वाला हिस्सा)

जब आप अगला वाक्य लिखना चाहते हैं, तो आप केवल उन 64 थीम्स को अंधाधुंध नहीं देखते। आप एक विशिष्ट प्रश्न पूछते हैं (एक "क्वेरी")।

  • जादुई ट्रिक: सिस्टम आपके प्रश्न को लेता है और उसे उन्हीं 6स्यों "भाषा" में अनुवादित करता है जिसमें वे 64 थीम्स हैं। फिर यह जाँचता है: "इन 64 थीम्स में से कौन सी मेरी वर्तमान प्रश्न के लिए सबसे अधिक प्रासंगिक है?"
  • परिणाम: आपको दोनों दुनियाओं का सर्वश्रेष्ठ मिलता है। आप एक संकुचित सारांश देख रहे हैं (तेज़!), लेकिन आप वर्तमान में जो सोच रहे हैं उसके आधार पर उस सारांश के सही हिस्सों का चयन कर रहे हैं (स्मार्ट!)।

यह कैसे काम करता है ("किचन" की उपमा)

कल्पना कीजिए कि आप एक शेफ हैं जो सूप (आउटपुट) बना रहे हैं।

  • स्टैंडर्ड अटेंशन: आपके पास सामग्रियों का एक विशाल बर्तन (पूरा इतिहास) है। नमक डालने के लिए, आपको यह तय करने के लिए बर्तन में मौजूद हर एक सामग्री को चखना होगा कि कितना नमक डालना है। जैसे-जैसे बर्तन बड़ा होता जाता है, इसमें बहुत समय लगता है।
  • स्टैंडर्ड SSM: आपके पास केवल 64 जार वाला एक छोटा सा मसाला रैक है। आप बस एक जार उठाते हैं और डाल देते हैं। यह तेज़ है, लेकिन अब आप विशिष्ट सामग्रियों को चख नहीं सकते।
  • इंटरडोमन अटेंशन:
    1. आपके पास एक मशीन है जो आपके द्वारा अब तक पकाए गए हर व्यंजन के आधार पर एक निश्चित आकार का मसाला रैक (64 थीम्स) को लगातार अपडेट करती रहती है।
    2. जब आप नमक डालना चाहते हैं, तो आप पूरे बर्तन को नहीं चखते। इसके बजाय, आप एक विशेष टेस्टिंग स्पून (क्वेरी फीचर मैप) पकड़ते हैं जो तुरंत आपको बता देता है: "वर्तमान स्वाद के आधार पर, आपको 'टमाटर' के जार का 30% और 'हर्ब' के जार का 70% मिलाना चाहिए।"
    3. आप अपने निश्चित मसाला रैक से उन विशिष्ट मात्राओं को मिलाते हैं। यह तेज़ है क्योंकि रैक छोटा है, लेकिन यह सटीक है क्योंकि आपका चम्मच जानता है कि वर्तमान क्षण के लिए उन्हें कैसे मिलाना है।

इस पेपर ने वास्तव में क्या पाया

लेखकों ने छोटे (125 मिलियन पैरामीटर्स) से लेकर बड़े (1.3 बिलियन पैरामीटर्स) तक के लैंग्वेज मॉडल्स पर इस नए "इंटरडोमेन अटेंशन" का परीक्षण किया। यहाँ उनके मुख्य दावे हैं:

  1. यह "छोटे नोट कार्ड" (SSM) को मात देता है: हर परीक्षण में, इंटरडोमेन अटेंशन स्टैंडर्ड SSM पद्धति की तुलना में टेक्स्ट लिखने में बेहतर था। इसने तेज़ रहते हुए भी संदर्भ (context) को बेहतर ढंग से समझा।
  2. यह स्केल पर "विशाल बर्तन" (स्टैंडंड अटेंशन) को भी पीछे छोड़ देता है: जिस सबसे बड़े आकार (1.3 बिलियन पैरामीटर्स) पर उन्होंने परीक्षण किया, उसमें इंटरडोमेन अटेंशन ने वास्तव में स्टैंडर्ड तरीके (जो हर शब्द को देखता है) की तुलना में बेहतर टेक्स्ट लिखा (कम "परप्लेक्सिटी" और बेहतर कॉमन सेंस स्कोर)।
  3. यह लंबी कहानियों को नहीं भूलता: सबसे बड़ी जीत लंबाई (length) है। स्टैंडर्ड तरीके भ्रमित हो जाते हैं और गलतियाँ करने लगते हैं जब कहानी उनके प्रशिक्षण (training) से लंबी हो जाती है। इंटरडोमेन अटेंशन तब भी शांत और सुसंगत रहा जब कहानी अपनी ट्रेनिंग से 3.5 गुना लंबी थी। यह धीमा या भ्रमित नहीं हुआ; यह बस काम करता रहा।
  4. सीक्रेट सॉस (Secret Sauce): उन्होंने एक "मैकेनिज्म डिकंपोजिशन" (मशीन को खोलकर यह देखने का एक तरीका कि किस हिस्से ने काम किया) किया। उन्होंने पाया कि क्वेरी-कंडीशन्ड प्रोजेक्शन (वह "स्मार्ट स्पून" जो आपके प्रश्न को सारांश की भाषा में अनुवादित करता है) ही सफलता का मुख्य कारण था। उस विशिष्ट चरण के बिना, सिस्टम केवल एक स्टैंडर्ड SSM की तरह काम करता और खराब प्रदर्शन करता।

ट्रेड-ऑफ (यह क्या नहीं कर सकता)

पेपर इसकी एक कमजोरी के बारे में ईमानदार है: सटीक रिकॉल (Exact Recall)

  • उपमा: यदि आप सिस्टम से पूछते हैं, "पेज 4 पर उल्लेखित पात्र का सटीक फोन नंबर क्या था?" तो स्टैंडर्ड तरीका (पूरी किताब को देखना) इसे खोजने में बहुत अच्छा है। इंटरडोमेन अटेंशन, क्योंकि यह एक संकुचित सारांश पर निर्भर करता है, सटीक टेक्स्ट स्ट्रिंग्स (जैसे फोन नंबर या विशिष्ट नाम) को प्राप्त करने में उतना अच्छा नहीं है यदि वे मुख्य "थीम्स" का हिस्सा नहीं हैं।
  • हालाँकि, लेखकों ने नोट किया कि यह सूचना को संकुचित करने वाले किसी भी सिस्टम की एक सीमा है, न कि केवल उनके नए तरीके की।

सारांश

इंटरडोमेन अटेंशन AI के लिए चीजों को याद रखने का एक नया तरीका है। दुनिया को अपने दिमाग में रखने की कोशिश करने (धीमा) या केवल एक छोटे नोट (भुलक्कड़) के बजाय, यह दुनिया का एक स्मार्ट, संकुचित सारांश रखता है। जब इसे लिखने की आवश्यकता होती है, तो यह उस सारांश के बिल्कुल सही हिस्सों को चुनने के लिए एक विशेष ट्रांसलेटर का उपयोग करता है। यह इसे तेज़, कुशल और लंबी कहानों को बिना भ्रमित हुए संभालने में आश्चर्यजनक रूप से सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →