← नवीनतम पेपर
💬 NLP

Higher-order Linear Attention

यह शोध पत्र हायर-ऑर्डर लीनियर अटेंशन (HLA) को प्रस्तुत करता है, जो एक स्केलेबल, कॉज़ल मैकेनिज्म है जो कॉम्पैक्ट प्रीफ़िक्स पर्याप्त सांख्यिकी (prefix sufficient statistics) को बनाए रखकर लीनियर टाइम कॉम्प्लेक्सिटी के साथ हायर-ऑर्डर इंटरैक्शन प्राप्त करता है, जिससे रिकरेंट आर्किटेक्चर की अभिव्यक्ति क्षमता को संरक्षित करते हुए मानक अटेंशन की क्वाड्रेटिक लागत पर विजय प्राप्त की जा सकती है।

मूल लेखक: Yifan Zhang, Zhen Qin, Quanquan Gu

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yifan Zhang, Zhen Qin, Quanquan Gu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी किताब पढ़ने की कोशिश कर रहे हैं, लेकिन आपका एक बहुत सख्त नियम है: आप केवल वही याद रख सकते हैं जो आपने अब तक पढ़ा है, और आपको प्रत्येक शब्द को एक-एक करके प्रोसेस करना होगा जैसे-जैसे वह आता है।

आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे करने का मानक तरीका (जिसे "ट्रांसफॉर्मर अटेंशन" कहा जाता है) ऐसा है जैसे आप हर नए शब्द के मिलने पर अब तक पढ़ी गई पूरी किताब को याद करने की कोशिश करते हैं। वर्तमान शब्द को समझने के लिए, AI पिछले हर एक शब्द को देखता है, उन सभी की तुलना करता है, और एक स्कोर निकालता है। यदि किताब में 10,000 शब्द हैं, तो यह "पीछे देखने" की प्रक्रिया अविश्वसनीय रूप से धीमी और मेमोरी-भारी हो जाती है क्योंकि AI हर शब्द की तुलना हर दूसरे शब्द से करता है। यह भीड़ में किसी विशिष्ट व्यक्ति को खोजने के लिए हर एक व्यक्ति से यह पूछने जैसा है कि क्या वे उस व्यक्ति को जानते हैं, और यह बार-बार करना।

हायर-ऑर्डर लीनियर अटेंशन (HLA) एक नया तरीका है जिसे शोधकर्ताओं द्वारा इस समस्या को हल करने के लिए प्रस्तावित किया गया है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग करें:

1. समस्या: "क्वाड्रेटिक" बाधा (The "Quadratic" Bottleneck)

पुराना तरीका एक ग्रुप चैट की तरह है जहाँ हर किसी को एक-दूसरे को जवाब देना पड़ता है। यदि NN लोग हैं, तो बातचीत की संख्या N×NN \times N है। जैसे-जैसे ग्रुप बड़ा होता है, चैट प्रबंधित करना असंभव हो जाता है। यही कारण है कि वर्तमान AI मॉडल बहुत लंबे संदर्भों (जैसे एक बार में पूरी उपन्यास पढ़ने) के साथ संघर्ष करते हैं।

2. समाधान: "स्मार्ट नोटबुक" (लीनियर अटेंशन)

पिछले समाधानों ने एक "सारांश" या "नोटबुक" का उपयोग करके इसे ठीक करने की कोशिश की। हर विशिष्ट बातचीत को याद रखने के बजाय, AI केवल सबसे महत्वपूर्ण चीजों का एक चलता-फिरता हिसाब रखता है।

  • फर्स्ट-ऑर्डर (बेसिक नोटबुक): कल्पना कीजिए कि आपके पास एक नोटबुक है जहाँ आप केवल देखे गए लाल कारों और नीली कारों की कुल संख्या लिखते हैं। जब कोई नई कार आती है, तो आप बस गिनती अपडेट कर देते हैं। यह तेज़ है, लेकिन यह थोड़ा कम बुद्धिमान है। इसे यह नहीं पता होता कि कारें एक-दूसरे से कैसे संबंधित हैं, बस यह कि वे मौजूद हैं।

3. नवाचार: "एडवांस्ड डैशबोर्ड" (हायर-ऑर्डर HLA)

लेखक कहते हैं, "क्या होगा अगर हमारी नोटबुक स्मार्ट हो सके? क्या होगा अगर यह न केवल गिनती, बल्कि यह भी याद रख सके कि कारें एक-दूसरे से कैसे संबंधित हैं?"

वे हायर-ऑर्डर लीनियर अटेंशन (HLA) पेश करते हैं।

  • उपमा: केवल गणनाओं की सूची के बजाय, एक डैशबोर्ड की कल्पना करें जो ट्रैक करता है:
    1. कारों की कुल संख्या।
    2. कारों के बीच का "संबंध" (जैसे, "एक नीली कार के बाद कितनी लाल कारें देखी गई हैं?")।
    3. यहाँ तक कि अधिक जटिल पैटर्न (जैसे, "लाल कारें उन नीली कारों के साथ कैसे इंटरैक्ट करती हैं जो एक हरी कार के बाद आईं?")।

यह डैशबोर्ड हायर-ऑर्डर कहलाता है क्योंकि यह केवल सरल योग के बजाय इन जटिल, बहु-स्तरीय संबंधों (इंटरेक्शन) को देखता है।

4. यह तेज़ कैसे रहता है ("स्ट्रीमिंग" का जादू)

HLA का जादू यह है कि यह यह सारा जटिल गणित बिना धीमा किए करता है।

  • पुराना तरीका: कारों के बीच संबंध की गणना करने के लिए, आपको शायद हर कार बनाम हर कार का एक विशाल ग्रिड लिखना पड़ सकता है (एक विशाल N×NN \times N मैट्रिक्स)। इसमें बहुत समय लगता है।
  • HLA का तरीका: AI एक कॉम्पैक्ट, कांस्टेंट-साइज़ स्टेट बनाए रखता है। इसे एक डैशबोर्ड गेज की तरह समझें। चाहे आपने 10 मील की यात्रा की हो या 10,000 मील की, डैशबोर्ड में केवल कुछ सुइयां और नंबर होते हैं। जब एक नई कार गुजरती है, तो AI बस उन सुइयों को थोड़ा सा ट्यून करता है। इसे पूरे इतिहास को पीछे देखने की आवश्यकता नहीं होती; यह बस वर्तमान सारांश को अपडेट करता है।
  • परिणाम: इसे जटिल संबंधों (जैसे पुराने तरीके) को देखने के "स्मार्ट" लाभ मिलते हैं, लेकिन यह सरल नोटबुक विधि की "तेज़" गति को भी बनाए रखता है।

5. "स्ट्रिक्टली कॉज़ल" (Strictly Causal) नियम

पेपर इस बात पर जोर देता है कि यह सिस्टम स्ट्रिक्टली कॉज़ल है।

  • उपमा: कल्पना कीजिए कि आप एक फिल्म देख रहे हैं। आप केवल उन दृश्यों से जानकारी का उपयोग कर सकते हैं जिन्हें आप पहले ही देख चुके हैं। आप अंत में झाँक नहीं सकते।
  • HLA यह सुनिश्चित करता है कि वर्तमान क्षण के लिए "डैशबोर्ड" की गणना करते समय, यह भविष्य में होने वाली किसी भी चीज़ को पूरी तरह से अनदेखा कर दे। यह एक विशेष "करेक्शन समरी" (गणितीय ट्रिक) का उपयोग करके यह सुनिश्चित करता है कि भविष्य की कोई भी जानकारी गलती से शामिल न हो जाए। यह इसे रीयल-टाइम स्ट्रीमिंग (जैसे लाइव चैट या लाइव वीडियो फीड) में पूरी तरह से काम करने योग्य बनाता है।

6. समानांतर में प्रशिक्षण (टीमवर्क की ट्रिक)

आमतौर पर, यदि आप एक AI को यह "एक-एक करके" स्ट्रीमिंग करने के लिए प्रशिक्षित करना चाहते हैं, तो आपको इसे धीरे-धीरे, स्टेप-बाय-स्टेप करना होगा, जो शक्तिशाली कंप्यूटरों (GPUs) पर धीमा होता है।

  • पेपर की ट्रिक: लेखकों ने एक गणितीय तरीका खोजा जिससे वे लंबी किताब को चंक्स (टुकड़ों) (जैसे अध्याय) में तोड़ सकें।
  • उन्होंने एक विशेष "गोंद" (जिसे एसोसिएटिव स्कैन कहा जाता है) बनाया जो कंप्यूटर को अध्याय 1, अध्याय 2 और अध्याय 3 के सारांश को एक साथ गणना करने और फिर उन्हें पूरी तरह से जोड़ने की अनुमति देता है।
  • उपमा: एक रिले रेस की कल्पना करें। आमतौर पर, धावक को पिछले धावक के समाप्त करने का इंतजार करना पड़ता है। लेकिन HLA के साथ, टीम पूरी दौड़ के परिणाम को छोटे-छोटे स्प्रिंट के परिणामों को जोड़कर तुरंत निकाल सकती है, और अंतिम परिणाम बिल्कुल वही होता है जैसा कि यदि उन्होंने इसे एक-एक करके चलाया होता।

उनके दावे का सारांश

  • उन्होंने क्या बनाया: उन्होंने डेटा के लंबे अनुक्रमों (जैसे टेक्स्ट) पर ध्यान देने का एक नया तरीका बनाया जो स्मार्ट (जटिल पैटर्न को समझता है) और तेज़ (टेक्स्ट लंबा होने पर धीमा नहीं होता) दोनों है।
  • यह कैसे काम करता है: यह सांख्यिकी (मोमेंट्स) के एक "डैशबोर्ड" का उपयोग करता है जो हर नए शब्द के साथ तुरंत अपडेट होता है, जिससे इतिहास के विशाल ग्रिड को स्टोर करने की आवश्यकता नहीं होती।
  • "हायर-ऑर्डर" वाला हिस्सा: यह केवल एकल शब्दों के बजाय शब्दों के बीच दूसरे-क्रम (जोड़े) और तीसरे-क्रम (त्रिक) के संबंधों को देखता है।
  • गारंटी: उन्होंने गणितीय रूप से सिद्ध किया कि यह तेज़, चंक्ड (टुकड़ों में किया गया) तरीका, धीमे, स्टेप-बाय-स्टेप तरीके के बिल्कुल समान परिणाम देता है।

संक्षेप में, HLA एक कार को साधारण स्पीडोमीटर से हाई-टेक डैशबोर्ड में अपग्रेड करने जैसा है जो जटिल इंजन इंटरैक्शन को ट्रैक करता है, लेकिन यह ऐसा करता है बिना कार को भारी या धीमा बनाए, जिससे यह बिना ईंधन (मेमोरी) खत्म हुए हमेशा के लिए चलने में सक्षम होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →