← नवीनतम पेपर
🤖 machine learning

Local Attention Mechanism: Boosting the Transformer Architecture for Long-Sequence Time Series Forecasting

यह शोध पत्र लोकल अटेंशन मैकेनिज्म (LAM) को प्रस्तुत करता है, जो कि टाइम सीरीज़ निरंतरता के लिए विशेष रूप से तैयार किया गया एक कुशल O(n log n) अटेंशन एल्गोरिदम है, जो ट्रांसफॉर्मर्स में एकीकृत होने पर लॉन्ग-होरिज़न फोरकास्टिंग में अत्याधुनिक मॉडलों से बेहतर प्रदर्शन करता है और साथ ही मूल्यांकन अंतराल को दूर करने के लिए एक नवीन डेटासेट सूट का प्रस्ताव भी देता है।

मूल लेखक: Ignacio Aguilera-Martos, Andrés Herrera-Poyatos, Julián Luengo, Francisco Herrera

प्रकाशित 2026-07-29
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ignacio Aguilera-Martos, Andrés Herrera-Poyatos, Julián Luengo, Francisco Herrera

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी, घुमावदार सड़क को देखकर भविष्य की भविष्यवाणी करने की कोशिश कर रहे हैं। शायद यह शेयर बाजार का रास्ता हो, किसी शहर में बिजली का प्रवाह हो, या ट्रैफिक के बीच एक टैक्सी की आवाजाही। यह टाइम सीरीज़ फोरकास्टिंग (समय श्रृंखला पूर्वानुमान) की दुनिया है: भविष्य का अनुमान लगाने के लिए पिछले डेटा बिंदुओं का उपयोग करना। लंबे समय तक, कंप्यूटर संघर्ष करते रहे क्योंकि जब सड़क बहुत लंबी हो जाती थी, तो वे "बड़ी तस्वीर" देखने में असमर्थ रहते थे। वे पिछले कुछ कदमों को याद रखने में तो माहिर थे, लेकिन जब उन्हें हफ्तों या महीनों आगे देखने के लिए कहा जाता था, तो वे भ्रमित हो जाते थे या उनकी मेमोरी खत्म हो जाती थी।

यहाँ ट्रांसफॉर्मर (Transformer) आता है, एक प्रकार का आर्टिफिशियल इंटेलिजेंस जो मानव भाषा को पढ़ने और लिखने के लिए प्रसिद्ध हुआ। ट्रांसफॉर्मर को एक सुपर-स्मार्ट जासूस के रूप में सोचें जो कहानी के हर सुराग को एक साथ देख सकता है, बजाय इसके कि वह शब्द-दर-शब्द पढ़े। यह "एक साथ सब कुछ देखने" की सुपरपावर, जिसे अटेंशन (attention) कहा जाता है, दूर के बिंदुओं को जोड़ने की अनुमति देती है। हालाँकि, जब इसे लंबी टाइम सीरीज़ पर लागू किया जाता है, तो इस जासूस के सामने एक समस्या आती है: हर एक सुराग को दूसरे हर सुराग से जोड़ने के लिए, उन्हें भारी मात्रा में गणित करना पड़ता है। यह एक पार्टी में मौजूद हर व्यक्ति को दूसरे हर व्यक्ति से मिलवाने जैसा है; हैंडशेक (हाथ मिलाने) की संख्या इतनी तेजी से बढ़ती है कि पार्टी थम जाती है। यह शोध पत्र इसी विशिष्ट ट्रैफिक जाम को हल करने की कोशिश करता है, और पूछता है: हम जासूस की सुपरपावर को बरकरार रखते हुए भी काम का बोझ कैसे कम कर सकते हैं?

लेखक इस नए उपकरण के रूप में एक चतुर नए टूल का परिचय देते हैं जिसे लोकल अटेंशन मैकेनिज्म (Local Attention Mechanism - LAM) कहा जाता है। उनका मुख्य निष्कर्ष यह है कि टाइम सीरीज़ डेटा के लिए, आपको भविष्य की भविष्यवाणी करने के लिए वास्तव में अतीत के हर क्षण को देखने की आवश्यकता नहीं है; आपको मुख्य रूप से उसके आसपास के क्षणों को देखने की आवश्यकता होती है। केवल इन "स्थानीय" पड़ोसों पर ध्यान केंद्रित करके, उन्होंने एक ऐसी विधि बनाई है जो गणितीय रूप से पारंपरिक दृष्टिकोण की तुलना में बहुत तेज़ और मेमोरी के मामले में हल्की है। अपने परीक्षणों में, इस नई विधि ने न केवल समय बचाया; बल्कि इसने वर्तमान शीर्ष मॉडलों से बेहतर भविष्यवाणी भी की, यहाँ तक कि लंबी अवधि (long horizons) को देखते समय भी।

समस्या: जासूस का ओवरलोड

यह समझने के लिए कि इस नए उपकरण की आवश्यकता क्यों है, आइए देखें कि मानक ट्रांसफॉर्मर कैसे काम करता है। कल्पना कीजिए कि एक जासूस एक डायरी के आधार पर रहस्य सुलझाने की कोशिश कर रहा है। मानक विधि, जिसे फुल अटेंशन (Full Attention) कहा जाता है, के लिए आवश्यक है कि जासूस डायरी के हर एक पन्ने को पढ़े और कनेक्शन खोजने के लिए उसे दूसरे हर पन्ने से तुलना करे। यदि डायरी में 1,000 पन्ने हैं, तो जासूस को लगभग 1,000,000 तुलनाएँ करनी होंगी। यदि डायरी में 10,000 पन्ने हैं, तो यह बढ़कर 100,000,000 हो जाएगा। वैज्ञानिक इसे क्वाड्रेटिक कॉम्प्लेक्सिटी (quadratic complexity - Θ(n2)\Theta(n^2)) कहते हैं। जैसे-जैसे डायरी लंबी होती जाती है, काम विस्फोट की तरह बढ़ता है, और कंप्यूटर की मेमोरी खत्म हो जाती है या उसे पूरा होने में बहुत समय लगता है।

इसके अलावा, लेखक बताते हैं कि जबकि यह "सब कुछ देखने" वाला दृष्टिकोण भाषा (जहाँ वाक्य की शुरुआत का एक शब्द अंत के शब्द से संबंधित हो सकता है) के लिए अच्छा काम करता है, यह अक्सर टाइम सीरीज़ के लिए ज़रूरत से ज़्यादा है। टाइम सीरीज़ में—जैसे तापमान या बिजली का उपयोग—जो अभी हो रहा है, वह आमतौर पर इस बात से प्रभावित होता है कि अभी कुछ क्षण पहले क्या हुआ था। तीन दिन पहले जो हुआ था, उससे संबंध अक्सर बहुत कमजोर होता है। फिर भी, मानक ट्रांसफॉर्मर उन कमजोर कनेक्शनों की गणना करने में ऊर्जा बर्बाद करता है जैसे कि वे मजबूत हों।

समाधान: पड़ोस की निगरानी (The Neighborhood Watch)

लेखक लोकल अटेंशन मैकेनिज्म (LAM) का प्रस्ताव करते हैं। जासूस को पूरी डायरी पढ़ने के बजाय, LAM उसे कहता है: "केवल पिछले कुछ पन्नों को देखो, और शायद एक विशिष्ट पैटर्न के कुछ पन्नों को देखो, लेकिन बाकी को अनदेखा कर दो।"

उन्होंने इस तंत्र को समय की "निरंतरता" (continuity) का लाभ उठाने के लिए डिज़ाइन किया है। वास्तविक दुनिया में, चीजें तुरंत नहीं बदलतीं; वे प्रवाहित होती हैं। यदि आप दोपहर 2:00 बजे का तापमान अनुमानित कर रहे हैं, तो 1:59 PM का तापमान एक बड़ा सुराग है, लेकिन पिछले मंगलवार का तापमान कम प्रासंगिक है। LAM अप्रासंगिक और दूर के अतीत को ब्लॉक करने के लिए एक गणितीय "मास्क" (फिल्टर) का उपयोग करता है।

LAM का जादू केवल यह नहीं है कि वह चीजों को अनदेखा करता है; बल्कि यह है कि वह उन्हें कैसे अनदेखा करता है। लेखकों ने टेंसर अलजेब्रा (tensor algebra) (डेटा को ब्लॉक्स में व्यवस्थित करने का एक शानदार तरीका) का उपयोग करके एक विशिष्ट एल्गोरिदम विकसित किया है जो कंप्यूटर को बेकार की गणनाओं को पूरी तरह से छोड़ने की अनुमति देता है। n2n^2 काम करने के बजाय, LAM nlognn \log n के अनुपात में काम करता है। इसे समझने के लिए: यदि एक मानक विधि को लंबे डेटासेट को प्रोसेस करने में 100 घंटे लगते हैं, तो LAM में केवल कुछ घंटे लग सकते हैं। यह एक शहर के हर घर की जाँच करने के बजाय केवल अपने स्वयं के स्ट्रीट और उसके बगल वाली कुछ गलियों के घरों की जाँच करने जैसा है।

परिणाम: तेज़ और स्मार्ट

टीम ने केवल टूल बनाया ही नहीं; उन्होंने इसे परखने के लिए टेस्ट भी किया। उन्होंने अपने LAM-एन्हांस्ड ट्रांसफॉर्मर की तुलना इन्फॉर्मर (Informer) जैसे लोकप्रिय मॉडल और कई पुराने सांख्यिकीय तरीकों सहित वर्तमान अत्याधुनिक (state-of-the-art) मॉडलों से की।

  1. बेहतर भविष्यवाणियाँ: बिजली के उपयोग, मौसम के पैटर्न और टैक्सी यात्राओं जैसे वास्तविक दुनिया के डेटा का उपयोग करके किए गए प्रयोगों में, LAM मॉडल ने लगातार प्रतिस्पर्धा से कम गलतियाँ कीं। यह लंबी अवधि (long horizons) की भविष्यवाणी करने में विशेष रूप से अच्छा था, जहाँ अन्य मॉडल भ्रमित होने लगते थे।
  2. दक्षता (Efficiency): LAM मॉडल काफी छोटा और हल्का था। जबकि इन्फॉर्मर मॉडल में 12 मिलियन से अधिक पैरामीटर (AI के "मस्तिष्क कोशिकाएं") थे, LAM मॉडल ने केवल लगभग 6 मिलियन के साथ बेहतर परिणाम प्राप्त किए।
  3. "फेयर" टेस्ट: लेखकों ने यह सुनिश्चित करने के लिए सावधानी बरती कि तुलना निष्पक्ष हो। उन्होंने इन्फॉर्मर के अपने विशेष अटेंशन मेथड (जिसे ProbAttention कहा जाता है) के खिलाफ LAM का परीक्षण किया, लेकिन बाकी कंप्यूटर आर्किटेक्चर को बिल्कुल समान रखा। इस आमने-सामने की टक्कर में भी, LAM जीत गया, जिससे यह साबित हुआ कि सुधार नए अटेंशन मैकेनिज्म से आया है, न कि केवल एक बेहतर कंप्यूटर डिज़ाइन से।

बेहतर डेटा के लिए आह्वान

शोध पत्र इन मॉडलों के परीक्षण के लिए उपयोग किए जाने वाले उपकरणों के बारे में एक महत्वपूर्ण अवलोकन भी करता है। लेखक तर्क देते हैं कि इस क्षेत्र में उपयोग किए जाने वाले मानक डेटासेट बहुत छोटे और बहुत सरल हैं। वे एक छात्र को केवल खाली पार्किंग लॉट का उपयोग करके गाड़ी चलाना सिखाने जैसा है। वास्तविक दुनिया की समस्याओं में, जैसे पूरे शहर के ट्रैफिक या एक विशाल ग्रिड की बिजली की भविष्यवाणी करना, लाखों डेटा पॉइंट और जटिल पैटर्न शामिल होते हैं।

इसे ठीक करने के लिए, लेखकों ने परीक्षण के लिए एक नया डेटासेट सेट पेश किया है। इसमें शामिल हैं:

  • IHEP: घरेलू बिजली उपयोग के 2 मिलियन से अधिक रिकॉर्ड।
  • NYTaxi: न्यूयॉर्क शहर में टैक्सी यात्राओं के 2 मिलियन से अधिक रिकॉर्ड।
  • RPB: बैटरी और सौर ऊर्जा उपयोग पर डेटा।
  • TiNA: एक औद्योगिक खनन मशीन से 38 मिलियन से अधिक रिकॉर्ड वाला एक विशाल डेटासेट।

जब उन्होंने अपने मॉडलों का इन विशाल, वास्तविक दुनिया के डेटासेट पर परीक्षण किया, तो LAM का लाभ और भी स्पष्ट हो गया। पुराने मॉडल अक्सर क्रैश हो जाते थे या मेमोरी की कमी के कारण रुक जाते थे क्योंकि डेटा बहुत बड़ा था, जबकि LAM सुचारू रूप से और सटीकता से चलता रहा।

इसका क्या अर्थ है

शोध पत्र निष्कर्ष निकालता है कि लंबी-अनुक्रम (long-sequence) टाइम सीरीज़ फोरकास्टिंग के लिए, "सब कुछ देखने" वाला दृष्टिकोण न केवल धीमा है; बल्कि यह अक्सर अनावश्यक भी है। समय के स्थानीय पड़ोस पर ध्यान केंद्रित करके, हम ऐसा AI बना सकते हैं जो तेज़, चलाने में सस्ता और आश्चर्यजनक रूप से अधिक सटीक हो।

लेखक सुझाव देते हैं कि जबकि उनकी विधि एक मजबूत कदम है, इस क्षेत्र को अभी भी बेहतर बेंचमार्क और अधिक कठोर परीक्षण की आवश्यकता है। उन्होंने यह दावा नहीं किया कि उन्होंने पूर्वानुमान (forecasting) की हर समस्या को हल कर दिया है, लेकिन उन्होंने भविष्य को देखने के लिए एक नया शक्तिशाली लेंस प्रदान किया है—जो तेज, कुशल और वास्तव में महत्वपूर्ण चीजों पर केंद्रित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →