← नवीनतम पेपर
📊 statistics

Recency Biased Causal Attention for Time-series Forecasting

यह शोध पत्र एक सरल तंत्र का प्रस्ताव करता है जो स्लोथ हेवी-टेल्ड डिसे (smooth heavy-tailed decay) के साथ स्कोर को पुनर्वितरित करके ट्रांसफॉर्मर अटेंशन में रिसेंसी बायस (recency bias) पेश करता है, जिससे लंबी अवधि के सहसंबंधों को पकड़ने की लचीलापन बनाए रखते हुए स्थानीय अस्थायी निर्भरताओं को बढ़ाया जाता है और टाइम-सीरीज फोरकास्टिंग बेंचमार्क पर बेहतर प्रदर्शन प्राप्त किया जाता है।

मूल लेखक: Kareem Hegazy, Michael W. Mahoney, N. Benjamin Erichson

प्रकाशित 2026-04-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kareem Hegazy, Michael W. Mahoney, N. Benjamin Erichson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अगले सप्ताह के मौसम की भविष्यवाणी करने की कोशिश कर रहे हैं। आपके पास एक सुपर-स्मार्ट AI सहायक (Transformer) है जो पिछले एक साल के हर एक दिन को देख सकता है ताकि वह अपना अनुमान लगा सके।

समस्या क्या है? यह AI बहुत अधिक स्मार्ट है। यह पिछले साल के 365 दिन पहले के मौसम को उतना ही महत्वपूर्ण मानता है जितना कि 5 मिनट पहले के मौसम को। यह एक ऐसी स्थिति की तरह है जैसे आप यह तय करने के लिए कि कल क्या पहनना है, पिछले जनवरी के बर्फीले तूफान को वर्तमान में हो रही बारिश के बराबर महत्व दें। यह शोर (noise) से भ्रमित हो जाता है और स्पष्ट संकेत (signal) को मिस कर देता है: जो हाल ही में हुआ है, वह सबसे अधिक मायने रखता है।

यह पेपर इस AI को सिखाने का एक नया तरीका पेश करता है कि वह "बीते हुए कल" को नजरअंदाज किए बिना "आज" पर ध्यान कैसे दिया जाए। वे इसे Recency Biased Causal Attention (RBCA) कहते हैं, और उन्होंने एक नया मॉडल बनाया जिसे Powerformer कहा गया है।

सरल उपमाओं (analogies) का उपयोग करके इसका विवरण यहाँ दिया गया है:

1. समस्या: "सर्वव्यापी आँख" बनाम "मानवीय स्मृति"

मानक AI मॉडल (Transformers) एक ऐसे व्यक्ति की तरह काम करते हैं जिसकी जादुई, पूर्ण स्मृति है जो उनके द्वारा की गई हर बातचीत को तुरंत याद कर सकती है। जब उनसे कोई प्रश्न पूछा जाता है, तो वे उत्तर खोजने के लिए पिछली हर बातचीत को समान रूप से स्कैन करते हैं।

  • भाषा में: यह बहुत अच्छा है। यदि आप कहते हैं "बैंक बंद था," तो AI को याद रखने की आवश्यकता है कि "बैंक" का अर्थ नदी का किनारा था या वित्तीय संस्थान, भले ही आपने इसका उल्लेख 50 वाक्यों पहले किया हो।
  • समय के संदर्भ में (मौसम/शेयर बाजार): यह बुरा है। यदि आप कल के तापमान की भविष्यवाणी कर रहे हैं, तो 300 दिन पहले का तापमान लगभग बेकार है। AI इसे देखने में अपनी ऊर्जा बर्बाद करता है, अप्रासंगिक इतिहास से विचलित होता है।

2. समाधान: "हेवी-टेल्ड डिके" (वॉल्यूम नॉब)

लेखकों ने महसूस किया कि मानव स्मृति अलग तरह से काम करती है। हमें जो अभी हुआ है, वह बहुत स्पष्ट रूप से याद रहता है। हमें एक सप्ताह पहले की चीजें धुंधली याद रहती हैं। हमें एक साल पहले की बातें केवल तभी याद रहती हैं जब वे कोई बड़ी घटना रही हों।

उन्होंने AI को एक नया नियम दिया: "आप समय में जितना पीछे जाएंगे, संकेत उतना ही धीमा होता जाएगा, लेकिन यह पूरी तरह से गायब नहीं होगा।"

उन्होंने एक गणितीय ट्रिक का उपयोग किया जिसे Power-Law कहते हैं। इसे रेडियो के वॉल्यूम नॉब की तरह समझें:

  • हाल की घटनाएं ("अब"): वॉल्यूम 100% पर है।
  • कुछ दिन पहले: वॉल्यूम 50% पर है।
  • एक महीना पहले: वॉल्यूम 10% पर है।
  • एक साल पहले: वॉल्यूम 1% पर है, लेकिन यह अभी भी वहां है।

यह अन्य तरीकों से अलग है जो सिग्नल को एक निश्चित बिंदु के बाद काट देते हैं (जैसे एक "स्लाइडिंग विंडो" जो कहती है, "मुझे केवल पिछले 7 दिनों की परवाह है, बाकी सब भूल जाओ")। Power-Law दृष्टिकोण एक "हैवी टेल" (भारी पूंछ) की तरह है: यह AI को दूर के अतीत को सुनने की अनुमति देता है, लेकिन यह इतना धीमा होता है कि यह हाल की महत्वपूर्ण खबरों को दबाता नहीं है।

3. "फ्लिप-फ्लॉप" टेस्ट: AI को ध्यान केंद्रित करना सिखाना

मौसम पर परीक्षण करने से पहले, लेखकों ने AI को "फ्लिप-फ्लॉप" नामक एक सरल तर्क पहेली दी।

  • खेल: AI को "एक संख्या लिखें," "एक संख्या को अनदेखा करें," या "लिखी गई अंतिम संख्या को पढ़ें" जैसे निर्देश दिए जाते हैं।
  • परिणाम: मानक AI मॉडल (इस नए नियम के बिना) भ्रमित हो जाते हैं। वे कभी भी लिखी गई हर संख्या को याद रखने की कोशिश करते हैं।
  • सुधार: नए Recency Bias के साथ, AI ने इंसान की तरह कार्य करना सीख लिया: "ओह, मुझे उस संख्या को अनदेखा करने के लिए कहा गया था? ठीक है, मैं उसकी आवाज़ धीमी कर दूँगा। मैं केवल उस अंतिम संख्या को सुनूँगा जिसे मुझे लिखने के लिए कहा गया था।"

इससे यह सिद्ध हुआ कि AI अंततः पढ़ना, लिखना और अनदेखा करना सीख सका—जो मानवीय स्मृति की तीन महाशक्तियाँ हैं।

4. Powerformer: नया चैंपियन

लेखकों ने एक लोकप्रिय टाइम-सीरीज मॉडल (PatchTST) लिया और उसके "कानों" को इन नए "रेसिन्सी-बायस्ड कानों" से बदल दिया। उन्होंने इस नए मॉडल को Powerformer नाम दिया।

  • यह कैसे काम करता है: यह डेटा को देखता है, "वॉल्यूम नॉब" नियम (Power-Law) लागू करता है, और दूर के अतीत की एक हल्की स्मृति रखते हुए तत्काल अतीत पर भारी ध्यान केंद्रित करता है।
  • परिणाम: 7 वास्तविक दुनिया के डेटासेट्स (बिजली का उपयोग, यातायात, मौसम) पर, Powerformer ने लगभग हर अन्य मॉडल को पछाड़ दिया, जिसमें बहुत बड़े और अधिक जटिल मॉडल भी शामिल थे।

5. यह क्यों मायने रखता है (द "हैवी टेल" उपमा)

कल्पना कीजिए कि आप एक शोर भरे कमरे में बातचीत सुन रहे हैं।

  • मानक AI: पिछले एक घंटे में कमरे में बोलने वाले हर व्यक्ति के हर शब्द को सुनने की कोशिश करता है। उसे सिरदर्द होता है और वह उस व्यक्ति को मिस कर देता है जो उसके ठीक बगल में बोल रहा है।
  • पुराना "विंडो" AI: केवल पिछले 10 सेकंड तक सुनता है। यदि वह व्यक्ति जिसे आपको सुनना था, वह 11 सेकंड पहले बोला था, तो वह चला गया।
  • Powerformer (यह पेपर): अपने ठीक बगल वाले व्यक्ति को पूरी आवाज़ में सुनता है। वह 10 फीट दूर वाले व्यक्ति को आधी आवाज़ में सुनता है। वह कमरे के दूसरी ओर बैठे व्यक्ति को फुसफुसाहट की तरह सुनता है। वह अगली इमारत में बैठे व्यक्ति को पूरी तरह अनदेखा कर देता है।

यह "हैवी टेल" दृष्टिकोण टाइम-सीरीज डेटा के लिए एकदम सही है क्योंकि वास्तविक दुनिया की घटनाओं (जैसे बिजली का उपयोग या यातायात) में अक्सर अल्पकालिक स्पाइक्स (अचानक रश ऑवर) और दीर्घकालिक रुझान (मौसमी बदलाव) होते हैं। Powerformer दोनों को पूरी तरह से पकड़ लेता है: स्पाइक्स के लिए "तेज़" हालिया डेटा और रुझानों के लिए "धुंधला" दूर का डेटा।

सारांश

पेपर कहता है: "कल की खबरों को आज की खबरों के समान न समझें।"

AI मॉडलों को वर्तमान की अधिक परवाह करने का एक अंतर्निहित पूर्वाग्रह (bias) देकर, वे भविष्य की भविष्यवाणी करने में बहुत बेहतर हो जाते हैं। यह एक सरल सुधार है जो AI को एक भ्रमित विश्वकोश के बजाय एक मानव पर्यवेक्षक की तरह कार्य करने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →