← नवीनतम पेपर
💰 quantitative finance

A Controlled Comparison of Deep Learning Architectures for Multi-Horizon Financial Forecasting: Evidence from 918 Experiments

नौ डीप लर्निंग आर्किटेक्चर के माध्यम से 918 प्रयोगों के एक कठोर नियंत्रित तुलनात्मक अध्ययन के द्वारा, यह अध्ययन मल्टी-होराइजन वित्तीय पूर्वानुमान के लिए मॉडर्न टीसीएन (ModernTCN) को श्रेष्ठ मॉडल के रूप में पहचानता है, जो यह प्रदर्शित करता है कि आर्किटेक्चरल इंडक्टिव बायस (architectural inductive bias), हाइपरपैरामीटर ट्यूनिंग और सीड रैंडमनेस (seed randomness) की तुलना में काफी अधिक प्रभावी है, साथ ही यह भी प्रकट करता है कि वर्तमान एमएसई-प्रशिक्षित (MSE-trained) मॉडल्स में प्रति घंटा रिज़ॉल्यूशन पर दिशात्मक कौशल (directional skill) का अभाव है।

मूल लेखक: Nabeel Ahmad Saidd

प्रकाशित 2026-03-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nabeel Ahmad Saidd

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो यह तय करने की कोशिश कर रहे हैं कि कौन सी रेसिपी सबसे अच्छा सूप बनाती है। आपके पास नौ अलग-अलग रेसिपी (डीप लर्निंग आर्किटेक्चर) हैं, और आप जानना चाहते हैं कि तीन अलग-अलग प्रकार की सामग्रियों के लिए कौन सी सबसे अच्छी तरह काम करती है: मसालेदार सब्जियां (क्रिप्टोकरेंसी), हल्का शोरबा (फॉरेक्स), और भारी मांस (स्टॉक इंडेक्स)।

पिछली अधिकांश कुकिंग प्रतियोगिताएं पक्षपाती थीं। कुछ शेफ को नमक को ठीक करने के लिए अपने सूप को 100 बार चखने का मौका मिला, जबकि कुछ को केवल एक ही मौका मिला। कुछ ने केवल शाम 5 बजे सूप चखा, यह नजरअंदाज करते हुए कि वह रात 8 बजे कैसा स्वाद देगा। और किसी ने भी यह नहीं जांचा कि परिणाम केवल एक इत्तेफाक थे या इसलिए क्योंकि शेफ बर्तन को चलाने (stirring) में भाग्यशाली था।

यह पेपर वित्तीय पूर्वानुमान (financial forecasting) के लिए पहला वास्तव में निष्पक्ष कुकिंग कॉम्पिटिशन है। लेखक, नबील अहमद सैद (Nabeel Ahmad Saidd) ने यह पता लगाने के लिए 918 प्रयोग चलाए कि कौन सी "रेसिपी" वास्तव में स्टॉक और क्रिप्टो कीमतों की भविष्यवाणी करने के लिए सबसे अच्छा काम करती है।

यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. दावेदार (नौ रेसिपी)

इस अध्ययन में चार अलग-अलग विचारधाराओं के नौ अलग-अलग "AI शेफ" (डीप लर्निंग मॉडल) का परीक्षण किया गया:

  • द ट्रांसफॉर्मर्स (The Transformers): नए, फैंसी शेफ जो पैटर्न खोजने के लिए पूरे बर्तन को एक साथ देखते हैं (जैसे PatchTST और Autoformer)।
  • द CNNs (कन्वोल्यूशनल): वे शेफ जो एक विस्तृत क्षेत्र में पैटर्न को पकड़ने के लिए बड़े, चौड़े चम्मचों का उपयोग करते हैं (जैसे ModernTCN)।
  • द MLPs (लीनियर): सरल, बिना किसी तामझाम वाले शेफ जो मानते हैं कि एक सीधी रेखा अक्सर सबसे अच्छा रास्ता होती है (जैसे DLinear)।
  • द RNNs (LSTM): पुराने स्कूल के शेफ जो एक समय में एक कदम पीछे की याद रखते हैं (जैसे LSTM)।

2. खेल के नियम (प्रोटोकॉल)

परिणामों को निष्पक्ष सुनिश्चित करने के लिए, लेखक ने सख्त नियम बनाए:

  • समान सामग्री: हर शेफ को बिल्कुल एक जैसा डेटा (ओपन, हाई, लो, क्लोज, वॉल्यूम कीमतें) मिला।
  • समान प्रशिक्षण समय: हर शेफ को अभ्यास करने के लिए समान समय मिला (हाइपरपैरामीटर ऑप्टिमाइजेशन)।
  • "तीन-स्वाद" का नियम: केवल एक बार सूप चखने के बजाय, हर शेफ ने थोड़े अलग रैंडम शुरुआती बिंदुओं के साथ तीन बार सूप बनाया। यदि किसी शेफ का सूप हर बार अलग स्वाद देता था, तो वे अविश्वसनीय थे। यदि उनका स्वाद एक जैसा था, तो वे सुसंगत (consistent) थे।
  • दो टाइमफ्रेम: उन्होंने 4 घंटे आगे (शॉर्ट-टर्म) और 24 घंटे आगे (लॉन्ग-टर्म) की कीमत की भविष्यवाणी करने का परीक्षण किया।

3. परिणाम: कौन जीता?

परिणाम आश्चर्यजनक और स्पष्ट थे। विजेताओं ने एक विशिष्ट "पोडियम" बनाया:

🥇 स्वर्ण पदक (Gold Medal): ModernTCN
यह मॉडल 75% बार जीता। यह एक ऐसे शेफ की तरह है जो पैटर्न को पूरी तरह से पकड़ने के लिए एक विशाल, हाई-टेक करछी (लार्ज-कर्नेल कन्वोल्यूशन) का उपयोग करता है। यह स्टॉक्स, फॉरेक्स और क्रिप्टो पर बहुत अच्छा काम करता था। यह सबसे भरोसेमंद "ऑल-राउंडर" था।

🥈 रजत पदक (Silver Medal): PatchTST
यह मॉडल दूसरे स्थान पर आया। यह एक ट्रांसफार्मर है जो विश्लेषण करने के लिए सूप को "पैच" (टुकड़ों) में काटता है। यह विजेता के बहुत करीब था, विशेष रूप से शॉर्ट-टर्म भविष्यवाणियों में।

🥉 बाकी समूह
अन्य मॉडल एक मध्यम समूह और एक निचले समूह में आ गए।

  • मध्यम समूह: मॉडल जैसे iTransformer और DLinear ठीक थे लेकिन बहुत अच्छे नहीं थे।
  • निचला समूह: पुराना स्कूल वाला LSTM मॉडल सबसे अंत में आया, जिसकी त्रुटियां (errors) विजेता से 7 से 33 गुना बदतर थीं। यह एक दौड़ जीतने के लिए साइकिल चलाने जैसा है जबकि बाकी सब फेरारी पर सवार हैं।

4. बड़े आश्चर्य (मुख्य निष्कर्ष)

आश्चर्य #1: बड़ा होना हमेशा बेहतर नहीं होता।
आप सोच सकते हैं कि जिस मॉडल का दिमाग (पैरामीटर्स) सबसे जटिल है, वही जीतेगा। लेकिन सबसे सरल मॉडल (DLinear, जिसमें लगभग कोई "दिमाग" की शक्ति नहीं है) सबसे जटिल मॉडलों को भी हरा देता है।

  • उपमा: यह महसूस करने जैसा है कि एक बड़ी, अत्यधिक इंजीनियर की गई रोबोटिक भुजा की तुलना में एक साधारण, अच्छी तरह से ट्यून किया गया हथौड़ा कील ठोकने के लिए बेहतर है। डिजाइन आकार से अधिक महत्वपूर्ण है।

आश्चर्य #2: "सीड" (Seed) मायने नहीं रखता।
AI में, आप अक्सर एक रैंडम "सीड" (जैसे ताश के पत्तों को फेंटना) के साथ शुरुआत करते हैं। कुछ लोगों को चिंता होती है कि यदि हम कार्डों को अलग तरह से फेंटते हैं, तो हमें एक अलग विजेता मिलेगा।

  • निष्कर्ष: अध्ययन ने पाया कि परिणामों में 99.9% अंतर रेसिपी (मॉडल आर्किटेक्चर) के कारण था, और केवल 0.01% रैंडम शफल के कारण था।
  • उपमा: यदि आप केक बनाते हैं, तो रेसिपी तय करती है कि वह स्वादिष्ट होगा या नहीं। आपने बैटर को अपने बाएं या दाएं हाथ से मिलाया, इससे कोई फर्क नहीं पड़ता। यह जानने के लिए कि रेसिपी अच्छी है या नहीं, आपको केक को 100 बार बनाने की ज़रूरत नहीं है; तीन बार ही काफी है।

आश्चर्य #3: "दिशा" (Direction) की समस्या
यह ट्रेडर्स के लिए सबसे महत्वपूर्ण सबक है। हालांकि मॉडल कीमत (जैसे "कीमत $100 होगी") की भविष्यवाणी करने में शानदार थे, लेकिन वे दिशा (जैसे "क्या यह ऊपर जाएगी या नीचे?") की भविष्यवाणी करने में बहुत खराब थे।

  • निष्कर्ष: मॉडल दिशा के मामले में केवल 50% बार सही थे।
  • उपमा: कल्पना कीजिए कि एक मौसम विज्ञानी भविष्यवाणी करता है कि तापमान 75°F होगा। वह बहुत सटीक है! लेकिन यदि आप उससे पूछते हैं, "क्या बारिश होगी?" तो वह केवल एक सिक्का उछाल रहा है।
  • क्यों? मॉडल त्रुटि की दूरी (MSE) को कम करने के लिए प्रशिक्षित किए जाते हैं। वे स्वाभाविक रूप से "सुरक्षित खेलते हैं" और औसत की भविष्यवाणी करते हैं, जो उनके तेज उतार-चढ़ाव को पहचानने की क्षमता को खत्म कर देता है।

5. आपको क्या करना चाहिए? (व्यावहारिक सलाह)

यदि आप एक पोर्टफोलियो मैनेजर या ट्रेडर हैं जो AI का उपयोग कर रहे हैं:

  1. ModernTCN का उपयोग करें: यह लगभग किसी भी एसेट क्लास के लिए सबसे विश्वसनीय "वर्कहॉर्स" है।
  2. PatchTST का उपयोग करें: यदि आप ट्रांसफार्मर मॉडल पसंद करते हैं, तो यह आपका सबसे अच्छा विकल्प है।
  3. LSTM का उपयोग न करें: यह इस विशिष्ट कार्य के लिए पुराना हो चुका है।
  4. "डायरेक्शनल" दावों से सावधान रहें: भले ही कोई मॉडल कीमत की सटीक भविष्यवाणी करता है, इसका मतलब यह नहीं है कि वह आपको बता सकता है कि कब खरीदें या बेचें। यदि आपको दिशा जानने की आवश्यकता है, तो आपको बेहतर मॉडल चुनने के बजाय अपने मॉडल को प्रशिक्षित करने के तरीके को बदलने की आवश्यकता है।

निचोड़ (The Bottom Line)

यह पेपर वित्तीय AI उद्योग के लिए एक विशाल "क्वालिटी कंट्रोल" चेक है। यह साबित करता है कि आप मॉडल को कैसे डिजाइन करते हैं, यह इस बात से अधिक महत्वपूर्ण है कि आप उसे कितना डेटा खिलाते हैं या आप कितनी बार ताश के पत्तों को फेंटते हैं। यह हमें एक स्पष्ट लीडरबोर्ड देता है ताकि हम अनुमान लगाना बंद करें और उन उपकरणों का उपयोग करना शुरू करें जो वास्तव में काम करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →