DART: Domain Aware Relational Transformer for Stock Prediction
यह शोधपत्र DART का प्रस्ताव करता है, जो एक डोमेन-अवेयर रिलेशनल ट्रांसफॉर्मर है जो बड़े पैमाने के डेटासेट पर अत्याधुनिक स्टॉक भविष्यवाणी प्रदर्शन और काफी कम गणनात्मक लागत प्राप्त करने के लिए मल्टी-स्केल टेम्पोरल फ्यूजन मॉड्यूल और डोमेन-नॉलेज-गाइडेड स्पार्स अटेंशन मैकेनिज्म को संयोजित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप मौसम की भविष्यवाणी करने की कोशिश कर रहे हैं, लेकिन बादलों को देखने के बजाय, आप शेयर बाजार को देख रहे हैं। यह क्वांटिटेटिव फाइनेंस (quantitative finance) की दुनिया है, जहाँ वैज्ञानिक और निवेशक यह अनुमान लगाने की कोशिश करते हैं कि कल कौन से शेयर ऊपर जाएंगे या नीचे गिरेंगे। लंबे समय तक, लोगों ने सोचा कि बाजार एक पूरी तरह से निष्पक्ष कॉइन टॉस (सिक्का उछालने) जैसा है, जहाँ कोई भी वास्तव में भविष्य की भविष्यवाणी नहीं कर सकता क्योंकि हर कोई पहले से ही सब कुछ जानता था। लेकिन फिर, समझदार लोगों को एहसास हुआ कि इंसान पूर्ण रोबोट नहीं होते; हम डरते हैं, उत्साहित होते हैं और भीड़ का अनुसरण करते हैं, जो बाजार को थोड़ा अस्त-व्यस्त और वास्तव में कुछ मायनों में अनुमान लगाने योग्य बनाता है। आज, हम शक्तिशाली कंप्यूटरों और "डीप लर्निंग" (एक प्रकार का आर्टिफिशियल इंटेलिजेंस जो पैटर्न से सीखता है) का उपयोग इन छिपे हुए संकेतों को शोर (noise) के बीच खोजने के लिए करते हैं। हालाँकि, बड़ी समस्या यह है कि हजारों शेयर हैं, और वे सभी एक-दूसरे को जटिल तरीकों से प्रभावित करते हैं। हर एक शेयर कैसे दूसरे शेयर से बात करता है, इसे समझने की कोशिश करना एक स्टेडियम में होने वाली हर व्यक्ति की बातचीत को एक साथ सुनने जैसा है—यह बहुत अधिक जानकारी है जिसे संभालने के लिए कंप्यूटर अभिभूत (overwhelmed) हो जाता है।
यहीं पर एक नया अध्ययन आता है जिसमें DART (डोमेन-अवेयर रिलेशनल ट्रांसफॉर्मर) नामक एक चतुर समाधान दिया गया है। DART को एक विशाल, शोर भरे उत्सव की तरह समझें। अतीत में, यदि आप जानना चाहते थे कि कौन किससे बात कर रहा है, तो आप एक ही समय में होने वाली हर बातचीत को सुनने की कोशिश कर सकते थे। इसमें बहुत समय लगता है और इससे सिरदर्द भी होता है। DART के पीछे के शोधकर्ताओं ने महसूस किया कि लोग ज्यादातर अपने ही समूहों में रहने वाले लोगों से बात करते हैं—जैसे स्नैक टेबल पर बैठे बच्चे या पंच बाउल के पास खड़े वयस्क। वे आमतौर पर पूरी तरह से अलग समूह के किसी व्यक्ति को चिल्लाकर नहीं बुलाते। इसलिए, पूरे बाजार को सुनने के बजाय, DART केवल एक ही "इंडस्ट्री ग्रुप" (जैसे टेक कंपनियां अन्य टेक कंपनियों से बात करती हैं) के भीतर की बातों को सुनता है। यह कंप्यूटर के काम को बहुत, बहुत तेज़ बना देता है।
यह शोध पत्र सुझाव देता है कि इस "ग्रुप लिसनिंग" रणनीति का उपयोग करके, और समय को देखने के एक विशेष तरीके (लघु अवधि के रुझान, मध्यम अवधि के रुझान और लंबी अवधि के रुझानों को एक साथ देखना) के साथ मिलकर, यह मॉडल पुराने तरीकों की तुलना में स्टॉक रिटर्न की बेहतर भविष्यवाणी कर सकता है। NASDAQ, NYSE और S&P 500 के वास्तविक डेटा का उपयोग करते हुए परीक्षणों में, DART मॉडल ने दिखाया कि वह अन्य शीर्ष मॉडलों की तुलना में स्मार्ट निवेश निर्णय ले सकता है और जोखिम को बेहतर ढंग से संभाल सकता है। इसने यह भी साबित किया कि असंबंधित शेयरों के "शोर" को अनदेखा करके, कंप्यूटर अपना काम पहले की तुलना में लगभग 84% कम ऊर्जा का उपयोग करके कर सकता है। हालांकि यह मॉडल कोई जादुई क्रिस्टल बॉल नहीं है जो मुनाफे की गारंटी देता है, लेखक सुझाव देते हैं कि यह शेयर बाजार की जटिल और भीड़भाड़ वाली दुनिया में नेविगेट करने के लिए एक बहुत ही व्यावहारिक और कुशल उपकरण है।
DART की कहानी: बाजार को सुनने का एक स्मार्ट तरीका
समस्या: बहुत अधिक शोर, बहुत अधिक संबंध
कल्पना कीजिए कि आप हजारों लोगों के साथ एक विशाल संगीत कार्यक्रम (concert) में हैं। यदि आप जानना चाहते हैं कि कौन सा गाना बज रहा है, तो आप एक समय में हर एक व्यक्ति की आवाज़ सुनने की कोशिश कर सकते हैं। लेकिन यह असंभव है; यह केवल शोर की एक दीवार है। कंप्यूटरों के सामने जब शेयरों की भविष्यवाणी करने की बात आती है, तो ठीक यही समस्या होती है। हजारों शेयर हैं, और प्रत्येक शेयर दूसरे से जुड़ा हुआ है। पुराने कंप्यूटर मॉडल एक ही समय में सबकी बातें सुनने की कोशिश करते थे। इसे "फुल अटेंशन" (full attention) कहा जाता है। यह सैद्धांतिक रूप से बहुत सटीक है, लेकिन यह इतना धीमा और महंगा है कि हजारों शेयरों के वास्तविक व्यापार के लिए इसका उपयोग करना व्यावहारिक रूप से असंभव है। यह हर एक टुकड़े को दूसरे टुकड़े के साथ मिलाने की कोशिश करने जैसा है; पहेली बहुत बड़ी हो जाती है, और आपका दिमाग (या कंप्यूटर) क्रैश हो जाता है।
समाधान: "इंडस्ट्री नेबरहुड" का नियम
शोधकर्ताओं ने एक सरल लेकिन शक्तिशाली विचार प्रस्तावित किया: एक ही उद्योग के शेयर सबसे अच्छे दोस्त हैं; अलग-अलग उद्योगों के शेयर केवल परिचित हैं।
शेयर बाजार को एक विशाल शहर के रूप में सोचें जो मोहल्लों (neighborhoods) में विभाजित है। एक "टेक नेबरहुड" है, एक "फूड नेबरहुड" है, और एक "कार नेबरहुड" है। टेक नेबरहुड के लोग आपस में लगातार बात करते हैं क्योंकि वे एक ही समाचार और रुझान साझा करते हैं। लेकिन टेक नेबरहुड के लोगों की फूड नेबरहुड के लोगों के साथ शायद ही कभी कोई सीधा, तत्काल संवाद होता है।
DART मॉडल इसी नियम का उपयोग करता है। पूरे शहर को सुनने के बजाय, यह केवल प्रत्येक "नेबरहुड" के भीतर हो रही बातचीत को सुनता है। इसे डोमेन-नॉलेज-गाइडेड स्पार्स अटेंशन (DSA) कहा जाता है।
- यह कैसे काम करता है: कंप्यूटर एक शेयर को देखता है, पूछता है, "यह किस नेबरहुड में है?" और फिर केवल उसी नेबरहुड के अन्य शेयरों पर ध्यान देता है।
- परिणाम: यह असंबंधित शेयरों के बेकार शोर को अनदेखा कर देता है। शोध पत्र दिखाता है कि यह कंप्यूटर के कार्यभार को लगभग 84% (विशेष रूप से, उनके परीक्षणों में 0.23 GFLOPs से घटाकर 0.04 GFLOPs तक) कम कर देता है। यह तूफान में फुसफुसाहट सुनने के बजाय कॉफी शॉप में एक शांत बातचीत सुनने जैसा है।
टाइम मशीन: परतों में अतीत को देखना
भविष्य की भविष्यवाणी करना केवल इस बारे में नहीं है कि कौन किससे बात कर रहा है; यह भी महत्वपूर्ण है कि चीजें कब होती हैं। शेयर अलग-अलग घड़ियों पर चलते हैं। कुछ तेजी से चलते हैं (मिनट-दर-मिनट), कुछ मध्यम गति से (दैनिक रुझान), और कुछ धीमी गति से (मासिक या वार्षिक रुझान)।
पुराने मॉडल अक्सर केवल एक जोड़ी चश्मे के साथ समय को देखने की कोशिश करते थे, जिसका अर्थ था कि वे बड़ी तस्वीर या छोटे विवरणों को चूक जाते थे। DART एक मल्टी-स्केल टेम्पोरल फ्यूजन (MSTF) मॉड्यूल का उपयोग करता है।
- उपमा: एक फिल्म देखने की कल्पना करें। आपके पास एक ज़ूम लेंस है जो आपको एक अभिनेता के चेहरे के सूक्ष्म विवरण (लघु अवधि) देखने देता है, एक वाइड लेंस जो पूरे दृश्य को दिखाता है (मध्यम अवधि), और एक ड्रोन शॉट जो पूरे शहर को दिखाता है (लंबी अवधि)। DART एक ही समय में इन तीनों लेंसों का उपयोग करता है।
- जादू: इसके बाद यह इन दृश्यों को एक साथ जोड़ने के लिए एक विशेष "प्रोग्रेसिव टेम्पोरल फ्यूजन" नेटवर्क का उपयोग करता है। यह एक सैंडविच बनाने जैसा है जहाँ हर परत अधिक स्वाद जोड़ती है, जिससे कंप्यूटर यह समझने में सक्षम होता है कि आज का एक छोटा सा बदलाव कल एक बड़े रुझान में कैसे बदल सकता है।
उन्होंने क्या पाया: तेज़ और स्मार्ट
शोधकर्ताओं ने अपने नए मॉडल, DART का परीक्षण अमेरिकी शेयर बाजार (NASDAQ, NYSE और S&P 500) से 2020 से 2024 तक के वास्तविक डेटा का उपयोग करके कई अन्य प्रसिद्ध मॉडलों (जैसे LSTM, GCN और यहाँ तक कि MambaStock जैसे नए मॉडल) के विरुद्ध किया।
यहाँ डेटा क्या बताता है:
- बेहतर रिटर्न: DART ने केवल बेहतर अनुमान ही नहीं लगाया; इसने एक बेहतर "पोर्टफोलियो" (शेयरों का संग्रह) बनाने में मदद की। परीक्षणों में, इसने NASDAQ और S&P 500 पर उच्चतम शार्प रेशियो (Sharpe Ratio) (एक स्कोर जो यह मापता है कि आप जोखिम की तुलना में कितना पैसा कमाते हैं) प्राप्त किया। उदाहरण के लिए, NASDAQ पर, DART का शार्प रेशियो 2.432 था, जबकि अगला सबसे अच्छा 1.827 था।
- टॉप पिक्स: जब मॉडल ने उन शीर्ष 10 शेयरों को चुना जिन्हें उसने सबसे अच्छा प्रदर्शन करते हुए देखा, तो वह दूसरों की तुलना में अधिक बार सही निकला (एक मीट्रिक जिसे Precision@10 कहा जाता है)। NYSE पर, इसने अपने शीर्ष चुनावों में से 58.7% को सही बताया, जो प्रतिस्पर्धा से बेहतर था।
- "नो-गो" ज़ोन: अध्ययन ने स्पष्ट रूप से दिखाया कि यदि आप "नेबरहुड" नियम को हटा देते हैं और कंप्यूटर को सभी को सुनने देते हैं (फुल अटेंशन), तो मॉडल भ्रमित हो जाता है और बहुत खराब प्रदर्शन करता है। यह साबित करता है कि अप्रासंगिक संबंधों को अनदेखा करना वास्तव में मॉडल के लिए अच्छा है।
निष्कर्ष
शोध पत्र सुझाव देता है कि DART निवेश के भविष्य के लिए एक व्यावहारिक, कुशल उपकरण है। यह दावा नहीं करता है कि यह एक जादुई छड़ी है जो गारंटी देती है कि आप अमीर हो जाएंगे, लेकिन यह दिखाता है कि स्मार्ट नियमों (जैसे केवल अपने नेबरहुड को सुनना) का उपयोग करके और समय को परतों में देखकर, कंप्यूटर शेयर बाजार की अराजकता को बहुत बेहतर तरीके से समझ सकते हैं। यह "बहुत अधिक डेटा" की समस्या को चुनिंदा होकर हल करता है, जिससे बिना भारी खर्च या कंप्यूटर को नुकसान पहुँचाए हजारों शेयरों पर शक्तिशाली AI का उपयोग करना संभव हो जाता है।
जैसा कि लेखक नोट करते हैं, अभी भी विकास की गुंजाइश है। वर्तमान में, मॉडल केवल स्थिर उद्योग सूचियों के आधार पर "नेबरहुड्स" को देखता है। भविष्य में, वे इन नेबरहुड्स को गतिशील (dynamic) बनाने की आशा करते हैं, ताकि मॉडल देख सके कि कब एक टेक कंपनी अचानक एक फूड कंपनी की तरह व्यवहार करने लगती है, या जब ऐसी कोई खबर आती है जो दो पूरी तरह से अलग समूहों को जोड़ती है। लेकिन फिलहाल के लिए, DART वित्तीय दुनिया में नेविगेट करने के लिए कंप्यूटर को सिखाने की दिशा में एक मजबूत, कुशल कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।