Synthetic Data for Portfolios: A Throw of the Dice Will Never Abolish Chance
यह शोध पत्र पोर्टफोलियो प्रबंधन में वर्तमान जनरेटिव मॉडलों की सीमाओं की आलोचना करता है, जिसमें अत्यधिक डेटा जनरेशन के खतरों और पोर्टफोलियो निर्माण आवश्यकताओं के साथ मिसअलाइनमेंट जैसी समस्याओं पर प्रकाश डाला गया है, साथ ही मल्टीवेरिएट रिटर्न्स को सिंथेसाइज करने के लिए एक सुदृढ़ पाइपलाइन का प्रस्ताव दिया गया है और मॉडल की पहचान क्षमता (identifiability) तथा विशिष्ट वित्तीय अनुप्रयोगों के लिए उपयुक्तता का बेहतर मूल्यांकन करने के लिए एक "रिगर्जिटेटिव ट्रेनिंग" (regurgitative training) पद्धति को पेश किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अराजक, शोर भरे संसार के भविष्य की भविष्यवाणी करने की कोशिश कर रहे हैं। आपके पास एक छोटी नोटबुक है जो चीजों के हिलने-डुलने के अवलोकनों से भरी हुई है, लेकिन आप जानना चाहते हैं कि आगे क्या होगा। वित्त (फाइनेंस) की दुनिया में, इस नोटबुक में हजारों शेयरों के दैनिक मूल्य परिवर्तन होते हैं। दशकों से, विशेषज्ञों ने "जेनरेटिव मॉडल" बनाने की कोशिश की है—परिष्कृत डिजिटल मशीनें जो इस नोटबुक से सीखती हैं और फिर अंतहीन नए, नकली परिदृश्य उगलती हैं। यह एक शेफ की तरह है जो सूप का एक एकल चम्मच चखता है और फिर ठीक वैसा ही स्वाद देने वाला एक भव्य भोज पकाने की कोशिश करता है। उम्मीद यह है कि इन नकली परिदृश्यों को कंप्यूटर में खिलाकर, हम वास्तविक पैसे का जोखिम उठाए बिना निवेश रणनीतियों का परीक्षण कर सकते हैं। लेकिन एक पेच है: यदि शेफ ने केवल एक छोटा चम्मच चखा है, तो वे कितने भी कटोरे सूप पका लें, भव्य भोज का स्वाद गलत ही रहेगा। यह शोध पत्र वित्तीय बाजारों की इस अस्त-व्यस्त, उच्च-दांव वाली रसोई में उतरता है ताकि यह देख सके कि क्या ये डिजिटल शेफ वास्तव में ऐसा भोजन पका सकते हैं जो निवेशकों की मदद करे, या वे केवल एक शानदार भ्रम परोस रहे हैं।
लेखक, आदिल रंगिम सेटिंगोज़ और चार्ल्स-अल्बर्ट लेहेल, एक भारी सच्चाई बताते हुए शुरुआत करते हैं: अधिक पासे फेंकने से खराब रोल ठीक नहीं होता। उनका तर्क है कि यदि आप थोड़े से वास्तविक डेटा (जैसे 3й वर्षों के दैनिक स्टॉक मूल्य) पर एक मॉडल को प्रशिक्षित करते हैं, तो लाखों नकली डेटा बिंदु उत्पन्न करना आपकी भविष्यवाणियों को जादुई रूप से अधिक सटीक नहीं बनाएगा। वास्तव में, यह चीजों को और भी बदतर बना सकता है। मॉडल नमूने के आकार की "कमियों" को सीख लेता है और फिर उन कमियों को बार-बार आत्मविश्वास के साथ दोहराता है। यह उस छात्र की तरह है जिसने एक छोटे अभ्यास टेस्ट के उत्तर रट लिए हैं; यदि आप उन्हें उस टेस्ट की दस लाख प्रतियां देते हैं, तो वे एक आदर्श स्कोर प्राप्त करेंगे, लेकिन वे अभी भी एक नई समस्या को हल करना नहीं जानते होंगे। पेपर सुझाव देता है कि वित्त में, आप डेटा को वैसे "स्केल अप" नहीं कर सकते जैसे आप छवियों या टेक्स्ट के साथ कर सकते हैं; प्रारंभिक नमूना आकार एक कठिन सीमा है जिसे आप धोखा देकर पार नहीं कर सकते।
इसके बाद, लेखक इन मॉडलों के सीखने के तरीके और निवेशकों के सोचने के तरीके के बीच एक अजीब बेमेल (mismatch) पर प्रहार करते हैं। अधिकांश AI मॉडल "बड़ी तस्वीर" को सही करने के लिए प्रशिक्षित होते हैं—वे डेटा के सबसे स्पष्ट, शोर वाले पैटर्न पर ध्यान केंद्रित करते हैं, जैसे पूरे बाजार का सामान्य उतार-चढ़ाव। लेकिन एक स्मार्ट निवेश पोर्टफोलियो बनाने के लिए (विशेष रूप से एक ऐसा जो कुछ शेयरों के बढ़ने और अन्य के गिरने पर दांव लगाता है), सबसे महत्वपूर्ण सुराग अक्सर वे शांत, सूक्ष्म, कम-जोखिम वाले पैटर्न होते हैं जिन्हें AI अनदेखा कर देता है। यह एक ऐसे छात्र की तरह है जो इतिहास की किताब के केवल शोर वाले, नाटकीय अध्यायों का अध्ययन करता है और शांत फुटनोट्स को छोड़ देता है, जबकि शिक्षक (निवेशक) को परीक्षा पास करने के लिए फुटनोट्स की आवश्यकता होती है। पेपर दिखाता है कि मानक AI मॉडल इन सूक्ष्म, कम-जोखिम वाले विवरणों को पकड़ने में बहुत खराब हैं, जो वास्तव में एक सुरक्षित पोर्टफोलियो बनाने के लिए आवश्यक हैं।
इसे ठीक करने के लिए, लेखक सिंथेटिक स्टॉक डेटा उत्पन्न करने के लिए एक नया, कस्टम-निर्मित पाइपलाइन प्रस्तावित करते हैं। AI को सब कुछ एक साथ अनुमान लगाने देने के बजाय, वे समस्या को दो भागों में विभाजित करते हैं। पहले, वे "शोर वाले" बाजार आंदोलनों (कारक/factors) को "शांत" यादृच्छिक शोर (अवशेष/residuals) से अलग करते हैं। वे एक विशेष प्रकार के AI, जिसे जेनरेटिव एडवरसैरियल नेटवर्क (GAN) कहा जाता है, का उपयोग शोर वाले कारकों के जटिल, समय-आधारित पैटर्न को सीखने के लिए करते हैं, लेकिन वे समान कारकों को एक साथ समूहबद्ध करते हैं ताकि AI अभिभूत न हो जाए। शांत शोर के लिए, वे एक सरल, अधिक लचीले गणितीय तरीके (स्टूडेंट-टी वितरणों का मिश्रण) का उपयोग करते हैं ताकि कीमतों में अजीब, भारी-पूंछ वाले स्पाइक्स (heavy-tailed spikes) को पकड़ा जा सके जिन्हें मानक मॉडल मिस कर देते हैं। उन्होंने इस नई प्रणाली का परीक्षण S&P 500 के 433 शेयरों पर किया। परिणाम उत्साहजनक थे: नकली डेटा आश्चर्यजनक रूप से वास्तविक लग रहा था, जिसने वास्तविक बाजार की तरह ही अजीब व्यवहारों (जैसे अस्थिरता क्लस्टरिंग और हेवी टेल्स) को कैप्चर किया।
हालाँकि, लेखक केवल "यह अच्छा दिखता है" पर नहीं रुकते। वे यह परीक्षण करने का एक चतुर नया तरीका पेश करते है कि क्या मॉडल वास्तव में स्मार्ट है या केवल एक नकलची (parrot) है। वे इसे "रेगुरगिटेटिव ट्रेनिंग" (regurgitative training) कहते हैं। कल्पना कीजिए कि आप एक छात्र को आपके द्वारा लिखे गए पाठ्यपुस्तक का उपयोग करके सिखा रहे हैं, फिर उनसे सीखा हुआ उपयोग करके एक नई पाठ्यपुस्तक लिखने के लिए कहते हैं, और अंत में यह जांचते हैं कि क्या वह नई पाठ्यपुस्तक मूल छात्र को सिखा सकती है। यदि मॉडल अपने स्वयं के नकली डेटा से मूल समस्या को हल करने के लिए नहीं सीख सकता है, तो यह एक अच्छा मॉडल नहीं है। इस परीक्षण का उपयोग करते हुए, उन्होंने पाया कि कई मानक मॉडल विफल हो जाते हैं क्योंकि वे बाजार के अंतर्निहित नियमों की पहचान नहीं कर पाते हैं, भले ही वे नियम डेटा में छिपे हों जिसे उन्होंने स्वयं उत्पन्न किया है।
संक्षेप में, यह पेपर सुझाव देता है कि जबकि हम अपनी समस्याओं को हल करने के लिए अनंत नकली डेटा उत्पन्न नहीं कर सकते, हम बेहतर, अधिक विशिष्ट उपकरण बना सकते हैं यदि हम सभी डेटा के साथ एक जैसा व्यवहार करना बंद कर दें। हमारे वास्तविक दुनिया के छोटे नमूनों की सीमाओं का सम्मान करके और निवेश के लिए महत्वपूर्ण शांत, सूक्ष्म विवरणों पर ध्यान केंद्रित करके, हम ऐसा सिंथेटिक डेटा बना सकते हैं जो वास्तव में उपयोगी हो। लेखक सुझाव देते हैं कि भविष्य बड़े मॉडलों के बारे में नहीं, बल्कि स्मार्ट, अधिक अनुकूलित मॉडलों के बारे में है जो बाजार की विशिष्ट बारीकियों को समझते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।