A Reinforcement Learning Supervisor with Dynamic Performance-Metric Weighting for Cryptocurrency Portfolio Management
यह शोध पत्र एक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) पर्यवेक्षक ढांचे का प्रस्ताव करता है जो विषम एजेंटों के एक सेट से इष्टतम ट्रेडिंग नीति चुनने के लिए कई प्रदर्शन मेट्रिक्स को गतिशील रूप से भारित करता है, जो व्यक्तिगत एजेंटों और निश्चित रणनीतियों की तुलना में गैर-स्थिर क्रिप्टोकरेंसी बाजारों में बेहतर जोखिम-समायोजित रिटर्न प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
वित्तीय बाजारों में निवेश करना अनुकूलन का एक निरंतर खेल है। खेल के नियम बदलते रहते हैं क्योंकि अर्थव्यवस्था विकास के उछाल वाले दौर से बदलकर धीमी, स्थिर गति या अचानक, तीव्र गिरावट की ओर बढ़ जाती है। इन वातावरणों में, एक अकेली रणनीति जो उछाल के दौरान पूरी तरह से काम करती है, अक्सर बाजार के मुड़ने पर बुरी तरह विफल हो जाती है। यह पोर्टफोलियो प्रबंधन की मुख्य चुनौती है: यह तय करना कि विभिन्न संपत्तियों के बीच पैसा कैसे विभाजित किया जाए जब भविष्य अनिश्चित हो और अतीत एक विश्वसनीय मानचित्र न हो। दशकों तक, निवेशकों ने जोखिम और प्रतिफल को संतुलित करने के लिए गणितीय सूत्रों पर भरोसा किया है, लेकिन ये स्थिर मॉडल अक्सर संघर्ष करते हैं जब बाजार की स्थितियां तेजी से बदलती हैं। हाल ही में, कंप्यूटर वैज्ञानिकों ने 'रीइन्फोर्समेंट लर्निंग' नामक कृत्रिम बुद्धिमत्ता (आर्टिफिशियल इंटेलिजेंस) की ओर रुख किया है। विशिष्ट नियमों को सिखाए जाने के बजाय, ये कंप्यूटर प्रोग्राम परीक्षण और त्रुटि (ट्रायल एंड एरर) के माध्यम से सीखते हैं, और एक सिम्युलेटेड बाजार के साथ बातचीत करके यह पता लगाते हैं कि किन कार्यों से दीर्घकालिक सर्वोत्तम परिणाम मिलते हैं। हालांकि ये प्रोग्राम व्यापार करना सीख सकते हैं, लेकिन वे अक्सर सोचने के एक ही तरीके में फंस जाते हैं, और बाजार के शासन (रेजीम) में बदलाव होने पर खुद को बदलने में असमर्थ होते हैं।
कोरिया नेशनल यूनिवर्सिटी ऑफ ट्रांसपोर्टेशन के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने का एक नया तरीका प्रस्तावित किया है। एक आदर्श ट्रेडिंग रोबोट बनाने के बजाय, उन्होंने एक ऐसा सिस्टम बनाया है जो एक पर्यवेक्षक (सुपरवाइजर) के रूप में कार्य करता है, जो पांच अलग-अलग ट्रेडिंग रोबोटों की एक टीम का प्रबंधन करता है, जिनमें से प्रत्येक को थोड़ा अलग सीखने के तरीके के साथ प्रशिक्षित किया गया है। पर्यवेक्षक स्वयं ट्रेड नहीं करता है। इसके बजाय, यह देखता है कि हाल ही में प्रत्येक रोबोट का प्रदर्शन कैसा रहा है और निर्णय लेता है कि किसी भी क्षण में किसे प्रभारी होना चाहिए। शोधकर्ताओं ने इस प्रणाली का परीक्षण क्रिप्टोकरेंसी बाजार के वास्तविक, उच्च-आवृत्ति (हाई-फ्रीक्वेंसी) डेटा का उपयोग करके किया, जो अत्यधिक अस्थिरता और तीव्र परिवर्तनों के लिए जाना जाता है। उन्होंने पाया कि यह पर्यवेक्षक प्रणाली लगातार किसी भी एकल रोबोट और पारंपरिक निवेश रणनीतियों से बेहतर प्रदर्शन करती है, क्योंकि यह वर्तमान बाजार स्थितियों के लिए सबसे उपयुक्त एजेंट में गतिशील रूप से स्विच करती है।
शोधकर्ताओं ने पांच विशिष्ट एजेंटों का निर्माण करके शुरुआत की। प्रत्येक एजेंट एक कंप्यूटर प्रोग्राम है जिसे निवेश निर्णय लेने के लिए डिज़ाइन किया गया है, लेकिन उन्हें अलग-अलग गणितीय दृष्टिकोणों का उपयोग करके प्रशिक्षित किया गया था। हालांकि सभी एजेंटों को एक ही पोर्टफोलियो वातावरण और एक ही रिवॉर्ड फंक्शन के साथ प्रशिक्षित किया गया था, उनके अलग-अलग शिक्षण तंत्रों के कारण प्रत्येक एजेंट का एक अद्वितीय व्यक्तित्व विकसित हुआ। एक बहुत आक्रामक हो सकता है, उच्च लाभ के पीछे भागते हुए बड़े जोखिम ले सकता है, जबकि दूसरा अधिक सतर्क हो सकता है, जो तीव्र लाभ के बजाय स्थिरता को प्राथमिकता देता है। एक स्थिर बाजार में, आक्रामक एजेंट चमक सकता है। एक अशांत बाजार में, केवल सतर्क वाला ही जीवित बच सकता है। समस्या यह है कि कोई भी एकल एजेंट हर समय हर चीज में सर्वश्रेष्ठ नहीं होता है। यदि कोई निवेशक केवल एक एजेंट चुनता है और उसी के साथ बना रहता है, तो वे तब नुकसान उठा सकते हैं जब बाजार उस दिशा में बदल जाता है जो उस एजेंट को पसंद नहीं है।
इस समस्या को हल करने के लिए, शोधकर्ताओं ने एक पर्यवेक्षक एजेंट (सुपरवाजर एजेंट) पेश किया। यह पर्यवेक्षक पांच एजेंटोंों के आंतरिक कोड को नहीं जानता है। इसके बजाय, यह एक खेल को देख रहे कोच की तरह कार्य करता है, जो केवल स्कोरबोर्ड को देखता है। यह प्रत्येक एजेंट के लिए सात अलग-अलग प्रदर्शन मेट्रिक्स को ट्रैक करता है, जैसे कि उन्होंने कितना लाभ कमाया, उस लाभ को पाने के लिए उन्होंने कितना जोखिम लिया, और सकारात्मक रिटर्न की अवधियों का अनुपात। यह इन नंबरों को विभिन्न समयावधियों में देखता है, पिछले कुछ घंटों से लेकर पिछले कुछ दिनों तक। पर्यवेक्षक का काम यह पता लगाना है कि अभी कौन सा मेट्रिक सबसे महत्वपूर्ण है। एक शांत बाजार में, पर्यवेक्षक यह तय कर सकता है कि निरंतर, स्थिर लाभ सबसे महत्वपूर्ण संकेत है। एक अराजक बाजार में, वह यह तय कर सकता है कि बड़े नुकसान से बचना ही एकमात्र चीज है जो मायने रखती है।
पर्यवेक्षक इस वेटिंग सिस्टम (भार प्रणाली) को अपनी स्वयं की प्रशिक्षण प्रक्रिया के माध्यम से सीखता है। वह बाजार और एजेंटों के हालिया इतिहास का अवलोकन करता है, और फिर विभिन्न प्रदर्शन मेट्रिक्स को महत्व स्कोर देने के लिए सीखता है। यह केवल हालिया उच्चतम लाभ वाले एजेंट को नहीं चुनता है। इसके बजाय, यह प्रत्येक एजेंट के प्रदर्शन डेटा को उस विशिष्ट क्षण के लिए पर्यवेक्षक द्वारा सीखे गए महत्व के भार (वेट्स) के साथ जोड़कर एक स्कोर की गणना करता है। उच्चतम कुल स्कोर वाले एजेंट को अगले ट्रेडिंग काल के लिए पोर्टफोलियो का प्रबंधन करने के लिए चुना जाता है। यह एक ऐसा सिस्टम बनाता है जो लगातार अपने विकल्पों का पुनर्मूल्यांकन करता है, बाजार के वातावरण के बदलने के साथ एक एजेंट से दूसरे पर अपना विश्वास स्थानांतरित करता है।
शोधकर्ताओं ने बाइनेंस क्रिप्टोकरेंसी एक्सचेंज के तीस मिनट के मूल्य डेटा का उपयोग करके इस प्रणाली का परीक्षण किया, जो 1 जनवरी, 2021 से 31 दिसंबर, 2025 की अवधि को कवर करता है। उन्होंने दो अलग-अलग परिदृश्य सेट किए: एक जिसमें चार लोकप्रिय क्रिप्टोकरेंसी थीं और दूसरा जिसमें पांच थीं, यह देखने के लिए कि क्या सिस्टम निवेश के थोड़े बड़े समूह को संभाल सकता है। उन्होंने अपने पर्यवेक्षक सिस्टम की तुलना पांच व्यक्तिगत एजेंटों, सभी संपत्तियों को समान रूप से खरीदने और रखने की एक सरल रणनीति, और कई पारंपरिक निवेश सूत्रों से की। परिणाम स्पष्ट थे। पर्यवेक्षक प्रणाली ने किसी भी व्यक्तिगत एजेंट या पारंपरिक रणनीतियों की तुलना में काफी अधिक अंतिम पोर्टफोलियो मूल्य उत्पन्न किया। चार-संपत्ति वाले परिदृश्य में, पर्यवेक्षक ने पोर्टफोलियो मूल्य को शुरुआती राशि के 2.349 गुना तक बढ़ा दिया, जबकि सर्वश्रेष्ठ व्यक्तिगत एजेंट केवल 1.652 तक पहुँच सका। पांच-संपत्ति वाले परिदृश्य में, पर्यवेक्षक ने शुरुआती मूल्य का 3.044 गुना तक पहुँच प्राप्त किया, जबकि सर्वश्रेष्ठ व्यक्तिगत एजेंट के लिए यह 2.554 था।
महत्वपूर्ण बात यह है कि यह अतिरिक्त वृद्धि उच्च जोखिम की कीमत पर नहीं आई। पर्यवेक्षक प्रणाली ने व्यक्तिगत एजेंटों की तुलना में कम अधिकतम नुकसान, जिसे ड्रॉडाउन (drawdown) कहा जाता है, का भी अनुभव किया। इससे पता चलता है कि सिस्टम केवल उच्च रिटर्न पाने के लिए बड़े जुए नहीं लगा रहा था; बल्कि यह वास्तव में यह जानकर जोखिम का बेहतर प्रबंधन कर रहा था कि कब एक सुरक्षित एजेंट पर स्विच करना है। शोधकर्ताओं ने अपने सिस्टम की तुलना एक सरल संस्करण से भी की जो एजेंटों को बदलने के लिए केवल एक निश्चित नियम का उपयोग करता था, जैसे कि हमेशा हाल के उच्चतम लाभ वाले एजेंट को चुनना। पर्यवेक्षक प्रणाली ने इन एकल-नियम वाली रणनीतियों को बहुत पीछे छोड़ दिया। इसने साबित किया कि सिस्टम की सफलता एक एकल, कठोर मानदंड पर निर्भर रहने के बजाय, कई कारकों को एक साथ तौलने की इसकी क्षमता से आई थी।
यह समझने के लिए कि वास्तव में इस सिस्टम ने कैसे काम किया, शोधकर्ताओं ने एक श्रृंखला में परीक्षण किए जहाँ उन्होंने यह देखने के लिए सिस्टम के हिस्सों को हटाया कि क्या होता है। उन्होंने पाया कि सिस्टम को अपने सर्वश्रेष्ठ प्रदर्शन के लिए सातों प्रदर्शन मेट्रिक्स और चारों टाइम विंडो की आवश्यकता थी। लाभ से संबंधित मेट्रिक्स को हटाने से धन बढ़ाने की सिस्टम की क्षमता को नुकसान पहुँचा, जबकि जोखिम से संबंधित मेट्रिक्स को हटाने से नुकसान से बचने की इसकी क्षमता को नुकसान पहुँचा। इसी तरह, सिस्टम को अल्पकालिक और दीर्घकालिक दोनों प्रदर्शन इतिहास को देखने की आवश्यकता थी। चार-संपत्ति वाले परीक्षण में, दीर्घकालिक इतिहास सबसे महत्वपूर्ण था, जबकि पांच-संपत्ति वाले परीक्षण में, अल्पकालिक इतिहास अधिक महत्वपूर्ण था। इस भिन्नता ने दिखाया कि सिस्टम एक निश्चित नियम का उपयोग नहीं कर रहा था, बल्कि वास्तव में वर्तमान पोर्टफोलियो और बाजार की स्थितियों की विशिष्ट आवश्यकताओं के अनुकूल हो रहा था।
अध्ययन निष्कर्ष निकालता है कि पोर्टफोलियो का प्रबंधन करना केवल एक एकल सर्वश्रेष्ठ ट्रेडिंग एल्गोरिदम खोजने के बारे में नहीं है। यह एक ऐसी संरचना बनाने के बारे में है जो काम बदलने के साथ सही उपकरण चुनने में सक्षम हो। प्रदर्शन के विभिन्न संकेतों को गतिशील रूप से तौलने के लिए एक पर्यवेक्षक का उपयोग करके, सिस्टम क्रिप्टोकरेंसी बाजारों की अप्रत्याशित प्रकृति को किसी भी एकल एजेंट या स्थिर रणनीति की तुलना में अधिक प्रभावी ढंग से नेविगेट कर सकता है। शोधकर्ता उल्लेख करते हैं कि उनका वर्तमान सिस्टम पांच एजेंटों के एक विशिष्ट सेट और बाजार डेटा के एक विशिष्ट सेट का उपयोग करता है। भविष्य के कार्य में विभिन्न जोखिम प्रोफाइल वाले एजेंटों को शामिल करके या अन्य प्रकार की संपत्तियों पर सिस्टम का परीक्षण करके इसे विस्तारित किया जा सकता है। हालाँकि, मूल निष्कर्ष मजबूत बना हुआ है: एक पदानुक्रमित दृष्टिकोण (hierarchical approach) जो प्रदर्शन के लचीले, बहु-आयामी दृष्टिकोण के आधार पर नीतियों को चुनने के लिए सीखता है, वित्तीय बाजारों की अनिश्चितता को संभालने का एक शक्तिशाली तरीका प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।