Bridging Behavioral Finance and Robust Agentic DRL: A novel computational framework for Portfolio Selection
यह अध्ययन RPPO-MPT को प्रस्तुत करता है, जो एक नवीन सुदृढ़ सुदृढ़ीकरण शिक्षण (robust reinforcement learning) ढांचा है जो बाजार की अनिश्चितता के तहत निवेशक व्यवहार संबंधी प्राथमिकताओं के साथ बेहतर तालमेल बिठाकर इक्विटी पोर्टफोलियो अनुकूलन में पारंपरिक मॉडलों से बेहतर प्रदर्शन करने के लिए विक्षोभ-आधारित शोर न्यूनीकरण (perturbation-based noise reduction) को प्रॉस्पेक्ट थ्योरी-प्रेरित रिवॉर्ड शेपिंग के साथ एकीकृत करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जहाज के कप्तान हैं जो एक बहुत ही तूफानी समुद्र में अपनी राह बना रहे हैं। यह समुद्र शेयर बाजार का प्रतिनिधित्व करता है, और आपका जहाज आपका निवेश पोर्टफोलियो (investment portfolio) है।
लंबे समय से, कप्तान (निवेशक) दो मुख्य तरीकों से दिशा निर्धारित करने के लिए उपयोग करते आए हैं:
- पुराना नक्शा (पारंपरिक वित्त/Traditional Finance): यह मानता है कि समुद्र अनुमानित है और नाविक पूरी तरह से तर्कसंगत रोबोट हैं जिन्हें केवल मंजिल तक जितनी जल्दी हो सके पहुँचने की परवाह है, चाहे लहरें कितनी भी डरावनी क्यों न हों।
- नया जीपीएस (मानक एआई/Standard AI): हालांकि, अधिकांश एआई कप्तान अभी भी रोबोट की तरह व्यवहार करते हैं। वे बड़ी लहरों (मुनाफे) से उत्साहित होते हैं, लेकिन जब पानी उथल-पुथल भरा होता है तो वे इंसानों की तरह ही घबरा जाते हैं, जिससे वे ऐसे निर्णय लेते हैं जो एक वास्तविक मानव निवेशक को "सही" नहीं लगते।
यह शोध पत्र एक नए, सुपर-स्मार्ट एआई कप्तान से परिचय कराता है जिसे RPPO-MPT कहा जाता है। इसे तीन विशिष्ट तरकीबों को जोड़कर इस तूफानी समुद्र को बेहतर ढंगм से संभालने के लिए डिज़ाइन किया गया है।
नए कप्तान की तीन तरकीबें
1. "क्या होगा अगर?" प्रशिक्षण (मजबूती/Robustness)
कल्पना कीजिए कि आप एक दौड़ के लिए अभ्यास कर रहे हैं। एक सामान्य कप्तान शांत दिन पर अभ्यास करता है। यदि दौड़ के दिन अचानक तूफान आ जाए, तो वह सुन्न पड़ सकता है।
हालाँकि, नया कप्तान एक सिम्युलेटर में अभ्यास करता है जहाँ कंप्यूटर जानबूझकर नकली तूफान, हवा के झोंके और कोहरा जोड़ देता है। यह पूछता है, "क्या होगा अगर हवा 5% अधिक तेज चले? क्या होगा अगर धारा थोड़ी बदल जाए?"
इन "नकली" अराजक स्थितियों में प्रशिक्षण लेकर, कप्तान सीखता है कि जब वास्तविक समुद्र अव्यवस्थपूर्ण हो जाए, तो कैसे शांत रहना है और सही दिशा में मुड़ना है। इसे परटर्बेशन-आधारित मजबूत शिक्षण (perturbation-based robust learning) कहा जाता है। यह एआई को शोर (noise) के प्रति कम संवेदनशील बनाता है और बाजार के उतार-चढ़ाव के दौरान घबराहट में निर्णय लेने की संभावना को कम करता है।
2. "मानवीय हृदय" पुरस्कार प्रणाली (प्रोस्पेक्ट थ्योरी/Prospect Theory)
मानक एआई कप्तान को हर कमाए गए डॉलर के लिए एक "गोल्ड स्टार" (पुरस्कार) मिलता है। लेकिन वास्तविक इंसान ऐसा महसूस नहीं करते।
- डर: 100 पाने की खुशी से कहीं अधिक बुरा लगता है।
- उम्मीद: हम मुनाफे से उत्साहित होते हैं, लेकिन हम नुकसान से बहुत डरते हैं।
नये कप्तान को एक "उम्मीद-डर" पुरस्कार प्रणाली के साथ प्रोग्राम किया गया है। केवल डॉलर गिनने के बजाय, यह एक स्कोर की गणना करता है कि एक इंसान कैसा महसूस करेगा। - यदि जहाज पैसा बनाता है, तो इसे एक "उम्मीद" स्कोर मिलता है (लेकिन जैसे-जैसे आप अमीर होते हैं, उत्साह धीरे-धीरे बढ़ता है)।
- यदि जहाज पैसा खोता है, तो इसे एक "डर" स्कोर मिलता है (और दर्द को 2.25 गुना बढ़ा दिया जाता है!)।
यह एआई को स्वाभाविक रूप से पैसा खोने के प्रति सावधान रहने के लिए प्रशिक्षित करता है, जितना कि वह पैसा कमाने के लिए उत्सुक है, जो कि यह दर्शाता है कि वास्तविक लोग वास्तव में कैसे व्यवहार करते हैं।
3. हाइब्रिड दृष्टिकोण (Hybrid Approach)
यह शोध पत्र तीन संस्करणों वाले कप्तानों की तुलना करता है:
- बुनियादी कप्तान (PPO): मानक एआई जीपीएस का उपयोग करता है। अच्छा है, लेकिन तूफानों से हिल सकता है।
- मजबूत कप्तान (RPPO): "क्या होगा अगर?" प्रशिक्षण का उपयोग करता है। बहुत स्थिर, लेकिन मानवीय डर को नहीं समझता।
- सुपर कप्तान (RPPO-MPT): इसमें "क्या होगा अगर?" प्रशिक्षण और "मानवीय हृदय" पुरस्कार प्रणाली दोनों का उपयोग किया गया है।
दौड़ के परिणाम
लेखकों ने 15 बड़ी अमेरिकी कंपनियों (जैसे एप्पल और अमेज़न) के डेटा का उपयोग करके इन कप्तानों का परीक्षण किया, जो एक लंबी अवधि (2010 से 2025) तक चली। उन्होंने समय को दो भागों में विभाजित किया: एक "अभ्यास" अवधि (2010-2022) और एक "वास्तविक दौड़" अवधि (2022-2025)।
यहाँ क्या हुआ:
- बुनियादी कप्तान ठीक-ठाक था, लेकिन कभी-कभी बाजार के उतार-चढ़ाव से विचलित हो जाता था।
- मजबूत कप्तान अधिक स्थिर था और शोर को अच्छी तरह से संभालता था।
- सुपर कप्तान (RPPO-MPT) दौड़ जीत गया।
सुपर कप्तान क्यों जीता?
- उच्च रिटर्न: इसने समय के साथ अधिक पैसा बनाया।
- बेहतर सुरक्षा: इसने डरावने हिस्सों के दौरान उतना पैसा नहीं गंवाया (कम "ड्रॉडाउन"/drawdown)।
- खुश निवेशक: क्योंकि यह "उम्मीद-डर" के संतुलन को समझता था, इसने ऐसे परिणाम दिए जो एक मानव निवेशक के लिए बेहतर महसूस होते थे, जिससे एक बेहतर "उपयोगिता" (utility) स्कोर प्राप्त हुआ।
निष्कर्ष
यह शोध पत्र दावा करता है कि एआई को नकली अराजकता में अभ्यास करने (मजबूती बनाने के लिए) और इंसान की तरह सोचने (डर और उम्मीद को समझने के लिए) सिखाकर, आप एक ऐसा पोर्टफोलियो मैनेजर बना सकते हैं जो मानक एआई मॉडल की तुलना में अधिक सुरक्षित और अधिक लाभदायक है। यह ठंडे, कठोर गणित और लोगों के निवेश करने के वास्तविक, भावनात्मक वास्तविकता के बीच के अंतर को पाटता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।