CLaC@FinMMEval 2026 Task 3: Sentiment-Augmented Deep Reinforcement Learning for Active Trading -- An Alpha-Reward Approach
यह शोध पत्र CLaC@FinMMEval 2026 टास्क 3 के लिए एक सेंटीमेंट-ऑगमेंटेड डीप रीइन्फोर्समेंट लर्निंग सिस्टम प्रस्तुत करता है, जो यह प्रदर्शित करता है कि LLaMA 3.2 न्यूज़ सेंटीमेंट और अल्फा-आधारित रिवार्ड्स का उपयोग करने वाला एक DDPG एजेंट, TSLA और BTC पर बाय-एंड-होल्ड रणनीतियों की तुलना में काफी बेहतर प्रदर्शन करता है, और साथ ही बुल से बियर मार्केट रेजीम में नीतियों को सामान्य बनाने की चुनौतियों को भी उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक बहुत ही कठिन वीडियो गेम खेलना सिखाने की कोशिश कर रहे हैं: शेयर बाजार (स्टॉक मार्केट)। इस गेम में लक्ष्य केवल अंक जीतना नहीं है; बल्कि उस खिलाड़ी के स्कोर को हराना है जो कभी खेलना बंद नहीं करता, अपनी रणनीति कभी नहीं बदलता, और पूरे समय अपने चरित्र को थामे रखता है (एक ऐसी रणनीति जिसे "बाय-एंड-होल्ड" कहा जाता है)। यह गेम अराजक है, जो शोर भरे साउंड इफेक्ट्स, अचानक आने वाले ट्विस्ट और समाचारों की सुर्खियों की एक निरंतर धारा से भरा है जो नियमों को बदल सकते हैं। जीतने के लिए, आपको एक स्मार्ट एजेंट की आवश्यकता है जो स्क्रीन देख सके, समाचार पढ़ सके, गेम की लय को महसूस कर सके और यह तय कर सके कि आगे बढ़ना है, स्थिर रहना है, या पीछे हटना है। यह डीप रिइन्फोर्समेंट लर्निंग (DRL) की दुनिया है। DRL को एक ऐसी विधि के रूप में सोचें जहाँ एक AI परीक्षण और त्रुटि (ट्रायल एंड एरिवर) के माध्यम से सीखता है, जब वह एक अच्छा कदम उठाता है तो उसे "हाई-फाइव" (इनाम) मिलता है और जब वह गलती करता है तो "नाराजगी" (दंड) मिलती है। वह शोध पत्र जिसे आप पढ़ने जा रहे हैं, यह पता लगाता है कि दो बहुत अलग पात्रों के लिए अंतिम ट्रेडिंग रोबोट कैसे बनाया जाए: एक तकनीकी कंपनी टेस्ला (TSLA) और एक डिजिटल कॉइन बिटकॉइन (BTC)।
कन्वोर्डिया यूनिवर्सिटी के शोधकर्ताओं ने एक ऐसा ट्रेडिंग सिस्टम बनाने का लक्ष्य रखा जो केवल अनुमान न लगाए, बल्कि सीखे। उन्होंने शेयर बाजार को एक जटिल वीडियो गेम लेवल की तरह माना जहाँ खिलाड़ी (AI) को दैनिक निर्णय लेना होता है: लॉन्ग (Long) जाना (दांव लगाना कि कीमत बढ़ेगी), फ्लैट (Flat) रहना (किनारे पर बैठना), या शॉर्ट (Short) जाना (दांव लगाना कि कीमत गिरेगी)। AI को ये विकल्प चुनने में मदद करने के लिए, उन्होंने इसे तीन प्रकार की जानकारी दी: टेक्निकल इंडिकेटर्स (जैसे पिछले मूल्यों से खींची गई स्पीडोमीटर और ट्रेंड लाइनें), कैलेंडर साइकिल्स (यह जानना कि सोमवार है या महीने का अंत, क्योंकि बाजार कभी-कभी उन दिनों अलग व्यवहार करते हैं), और सेंटिमेंट स्कोर (समाचारों के लिए एक "मूड रिंग", जिसे एक सुपर-स्मार्ट AI द्वारा गणना की जाती है जो लेखों को पढ़कर यह देखता है कि लोग संपत्ति के बारे में खुश हैं या डरे हुए हैं)।
टीम ने इस गेम खेलने के लिए चार अलग-अलग प्रकार के AI "मस्तिष्क" प्रशिक्षित किए: पॉलिसी ग्रेडिएंट (PG), प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO), डीप Q-लर्निंग (DQL), और डीप डिटरमिनिस्टिक पॉलिसी ग्रेडिएंट (DDPG)। लेकिन यहाँ दिलचस्प हिस्सा यह है: केवल AI को पैसा कमाने के लिए पुरस्कृत करने के बजाय, उन्होंने इसे एक विशेष "अल्फा रिवॉर्ड" दिया। कल्पना कीजिए कि आप अपने दोस्त के साथ दौड़ रहे हैं; केवल इसलिए कि आप तेज़ दौड़ते हैं, आपको इनाम नहीं मिलता, बल्कि आपको अंक तभी मिलते हैं जब आप अपने दोस्त से तेज़ दौड़ते हैं। इसने AI को केवल इसलिए भाग्यशाली होने के बजाय "बाय-एंड-होल्ड" बेसलाइन को हराने पर ध्यान केंद्रित करने के लिए मजबूर किया क्योंकि पूरा बाजार ऊपर जा रहा था। उन्होंने प्रशिक्षण सत्रों को यादृच्छिक (रैंडम) समय पर शुरू किया ताकि AI केवल एक विशिष्ट गेम की पटकथा को याद न कर ले, बल्कि किसी भी स्थिति को संभालने के लिए सीख सके।
जब उन्होंने वास्तविक डेटा पर इन रोबोटों का परीक्षण किया, तो परिणाम सफलता और भविष्य के बारे में एक कठोर सबक का मिश्रण थे। टेस्ला के लिए, DDPG रोबोट स्टार था, जिसने 54.96% का भारी रिटर्न कमाया, जबकि DQL रोबट दूसरे स्थान पर रहा जिसने 52.62% कमाया। दोनों ने "बाय-एंड-होल्ड" रणनीति को बुरी तरह से हराया, जिसने केवल 16.45% बनाया। DDPG रोबोट विशेष रूप से परेशानी से बचने में अच्छा था, जिससे इसकी हानि (ड्रॉडडाउन) अन्य की तुलना में बहुत कम रही।
हालाँकि, बिटकॉइन परीक्षण एक बहुत कठिन स्तर था। बाजार एक 'बेयर मार्केट' (मंदी) में बदल गया, जहाँ कीमतें गिर गईं, और "बाय-एंड-होल्ड" रणनीति ने भारी 34.27% का नुकसान उठाया। इस तूफान में, DDPG रोबोट ही एकमात्र ऐसा था जो तैरता रहा, जो एक मामूली लेकिन सकारात्मक लाभ के साथ 1.58% पर समाप्त हुआ। अन्य रोबोट, जिनमें DQL भी शामिल था जो प्रशिक्षण के दौरान अद्भुत दिख रहा था, अचानक बढ़ते बाजार से गिरते बाजार में बदलाव के अनुकूल होने में संघर्ष कर गए।
शोध पत्र सुझाव देता है कि हालांकि ये AI एजेंट प्रभावी ढंग से व्यापार करना सीख सकते हैं, वे अभी भी बाजार के "मौसम" के प्रति संवेदनशील हैं। DDPG एल्गोरिदम सबसे मजबूत साबित हुआ, जिसने टेस्ला के धूप वाले दिनों और बिटकॉइन के तूफानी दिनों, दोनों को अन्य लोगों की तुलना में बेहतर तरीके से संभाला। हालाँकि, शोधकर्ताओं ने एक पेचीदा अंतर पाया: वह रोबट जो प्रशिक्षण के दौरान सबसे अच्छा दिख रहा था (DQL), वास्तविक परीक्षण में हमेशा नहीं जीता, खासकर जब बाजार का माहौल बुल मार्केट से बेयर मार्केट में बदल गया। यह हमें बताता है कि हालांकि AI वित्तीय समुद्रों में नौकायन करना सीख सकता है, उसे अभी भी सावधान रहने की आवश्यकता है कि वह शांत पानी का बहुत अधिक आदी न हो जाए, क्योंकि अगली लहर सुनामी हो सकती है। अंततः, अध्ययन दिखाता है कि समाचार भावना (न्यूज सेंटिमेंट) को स्मार्ट लर्निंग एल्गोरिदम के साथ जोड़ना बाजार को हराने में मदद कर सकता है, लेकिन "सर्वश्रेष्ठ" रोबोट इस बात पर निर्भर करता है कि वह किस प्रकार के बाजार का सामना कर रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।