← नवीनतम पेपर
🤖 machine learning

CLaC@FinMMEval 2026 Task 3: Sentiment-Augmented Deep Reinforcement Learning for Active Trading -- An Alpha-Reward Approach

यह शोध पत्र CLaC@FinMMEval 2026 टास्क 3 के लिए एक सेंटीमेंट-ऑगमेंटेड डीप रीइन्फोर्समेंट लर्निंग सिस्टम प्रस्तुत करता है, जो यह प्रदर्शित करता है कि LLaMA 3.2 न्यूज़ सेंटीमेंट और अल्फा-आधारित रिवार्ड्स का उपयोग करने वाला एक DDPG एजेंट, TSLA और BTC पर बाय-एंड-होल्ड रणनीतियों की तुलना में काफी बेहतर प्रदर्शन करता है, और साथ ही बुल से बियर मार्केट रेजीम में नीतियों को सामान्य बनाने की चुनौतियों को भी उजागर करता है।

मूल लेखक: Andrei Neagu, Eeham Khan, Leila Kosseim

प्रकाशित 2026-07-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andrei Neagu, Eeham Khan, Leila Kosseim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बहुत ही कठिन वीडियो गेम खेलना सिखाने की कोशिश कर रहे हैं: शेयर बाजार (स्टॉक मार्केट)। इस गेम में लक्ष्य केवल अंक जीतना नहीं है; बल्कि उस खिलाड़ी के स्कोर को हराना है जो कभी खेलना बंद नहीं करता, अपनी रणनीति कभी नहीं बदलता, और पूरे समय अपने चरित्र को थामे रखता है (एक ऐसी रणनीति जिसे "बाय-एंड-होल्ड" कहा जाता है)। यह गेम अराजक है, जो शोर भरे साउंड इफेक्ट्स, अचानक आने वाले ट्विस्ट और समाचारों की सुर्खियों की एक निरंतर धारा से भरा है जो नियमों को बदल सकते हैं। जीतने के लिए, आपको एक स्मार्ट एजेंट की आवश्यकता है जो स्क्रीन देख सके, समाचार पढ़ सके, गेम की लय को महसूस कर सके और यह तय कर सके कि आगे बढ़ना है, स्थिर रहना है, या पीछे हटना है। यह डीप रिइन्फोर्समेंट लर्निंग (DRL) की दुनिया है। DRL को एक ऐसी विधि के रूप में सोचें जहाँ एक AI परीक्षण और त्रुटि (ट्रायल एंड एरिवर) के माध्यम से सीखता है, जब वह एक अच्छा कदम उठाता है तो उसे "हाई-फाइव" (इनाम) मिलता है और जब वह गलती करता है तो "नाराजगी" (दंड) मिलती है। वह शोध पत्र जिसे आप पढ़ने जा रहे हैं, यह पता लगाता है कि दो बहुत अलग पात्रों के लिए अंतिम ट्रेडिंग रोबोट कैसे बनाया जाए: एक तकनीकी कंपनी टेस्ला (TSLA) और एक डिजिटल कॉइन बिटकॉइन (BTC)।

कन्वोर्डिया यूनिवर्सिटी के शोधकर्ताओं ने एक ऐसा ट्रेडिंग सिस्टम बनाने का लक्ष्य रखा जो केवल अनुमान न लगाए, बल्कि सीखे। उन्होंने शेयर बाजार को एक जटिल वीडियो गेम लेवल की तरह माना जहाँ खिलाड़ी (AI) को दैनिक निर्णय लेना होता है: लॉन्ग (Long) जाना (दांव लगाना कि कीमत बढ़ेगी), फ्लैट (Flat) रहना (किनारे पर बैठना), या शॉर्ट (Short) जाना (दांव लगाना कि कीमत गिरेगी)। AI को ये विकल्प चुनने में मदद करने के लिए, उन्होंने इसे तीन प्रकार की जानकारी दी: टेक्निकल इंडिकेटर्स (जैसे पिछले मूल्यों से खींची गई स्पीडोमीटर और ट्रेंड लाइनें), कैलेंडर साइकिल्स (यह जानना कि सोमवार है या महीने का अंत, क्योंकि बाजार कभी-कभी उन दिनों अलग व्यवहार करते हैं), और सेंटिमेंट स्कोर (समाचारों के लिए एक "मूड रिंग", जिसे एक सुपर-स्मार्ट AI द्वारा गणना की जाती है जो लेखों को पढ़कर यह देखता है कि लोग संपत्ति के बारे में खुश हैं या डरे हुए हैं)।

टीम ने इस गेम खेलने के लिए चार अलग-अलग प्रकार के AI "मस्तिष्क" प्रशिक्षित किए: पॉलिसी ग्रेडिएंट (PG), प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO), डीप Q-लर्निंग (DQL), और डीप डिटरमिनिस्टिक पॉलिसी ग्रेडिएंट (DDPG)। लेकिन यहाँ दिलचस्प हिस्सा यह है: केवल AI को पैसा कमाने के लिए पुरस्कृत करने के बजाय, उन्होंने इसे एक विशेष "अल्फा रिवॉर्ड" दिया। कल्पना कीजिए कि आप अपने दोस्त के साथ दौड़ रहे हैं; केवल इसलिए कि आप तेज़ दौड़ते हैं, आपको इनाम नहीं मिलता, बल्कि आपको अंक तभी मिलते हैं जब आप अपने दोस्त से तेज़ दौड़ते हैं। इसने AI को केवल इसलिए भाग्यशाली होने के बजाय "बाय-एंड-होल्ड" बेसलाइन को हराने पर ध्यान केंद्रित करने के लिए मजबूर किया क्योंकि पूरा बाजार ऊपर जा रहा था। उन्होंने प्रशिक्षण सत्रों को यादृच्छिक (रैंडम) समय पर शुरू किया ताकि AI केवल एक विशिष्ट गेम की पटकथा को याद न कर ले, बल्कि किसी भी स्थिति को संभालने के लिए सीख सके।

जब उन्होंने वास्तविक डेटा पर इन रोबोटों का परीक्षण किया, तो परिणाम सफलता और भविष्य के बारे में एक कठोर सबक का मिश्रण थे। टेस्ला के लिए, DDPG रोबोट स्टार था, जिसने 54.96% का भारी रिटर्न कमाया, जबकि DQL रोबट दूसरे स्थान पर रहा जिसने 52.62% कमाया। दोनों ने "बाय-एंड-होल्ड" रणनीति को बुरी तरह से हराया, जिसने केवल 16.45% बनाया। DDPG रोबोट विशेष रूप से परेशानी से बचने में अच्छा था, जिससे इसकी हानि (ड्रॉडडाउन) अन्य की तुलना में बहुत कम रही।

हालाँकि, बिटकॉइन परीक्षण एक बहुत कठिन स्तर था। बाजार एक 'बेयर मार्केट' (मंदी) में बदल गया, जहाँ कीमतें गिर गईं, और "बाय-एंड-होल्ड" रणनीति ने भारी 34.27% का नुकसान उठाया। इस तूफान में, DDPG रोबोट ही एकमात्र ऐसा था जो तैरता रहा, जो एक मामूली लेकिन सकारात्मक लाभ के साथ 1.58% पर समाप्त हुआ। अन्य रोबोट, जिनमें DQL भी शामिल था जो प्रशिक्षण के दौरान अद्भुत दिख रहा था, अचानक बढ़ते बाजार से गिरते बाजार में बदलाव के अनुकूल होने में संघर्ष कर गए।

शोध पत्र सुझाव देता है कि हालांकि ये AI एजेंट प्रभावी ढंग से व्यापार करना सीख सकते हैं, वे अभी भी बाजार के "मौसम" के प्रति संवेदनशील हैं। DDPG एल्गोरिदम सबसे मजबूत साबित हुआ, जिसने टेस्ला के धूप वाले दिनों और बिटकॉइन के तूफानी दिनों, दोनों को अन्य लोगों की तुलना में बेहतर तरीके से संभाला। हालाँकि, शोधकर्ताओं ने एक पेचीदा अंतर पाया: वह रोबट जो प्रशिक्षण के दौरान सबसे अच्छा दिख रहा था (DQL), वास्तविक परीक्षण में हमेशा नहीं जीता, खासकर जब बाजार का माहौल बुल मार्केट से बेयर मार्केट में बदल गया। यह हमें बताता है कि हालांकि AI वित्तीय समुद्रों में नौकायन करना सीख सकता है, उसे अभी भी सावधान रहने की आवश्यकता है कि वह शांत पानी का बहुत अधिक आदी न हो जाए, क्योंकि अगली लहर सुनामी हो सकती है। अंततः, अध्ययन दिखाता है कि समाचार भावना (न्यूज सेंटिमेंट) को स्मार्ट लर्निंग एल्गोरिदम के साथ जोड़ना बाजार को हराने में मदद कर सकता है, लेकिन "सर्वश्रेष्ठ" रोबोट इस बात पर निर्भर करता है कि वह किस प्रकार के बाजार का सामना कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →