← नवीनतम पेपर
💰 quantitative finance

FinSMART: Financial Sentiment Analysis for Algorithmic Trading through Market-Aligned Reinforcement Learning

FinSMART एक नवीन मार्केट-अलाइन्ड रीइन्फोर्समेंट लर्निंग फ्रेमवर्क पेश करता है जो स्थिर मानव एनोटेशन के बजाय वास्तविक बाजार परिणामों का उपयोग करके वित्तीय भावना विश्लेषण (फाइनेंशियल सेंटीमेंट एनालिसिस) को अनुकूलित करता है, जो लाभप्रदता में मौजूदा तरीकों से काफी बेहतर प्रदर्शन करता है और विकसित होती बाजार गतिशीलता के अनुकूल निरंतर अनुकूलन को सक्षम बनाता है।

मूल लेखक: Giorgos Iacovides, Wuyang Zhou, Danilo Mandic

प्रकाशित 2026-07-31
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Giorgos Iacovides, Wuyang Zhou, Danilo Mandic

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मौसम की भविष्यवाणी करना सिखाने की कोशिश कर रहे हैं। आप उसे हजारों पुराने, धूल भरे मौसम मानचित्र दिखा सकते हैं और उससे पूछ सकते हैं कि बारिश होने से पहले बादल कैसे दिखते थे। आज के अधिकांश कंप्यूटर प्रोग्राम इसी तरह सीखते हैं: वे अतीत के उदाहरणों के एक स्थिर पुस्तकालय का अध्ययन करते हैं और उम्मीद करते हैं कि भविष्य भी अतीत जैसा ही होगा। लेकिन क्या होगा अगर मौसम अचानक बदल जाए? क्या होगा अगर एक नए प्रकार का तूफान आ जाए जो पुरानी किताबों में नहीं था? रोबोट अटक जाएगा, पुराने नियमों के आधार पर अनुमान लगाएगा। यह उस समस्या का रूप है जिसका सामना वे कंप्यूटर कर रहे हैं जो शेयर की कीमतों की भविष्यवाणी करने के लिए वित्तीय समाचारों को पढ़ने की कोशिश करते हैं। वे वर्तमान में मानव-चिह्नित डेटासेट (human-annotated datasets) पर प्रशिक्षित होते हैं—मूल रूप से, लोग समाचार पढ़ रहे हैं और शेयर बाजार के लिए "अच्छा" या "बुरा" लिख रहे हैं। लेकिन इंसान धीमे हैं, महंगे हैं, और उनकी राय वास्तव में अराजक, तेजी से चलते शेयर बाजार में क्या होता है, उससे मेल नहीं खा सकती।

यहाँ "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning) की दुनिया में प्रवेश होता है। इसे एक पाठ्यपुस्तक पढ़ने के बजाय, एक वीडियो गेम खेलने के रूप में सोचें। चीजें याद करने के बजाय, कंप्यूटर चीजों को आजमाकर, गलतियाँ करके और अच्छा करने पर अंक (पुरस्कार/rewards) प्राप्त करके सीखता है। जिस शोध पत्र को आप पढ़ने जा रहे हैं, उसमें लेखक एक नया तरीका पेश कर रहे हैं जिससे कंप्यूटर को वित्तीय समाचार समझने के लिए सिखाया जा सके। वे इसे FinSMART कहते हैं। कंप्यूटर के उत्तरों को ग्रेड देने के लिए इंसानों से पूछने के बजाय, वे शेयर बाजार को ही इसका शिक्षक बनने देते हैं। यदि कंप्यूटर भविष्यवाणी करता है कि स्टॉक ऊपर जाएगा, और स्टॉक वास्तव में ऊपर जाता है, तो उसे उच्च स्कोर मिलता है। यदि वह गलत होता है, तो उसे कम स्कोर मिलता है। यह कंप्यूटर को पुराने, स्थिर क्लासरूम के बजाय, बाजार की वास्तविक, अव्यवस्थित और शोर भरी वास्तविकता से सीधे सीखने की अनुमति देता है।


समस्या: वह रोबोट जो केवल पाठ्यपुस्तकें पढ़ता है

लंबे समय से, शेयर बाजार की भविष्यवाणी करने वाले कंप्यूटर उन छात्रों की तरह रहे हैं जो पिछले वर्ष के परीक्षा पत्रों का उपयोग करके केवल परीक्षा के लिए अध्ययन करते हैं। वे "लार्ज लैंग्वेज मॉडल्स" (LLMs) का उपयोग करते हैं—सुपर-स्मार्ट AI जो मनुष्यों की तरह पढ़ और लिख सकता है—वित्तीय समाचारों को स्कैन करने के लिए। लेकिन ये AI आमतौर पर "सुपरवाइज्ड लर्निंग" (Supervised Learning) का उपयोग करके प्रशिक्षित होते हैं। कल्पना कीजिए कि एक शिक्षक एक छात्र को समाचार लेखों का एक ढेर दे रहा है जिसमें उत्तर पहले से ही लाल स्याही में लिखे हुए हैं: "यह अच्छा है," "यह बुरा है।" छात्र इन लाल स्याही वाले उत्तरों को रट लेता है।

समस्या यह है कि शेयर बाजार एक जीवित, सांस लेती हुई चीज है जो हर सेकंड बदलती है। पिछले वर्ष के "लाल स्याही" वाले उत्तर आज पूरी तरह से गलत हो सकते हैं। इसके अलावा, उन उत्तरों को लिखने के लिए इंसानों को नियुक्त करना धीमा और महंगा है। शोध पत्र का तर्क है कि इन स्थिर, मानव-निर्मित लेबल पर निर्भर रहना एक शांत झील के मानचित्र का उपयोग करके तूफानी समुद्र में रास्ता खोजने जैसा है। ये मॉडल "मार्केट-अग्नोस्टिक" (market-agnostic) हैं, जिसका अर्थ है कि उन्हें इस बात से कोई फर्क नहीं पड़ता कि उनके द्वारा भविष्यवाणी किए जाने के बाद वास्तविक बाजार में क्या होता है; वे बस मानव लेबल से मेल खाना चाहते हैं।

समाधान: बाजार को शिक्षक बनने दें

लेखक FinSMART पेश करते हैं, जो एक नया ढांचा है जो खेल को पूरी तरह बदल देता है। AI को ग्रेड देने के लिए किसी इंसान से पूछने के बजाय, FinSMART शेयर बाजार से इसे ग्रेड देने के लिए कहता है।

यहाँ जादू चरण-दर-चरण कैसे होता है:

  1. सेटअप: AI एक वित्तीय समाचार लेख पढ़ता है और अनुमान लगाता है कि स्टॉक ऊपर जाएगा (पॉजिटिव), नीचे जाएगा (नेगेटिव), या स्थिर रहेगा (न्यूट्रल)।
  2. रियलिटी चेक: सिस्टम यह देखने के लिए इंतजार करता है कि उस दिन वास्तव में स्टॉक की कीमत में क्या बदलाव आता है।
  3. स्कोर: यदि AI ने "पॉजिटिव" का अनुमान लगाया और स्टॉक की कीमत वास्तव में ऊपर गई (विशेष रूप से, यदि इसने सामान्य बाजार से एक निश्चित मात्रा में बेहतर प्रदर्शन किया), तो AI को बड़ा पुरस्कार मिलता है। यदि इसने "नेगेटिव" का अनुमान लगाया और स्टॉक गिर गया, तो इसे भी पुरस्कार मिलता है। लेकिन यदि AI ने "पॉजिटिव" का अनुमान लगाया और स्टॉक गिर गया, तो इसे भारी दंड मिलता है।
  4. फ़िल्टर: बाजार में बहुत शोर होता है। कभी-कभी एक स्टॉक इसलिए ऊपर जाता है क्योंकि पूरी अर्थव्यवस्था अच्छी चल रही होती है, न कि समाचार के कारण। इसे ठीक करने के लिए, FinSMART एक चतुर "डुअल-फ़िल्टर" (dual-filter) प्रणाली का उपयोग करता है। यह पुरस्कार तभी देता है जब स्टॉक सही दिशा में चलता है और वह हलचल इतनी मजबूत हो कि उसे केवल रैंडम शोर के बजाय एक वास्तविक संकेत माना जा सके। यह एक ऐसे शिक्षक की तरह है जो आपको स्वर्ण स्टार (gold star) तभी देता है जब आपका उत्तर सही हो और आपने अपना काम स्पष्ट रूप से दिखाया हो, उन समयों को अनदेखा करते हुए जब आप केवल भाग्यशाली थे।

इस प्रक्रिया को मार्केट-अलाइन्ड रीइन्फोर्समेंट लर्निंग (Market-Aligned Reinforcement Learning) कहा जाता है। AI ट्रेडिंग के खेल को बार-बार खेलकर सीखता है, अपने मस्तिष्क (अपने "वेट्स") को उस स्कोर के आधार पर समायोजित करता है जो बाजार उसे देता है।

सीक्रेट सॉस: GRPO और "ग्रुप" गेम

आप सोच सकते हैं, "यदि बाजार इतना शोर भरा है, तो क्या AI भ्रमित नहीं हो जाएगा?" लेखक एक विशेष प्रशिक्षण तकनीक का उपयोग करते हैं जिसे ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) कहा जाता है।

एक ऐसी कक्षा की कल्पना करें जहाँ शिक्षक छात्र को यह नहीं बताता कि उसका उत्तर पूर्ण शब्दों में "सही" है या "गलत"। इसके बजाय, शिक्षक आठ छात्रों को एक ही प्रश्न का उत्तर देने के लिए कहता है। फिर, शिक्षक कहता है, "जिस छात्र का स्कोर सबसे अधिक है उसे बोनस मिलेगा, और जिसका सबसे कम है उसे अंक गंवाने होंगे।" AI एक ही समाचार लेख के लिए आठ अलग-अलग अनुमान लगाकर ऐसा करता है। यह आपस में तुलना करता है। यदि एक अनुमान अन्य की तुलना में बेहतर बाजार परिणाम की ओर ले जाता है, तो AI उस तरह का अनुमान अधिक बार लगाने के लिए सीखता है। यह AI को सबसे अच्छे सिग्नल को खोजने में मदद करता है, भले ही बाजार का डेटा अव्यवस्थित और भ्रमित करने वाला हो।

परिणाम: पुराने चैंपियनों को हराना

लेखकों ने FinSMART का परीक्षण वर्तमान सर्वश्रेष्ठ मॉडलों (जैसे FinDPO और FinBERT) और कुछ पुराने शब्दकोश-आधारित तरीकों के खिलाफ किया। उन्होंने एक ट्रेडिंग रणनीति का अनुकरण किया जहाँ उन्होंने उन शेयरों को खरीदा जिन्हें AI पसंद करता था और उन्हें बेचा (शॉर्ट किया) जिन्हें वह नापसंद करता था।

परिणाम नाटकीय थे:

  • लाभ (Profit): FinSMART रणनीति ने परीक्षण अवधि के दौरान 264.9% का संचयी रिटर्न (cumulative return) बनाया। अगला सबसे अच्छा मॉडल, FinDPO, केवल 109.8% बना सका। यह एक बहुत बड़ा अंतर है।
  • जोखिम (Risk): FinSMART केवल अधिक पैसा नहीं कमा रहा था; यह अधिक सुरक्षित रूप से कर रहा था। इसका "शार्प रेशियो" (Sharpe Ratio - जोखिम के मुकाबले मिलने वाले रिटर्न का माप) 1.97 था, जबकि अगले सबसे अच्छे मॉडल का 1.12 था।
  • अनुकूलन क्षमता (Adaptability): लेखकों ने कुछ अनूठा भी आजमाया: उन्होंने AI को नए समाचार और नए बाजार परिणामों का उपयोग करके हर छह महीने में खुद को फिर से प्रशिक्षित करने दिया। यह "पीरियडिकली रिट्रेंड" (periodically retrained) संस्करण का FinSMART और भी बेहतर प्रदर्शन कर गया, जिसने 406.2% का संचयी रिटर्न हासिल किया।

यह क्यों महत्वपूर्ण है

शोध पत्र सुझाव देता है कि बाजार को सीधे AI को सिखाने देकर, हम ऐसे वित्तीय उपकरण बना सकते हैं जो केवल अतीत को याद नहीं रखते बल्कि वास्तव में वर्तमान के अनुकूल होते हैं। लेखकों ने पाया कि पुराना तरीका (स्थिर मानव लेबल) सीमित है क्योंकि यह बदलते बाजार के रुझानों के साथ तालमेल नहीं बिठा सकता। हालाँकि, FinSMART नए लेखों और उनके वास्तविक परिणामों से लगातार सीख सकता है।

संक्षेप में, यह शोध पत्र दिखाता है कि एक रोबोट जो केवल नियम पुस्तिका पढ़ने के बजाय शेयर बाजार का खेल खेलकर सीखता है, वह बहुत बेहतर खिलाड़ी बन सकता है। यह सुझाव देता है कि वित्तीय AI का भविष्य बड़ी पाठ्यपुस्तकों के बारे में नहीं है, बल्कि स्मार्ट, रियल-टाइम फीडबैक लूप के बारे में है जहाँ बाजार स्वयं अंतिम शिक्षक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →