← नवीनतम पेपर
🤖 AI

GIFT: LLM-Guided State-Reward Interface for Financial Reinforcement Learning

यह शोध पत्र GIFT का प्रस्ताव करता है, जो एक LLM-निर्देशित ढांचा है जो वित्तीय ज्ञान और जोखिम सिद्धांतों के आधार पर अनुकूलित स्टेट फीचर्स (state features) और रिवॉर्ड शेपिंग (reward shaping) नियमों को डिजाइन करने के लिए लार्ज लैंग्वेज मॉडल्स का उपयोग करके PPO-आधारित वित्तीय सुदृढीकरण शिक्षण (reinforcement learning) को उन्नत करता है, जिससे परीक्षण के दौरान LLM हस्तक्षेप की आवश्यकता के बिना आउट-ऑफ-सैंपल जोखिम-समायोजित पोर्टफोलियो प्रदर्शन में सुधार होता है।

मूल लेखक: Yanyan Wu, Boyi Zhang, Yanlin Liu, Xinyu Fang, Jining Luan, Meiqi Zhang, Jiacheng Liu, Hao Zeng, Dexu Yu, Chang Liu, Hanwen Du, Yongxin Ni, Youhua Li

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanyan Wu, Boyi Zhang, Yanlin Liu, Xinyu Fang, Jining Luan, Meiqi Zhang, Jiacheng Liu, Hao Zeng, Dexu Yu, Chang Liu, Hanwen Du, Yongxin Ni, Youhua Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को स्टॉक पोर्टफोलियो प्रबंधित करना सिखा रहे हैं। रीइन्फोर्समेंट लर्निंग (RL) की दुनिया में, रोबोट अनुभव और त्रुटियों (trial and error) के माध्यम से सीखता है: वह एक चाल चलता है, उसका परिणाम देखता है, और अपनी रणनीति को बदलता है।

समस्या यह है कि वित्त की इस अराजक दुनिया में, आप रोबोट को जो "निर्देश" देते हैं, वे अक्सर बहुत अस्पष्ट या भ्रमित करने वाले होते हैं।

  • द स्टेट (द व्यू - अवस्था/दृष्टि): आमतौर पर, रोबोट केवल कच्चे मूल्य चार्ट (Open, High, Low, Close, Volume) देखता है। यह एक शतरंज खिलाड़ी को केवल मोहरों की स्थिति दिखाने जैसा है, लेकिन उन्हें खेल के नियमों या चालों के पीछे की रणनीति के बारे में नहीं बताने जैसा। रोबोट को "मोमेंटम" (momentum) या "जोखिम" (risk) जैसी जटिल अवधारणाओं को खुद ही समझना होगा, जबकि वह जीतने की कोशिश कर रहा है।
  • द रिवॉर्ड (द स्कोर - पुरस्कार/स्कोर): आमतौर पर, रोबोट को इस आधार पर स्कोर मिलता है कि उसने आज कितना पैसा कमाया। लेकिन आज पैसा कमाने का मतलब यह हो सकता है कि उसने इतना बड़ा जोखिम लिया हो जो कल उसके पोर्टफोलियो को दिवालिया कर दे। यह एक छात्र को परीक्षा में नकल करने के लिए "A" ग्रेड देने जैसा है; तत्काल पुरस्कार उच्च है, लेकिन दीर्घकालिक सबक बहुत बुरा है।

पेश है, GIFT।

इस शोध पत्र के लेखक GIFT (गाइडेड इंटरफेस डिजाइन फॉर फाइनेंशियल ट्रेडिंग) नामक एक नई प्रणाली प्रस्तावित करते हैं। GIFT को एक रोबोट ट्रेडर के रूप में न देखें, बल्कि एक अत्यधिक जानकार वित्तीय कोच के रूप में देखें जो एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल, या LLM) का उपयोग करके रोबोट की निर्देश पुस्तिका को फिर से लिखता है।

GIFT कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. कोच खेल नहीं खेलता

GIFT का सबसे महत्वपूर्ण नियम यह है कि AI वास्तविक ट्रेड कभी नहीं करता। यह यह नहीं कहता, "एप्पल खरीदो, टेस्ला बेचो।" इसके बजाय, यह सीखने के वातावरण का डिजाइनर के रूप में कार्य करता है। यह पूछता है: "हमें रोबोट को डेटा कैसे दिखाना चाहिए? हमें उसे किस तरह का स्कोर देना चाहिए ताकि वह सुरक्षित और समझदार बनना सीख सके?"

2. तीन उपकरण जिनका कोच उपयोग करता है

GIFT रोबोट के सीखने के अनुभव को अपग्रेड करने के लिए तीन विशिष्ट उपकरणों का उपयोग करता है:

  • FSE (फैक्टर-गाइडेड स्टेट एनहांसमेंट): "हाइलाइट रील"
    कच्चे, अव्यवस्थित मूल्य डेटा दिखाने के बजाय, AI कोच एक "हाइलाइट रील" बनाता है। यह कच्चे नंबरों को लेता है और उनमें विशेष "वित्तीय लेंस" (जैसे मोमेंटम, अस्थिरता, या लिक्विडिटी) जोड़ता है।

    • उदाहरण: कल्पना कीजिए कि आप एक ड्राइवर को सिखा रहे हैं। केवल सड़क दिखाने के बजाय, आप उसे एक डैशबोर्ड देते हैं जो "फिसलन भरे स्थानों," "आने वाले घुमावों," और "ट्रैफिक घनत्व" को हाइलाइट करता है। अब रोबोट बाजार की संरचना को बहुत बेहतर तरीके से "देख" सकता है।
  • RRS (रिस्क-रूल-गाइडेड रिवॉर्ड शेपिंग): "निष्पक्ष स्कोरिंग प्रणाली"
    AI कोच स्कोरिंग सिस्टम को फिर से लिखता है। केवल "आज कमाए गए पैसे" को पुरस्कृत करने के बजाय, यह बुरे व्यवहार (जैसे बहुत अधिक जोखिम लेना या बार-बार स्टॉक बदलना) के लिए दंड और अच्छे व्यवहार (जैसे एक विविध पोर्टफोलियो बनाए रखना) के लिए बोनस जोड़ता है।

    • उदाहरण: एक वीडियो गेम में, यदि आपको केवल दुश्मनों को मारने के लिए अंक मिलते हैं, तो आप हेल्थ बार को अनदेखा कर सकते हैं और मर सकते हैं। कोच नियमों को इस तरह बदलता है कि आपको केवल अल्पकालिक हत्याओं के लिए नहीं, बल्कि जीवित रहने और समझदारी से खेलने के लिए अंक मिलते हैं।
  • DGR (डायग्नोस्टिक-गाइडेड रिफाइनमेंट): "अभ्यास सत्र समीक्षा"
    कोच केवल अनुमान नहीं लगाता कि सबसे अच्छे नियम क्या हैं। वह रोबोट के साथ एक अभ्यास सत्र (सिमुलेशन) चलाता है। फिर, वह रोबोट के प्रदर्शन को देखता है। क्या रोबोट भ्रमित हुआ? क्या उसने बहुत अधिक जोखिम लिया? इस "डायग्नोस्टिक रिपोर्ट" के आधार पर, कोच निर्देश पुस्तिका में बदलाव करता है और फिर से प्रयास करता है।

    • उदाहरण: यह एक स्पोर्ट्स कोच की तरह है जो गेम टेप देख रहा है, यह देख रहा है कि खिलाड़ी बार-बार बाएं हाथ के शॉट मिस कर रहा है, और वास्तविक खेल शुरू होने से पहले उस कमजोरी को ठीक करने के लिए विशेष प्रशिक्षण ड्रिल को समायोजित कर रहा है।

3. "फ्रीज" (Freeze) नियम

एक बार जब कोच ने वास्तविक दुनिया के परीक्षण के माध्यम से एक आदर्श निर्देश पुस्तिका और स्कोरिंग सिस्टम तैयार कर लिया होता है, तो वह उन्हें फ्रीज (स्थिर) कर देता है।

  • जब रोबोट "वास्तविक दुनिया" (वास्तविक बाजार परीक्षण) में जाता है, तो कोच हट जाता है। कोई और AI क्वेरी नहीं, कोई नियम परिवर्तन नहीं। रोबोट कोच द्वारा डिजाइन किए गए निश्चित, अनुकूलित नियमों का उपयोग करके खेल खेलता है। यह सुनिश्चित करता है कि रोबोट खेल के बीच में अपने नियम बदलकर भविष्य की जानकारी का उपयोग करके धोखाधड़ी न करे।

उन्होंने क्या पाया?

शोधकर्ताओं ने वास्तविक स्टॉक डेटा का उपयोग करके विभिन्न बाजार स्थितियों (बुल मार्केट, बेयर मार्केट और अराजक समय) में इस प्रणाली का परीक्षण किया।

  • परिणाम: GIFT-डिजाइन किए गए निर्देशों के साथ प्रशिक्षित रोबोटों ने मानक, कच्चे निर्देशों वाले रोबोटों की तुलना में काफी बेहतर प्रदर्शन किया।
  • मुख्य जीत: उन्होंने केवल अधिक पैसा नहीं बनाया; उन्होंने पैसा अधिक सुरक्षित रूप से बनाया। उन्होंने खराब बाजार क्रैश के दौरान कम पैसा खोया (लोअर ड्रॉडाउन) और जोखिम एवं इनाम के बीच बेहतर संतुलन बनाए रखा।
  • यह क्यों सफल रहा: "फ्री-फॉर्म" AI (एक ऐसा AI जो बिना वित्तीय मार्गदर्शन के केवल नियमों का अनुमान लगाता है) विफल रहा। लेकिन "गाइडेड" AI (GIFT), जिसे वास्तविक वित्तीय सिद्धांतों का पालन करने के लिए मजबूर किया गया था, सफल रहा।

निष्कर्ष

GIFT यह सिद्ध करता है कि आपको AI को ट्रेडर बनाने की आवश्यकता नहीं है। इसके बजाय, आप एक पारंपरिक ट्रेडिंग रोबोट के लिए एक बेहतर सीखने का वातावरण बनाने के लिए एक AI का उपयोग एक मास्टर आर्किटेक्ट के रूप में कर सकते हैं। रोबोट को बेहतर "आंखें" (State) और एक स्मार्ट "स्कोरकार्ड" (Reward) देकर, रोबोट वित्तीय बाजारों में बहुत अधिक प्रभावी ढंग से नेविगेट करना सीखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →