← नवीनतम पेपर
💰 quantitative finance

Can Reinforcement Learning Efficiently Discover Price Manipulation?

यह शोध पत्र प्रदर्शित करता है कि एक मॉडल-फ्री डीप डिटरमिनिस्टिक पॉलिसी ग्रेडिएंट सुदृढीकरण लर्निंग एजेंट, मध्यम बाजार अस्थिरता के तहत, लाभप्रद मूल्य हेरफेर रणनीतियों को खोजने में एक सही ढंग से निर्दिष्ट लेकिन पैरामीटर-अनुमानित मॉडल-आधारित दृष्टिकोण से बेहतर प्रदर्शन कर सकता है, जो जटिल नियंत्रण समस्याओं में आरएल (RL) की प्रभावकारिता और सुरक्षा उपायों के बिना वित्तीय बाजारों में ऐसे एल्गोरिदम को तैनात करने के जोखिमों, दोनों को रेखांकित करता है।

मूल लेखक: Ioanna-Yvonni Tsaknaki, Andrea Macrì, Fabrizio Lillo

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ioanna-Yvonni Tsaknaki, Andrea Macrì, Fabrizio Lillo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक वित्तीय बाजार की कल्पना एक विशाल, शोर भरे डांस फ्लोर के रूप में करें जहाँ कीमतें इस आधार पर ऊपर-नीचे होती हैं कि कितने लोग खरीद या बेच रहे हैं। आमतौर पर, यदि आप बहुत अधिक खरीदते हैं तो कीमत थोड़ी बढ़ जाती है; यदि आप बेचते हैं, तो यह नीचे गिर जाती है। लेकिन इस शोध पत्र में, लेखक इस डांस फ्लोर के एक विशिष्ट, थोड़े "ऊबड़-खाबड़" (bumpy) संस्करण को देखते हैं जहाँ नियम थोड़े अजीब हैं: आप जितना अधिक धक्का देते हैं, फर्श उतना ही गैर-सीधे तरीके से मुड़ता है (इसे नॉन-लीनियर इम्पैक्ट कहा जाता है)।

मुख्य सवाल जो लेखक पूछते हैं: क्या एक कंप्यूटर प्रोग्राम, जो 'रीइन्फोर्समेंट लर्निंग' (RL) नामक आर्टिफिशियल इंटेलिजेंस का एक प्रकार है, इन अजीब मोड़ों का फायदा उठाकर मुफ्त पैसा बनाने का तरीका खोज सकता है, भले ही उसे इस नृत्य के नियमों का पता न हो?

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

सेटअप: द "राउंड-ट्रिप" गेम

शोधकर्ताओं ने एक खेल बनाया जहाँ एक ट्रेडर को खेल के दौरान शून्य वस्तुओं के साथ शुरू करना होता है, कुछ चीजें खरीदनी और बेचनी होती हैं, और खेल के अंत में फिर से शून्य वस्तुओं के साथ समाप्त करना होता है। इसे "राउंड-ट्रिप" कहा जाता है।

  • लक्ष्य: केवल व्यापार करने के कार्य से लाभ कमाना, न कि इस बात का अनुमान लगाकर कि बाजार कुल मिलाकर किस दिशा में जाएगा।
  • चाल (The Trick): क्योंकि बाजार के नियम "ऊबड़-खाबड़" (non-linear) हैं, इसलिए इसमें एक सैद्धांतिक खामी (loophole) है। यदि आप शुरुआत में कीमतों को ऊपर धकेलने के लिए आक्रामक रूप से खरीदते हैं, और फिर बाद में बेचते हैं जब कीमत अधिक हो, तो आप केवल इस बात के कारण अधिक पैसा कमा सकते हैं कि बाजार ने आपकी क्रियाओं पर कैसे प्रतिक्रिया दी। इसे प्राइस मैनिपुलेशन (मूल्य हेरफेर) या डायनेमिक आर्बिट्राज कहा जाता है।

दो प्रतियोगी

लेखकों ने यह देखने के लिए दो अलग-अलग "खिलाड़ियों" को एक-दूसरे के विरुद्ध खड़ा किया कि कौन इस पैसा बनाने वाली चाल को बेहतर तरीके से खोज सकता है:

  1. "मॉडल-बेस्ड" खिलाड़ी (द कैलकुलेटर):

    • यह कैसे काम करता है: इस खिलाड़ी को बाजार के सटीक नियम (कीमतों के उतार-चढ़ाव के पीछे का गणित) दिए जाते हैं। हालांकि, इसे विशिष्ट संख्याएं (पैरामीटर्स) पूरी तरह से पता नहीं होतीं। इसे पिछले डेटा को देखकर उन संख्याओं का अनुमान लगाना होता है, जैसे कि कुछ धुंधली तस्वीरों को देखकर मछली के वजन का अनुमान लगाना।
    • कमजोरी: यदि तस्वीरें धुंधली (शोर वाला डेटा) हैं या पर्याप्त नहीं हैं, तो खिलाड़ी गलत संख्या का अनुमान लगा लेता है। यदि गणित गलत है, तो रणनीति विफल हो जाती है।
  2. "रीइन्फोर्समेंट लर्निंग" खिलाड़ी (द ट्रायल-एंड-एरर लर्नर):

    • यह कैसे काम करता है: इस खिलाड़ी को (DDPG नामक एल्गोरिदम का उपयोग करते हुए) कोई नियम पुस्तिका नहीं दी जाती है। यह गणित या पैरामीटर्स को नहीं जानता। यह केवल वर्तमान कीमत, अपनी इन्वेंट्री और समय को देखता है। यह क्रियाएं करता है, और जितना पैसा इसने कमाया उसके आधार पर इसे एक "स्कोर" (रिवॉर्ड) मिलता है, और यह अपनी गलतियों से सीखता है। यह एक बच्चे के चलने सीखने जैसा है: वह गिरता है, उठता है, और अंततः गुरुत्वाकर्षण के भौतिक विज्ञान को सीखे बिना ही संतुलन बनाना सीख जाता है।
    • ताकत: यह सीधे अनुभव से रणनीति सीखता है, जिससे छिपी हुई संख्याओं का अनुमान लगाने वाला चरण बच जाता है।

परिणाम: कौन जीता?

लेखकों ने इन खिलाड़ियों का तीन अलग-अलग "मौसम की स्थितियों" (वोलेटिलिटी स्तरों) के तहत परीक्षण किया:

  • तूफानी मौसम (उच्च अस्थिरता/High Volatility):

    • परिणाम: सभी विफल रहे। बाजार बहुत अराजक था। सटीक गणित भी लाभ नहीं खोज सका और सीखने वाला AI शोर (noise) से भ्रमित हो गया। कोई भी पैसा नहीं खोज सका।
  • शांत मौसम (कम अस्थिरता/Low Volatility):

    • परिणाम: कैलकुलेटर जीत गया। क्योंकि बाजार बहुत शांत था, कैलकुलेटर डेटा से छिपी हुई संख्याओं का बहुत सटीक अनुमान लगा सका। चूंकि इसके पास "परफेक्ट" गणित और सटीक संख्याएं थीं, इसलिए इसने AI को हरा दिया।
  • हवादार मौसम (मध्यवर्ती अस्थिरता/Intermediate Volatility):

    • परिणाम: AI (RL) जीत गया! यह सबसे आश्चर्यजनक खोज थी।
    • क्यों? इस "हवादार" क्षेत्र में, डेटा कैलकुलेटर के लिए संख्याओं का सही अनुमान लगाने के लिए बहुत अधिक अव्यवस्थित था। इसके अनुमान गलत थे, इसलिए इसकी रणनीति विफल हो गई। हालांकि, AI को संख्याओं की परवाह नहीं थी; इसने सीधे अनुभव के माध्यम से सीखा कि क्या काम करता है।
    • ट्विस्ट: यहाँ तक कि जब शोधकर्ताओं ने कैलकुलेटर को अपने अनुमान को ठीक करने के लिए दस गुना अधिक डेटा दिया, तब भी AI का प्रदर्शन बेहतर रहा। AI ने सीधे "डांस मूव्स" सीख लिए, जबकि कैलकुलेटर अपने गणितीय त्रुटियों के कारण लड़खड़ाता रहा।

मुख्य निष्कर्ष

यह शोध पत्र निष्कर्ष निकालता है कि रीइन्फोर्समेंट लर्निंग वित्तीय बाजारों में खामियों (loopholes) को खोजने में आश्चर्यजनक रूप से अच्छा है।

  • अच्छी खबर: यह दिखाता है कि AI जटिल नियंत्रण समस्याओं (control problems) को बहुत कुशलता से हल कर सकता है।
  • बुरी खबर: यह एक जोखिम भी दिखाता है। यदि नियामक या बाजार डिजाइनर अनजाने में ऐसे सिस्टम बनाते हैं जो इन "पैसा बनाने वाले लूप्स" (हेरफेर) को जन्म देते हैं, तो एक स्मार्ट AI उन्हें स्वचालित रूप से खोज सकता है और उनका फायदा उठा सकता है, भले ही सिस्टम बनाने वाले मनुष्यों को उस खामी का पता न चला हो।

संक्षेप में, यदि आप एक ऐसा खेल बनाते हैं जिसमें एक छिपा हुआ 'चीट कोड' है, तो एक मानव गणितज्ञ उसे मिस कर सकता है यदि डेटा अव्यवस्थित है, लेकिन एक सीखने वाला AI इसे केवल खेल को बार-बार खेलकर आसानी से खोज लेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →