← नवीनतम पेपर
💰 quantitative finance

Reinforcement Learning for Execution under Dynamic Fees in a Closed-Loop DEX Simulator

यह शोध पत्र एक क्लोज्ड-लूप DEX सिम्युलेटर पेश करता है यह प्रदर्शित करने के लिए कि एक छोटा डीप क्यू-नेटवर्क (DQN) एजेंट विशेष रूप से डायनेमिक-फी वातावरण में ट्यून्ड बेंचमार्क की तुलना में इम्प्लीमेंटेशन शॉर्टफॉल को महत्वपूर्ण रूप से कम करता है, जो ऑटोमेटेड मार्केट मेकर्स में निष्पादन नियंत्रण (एग्जीक्यूशन कंट्रोल) के लिए मॉडल-कंडीशन्ड काउंटरफैक्चुअल साक्ष्य प्रदान करता है।

मूल लेखक: Wen-Ting Wang

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wen-Ting Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यापारी हैं जो एक विकेंद्रीकृत एक्सचेंज (DEX) पर डिजिटल कुकीज़ का एक बड़ा ढेर बेचने की कोशिश कर रहे हैं। पुराने दिनों में, आपकी कुकीज़ बेचने के लिए "फीस" एक स्थिर दर थी, जैसे कैंडी बार पर एक निश्चित कीमत। लेकिन हाल ही में, इन एक्सचेंजों ने डायनेमिक फीस (गतिशील शुल्क) का उपयोग करना शुरू कर दिया है। इसे एक टैक्सी के लिए 'सर्ज-प्राइसिंग एल्गोरिदम' की तरह समझें: यदि सड़क पर भीड़ बढ़ जाती है या मौसम खराब हो जाता है, तो सवारी की कीमत तुरंत बढ़ जाती है।

बड़ा सवाल जो शोधकर्ताओं ने हल करना चाहा था, वह यह था: क्या एक स्मार्ट कंप्यूटर एजेंट, एक साधारण नियम का पालन करने वाले इंसान की तुलना में बदलते हुए शुल्कों के बीच बेहतर तरीके से रास्ता बना सकता है?

समस्या: मशीन में छिपा "भूत" (The Ghost in the Machine)

आमतौर पर, वैज्ञानिक पुराने रिकॉर्ड (ऐतिहासिक डेटा) को देखकर ट्रेडिंग का अध्ययन करते हैं। लेकिन इसमें एक पेंच है: अतीत में, फीस बहुत अधिक नहीं बदलती थी, और हमें यह ठीक से नहीं पता कि व्यापारियों ने वे चुनाव क्यों किए। यह शतरंज खेलने के तरीके को उस फिल्म को देखकर सीखने जैसा है जहाँ मोहरे कभी हिलते ही नहीं। आप यह नहीं सीख सकते कि आपके कदमों पर गेम कैसे प्रतिक्रिया देता है, यदि गेम वास्तव में आपके कार्यों के आधार पर अपना मन नहीं बदलता।

इसे ठीक करने के लिए, लेखकों ने एक वीडियो गेम सिम्युलेटर बनाया। यह एक "क्लोज्ड-लूप" दुनिया है जहाँ:

  1. आप (एजेंट) अपनी कुकीज़ बेचने की कोशिश करते हैं।
  2. मार्केट आपकी बिक्री पर प्रतिक्रिया देता है, जिससे कीमत और फीस बदल जाती है।
  3. अन्य खिलाड़ी (नॉइज़ ट्रेडर्स और आर्बिट्राजर्स) भी बाजार के साथ चलते हैं, बाजार की प्रतिक्रिया देते हैं।

महत्वपूर्ण बात यह है कि इस खेल में, फीस का नियम "स्मार्ट" होने के लिए डिज़ाइन किया गया है। यह बाजार की स्थिति के आधार पर बदलता है, ठीक वैसे ही जैसे वास्तविक डायनेमिक फीस सिस्टम करता है। इससे कंप्यूटर एजेंट वास्तव में यह सीख सकता है कि बाजार कैसे पलटवार करता है।

प्रतियोगिता: रणनीतियों की सीढ़ी (The Ladder of Strategies)

लेखकों ने केवल एक रैंडम गेसर (तुक्केबाज) के खिलाफ AI को नहीं लड़ाया। उन्होंने विरोधियों की एक "सीढ़ी" बनाई, जिसमें हर अगला विरोधी पिछले से अधिक स्मार्ट था:

  • द शेड्यूल (The Schedule): बस एक स्थिर गति से कुकीज़ बेचना, जैसे एक रोबोट टाइमर का पालन कर रहा हो।
  • वन-स्टेप लुकअहेड (The One-Step Lookahead): एक स्मार्ट इंसान जो अगले सेकंड को देखता है, सबसे अच्छा कदम निकालता है, और फिर सोचना बंद कर देता है।
  • द प्लानर्स (The Planners): ऐसे एजेंट जो कुछ कदम आगे का सिमुलेशन करने की कोशिश करते हैं ताकि देखा जा सके कि क्या होता है।
  • डीक्यूएन (DQN - Deep Q-Network): कहानी का "नायक"। यह एक छोटा, मॉडल-फ्री AI है जो अनुभव और त्रुटि (trial and error) से सीखता है, ताकि वह ब्रह्मांड के नियमों को जाने बिना दीर्घकालिक सर्वोत्तम रणनीति का पता लगा सके।

बड़ा खुलासा

लेखकों ने विभिन्न रैंडम मार्केट परिदृश्यों (सीड्स) के साथ सिमुलेशन को 1,000 बार चलाया ताकि देखा जा सके कि कौन जीता।

परिणाम: छोटे DQN AI ने स्मार्ट "वन-स्टेप लुकअहेड" इंसान को हरा दिया

  • कितना बेहतर? इसने ट्रेड की लागत पर लगभग 13.3 बेसिस पॉइंट्स (एक प्रतिशत का बहुत छोटा हिस्सा, लेकिन ट्रेडिंग में यह बहुत बड़ा है) बचाए।
  • यह जीत कहाँ से आई? AI ने अपनी ट्रेड को सही समय पर करने की कला सीखी ताकि वह "कम फीस" वाले दौर का फायदा उठा सके। इसने बाजार के शांत होने और फीस गिरने का इंतजार किया और फिर बेचा।
  • कैच (सावधानी): यह लाभ केवल डायनेमिक-फीस वातावरण में ही मौजूद था। जब शोधकर्ताओं ने डायनेमिक फीस को बंद कर दिया और उन्हें स्थिर (फ्लैट) बना दिया, तो AI और सरल मानव दोनों का प्रदर्शन बिल्कुल एक जैसा रहा। AI केवल भाग्यशाली नहीं था; इसने विशेष रूप से बदलते हुए शुल्कों का फायदा उठाना सीखा था।

AI ने क्या किया (और क्या नहीं किया)

AI कोई जादू की छड़ी नहीं बना। इसने भविष्य की भविष्यवाणी नहीं की, और न ही इसने एक "परफेक्ट" समाधान खोजा।

  • यह "प्लानर्स" को स्पष्ट रूप से नहीं हरा सका: आश्चर्यजनक रूप से, वे एजेंट जिन्होंने 2 या 3 कदम आगे की योजना बनाई थी, वे साधारण एक-कदम वाले इंसान से न तो काफी बेहतर प्रदर्शन कर पाए और न ही खराब। बाजार बहुत शोर भरा (noisy) था, इसलिए वे स्पष्ट रूप से देख नहीं पाए, और अंततः वे बेसलाइन के साथ सांख्यिकीय रूप से बराबरी पर रहे। केवल DQN ही एकमात्र ऐसा लर्नर था जिसने सांख्यिकीय निश्चितता के साथ बेसलाइन को हराया।
  • यह शून्य में काम नहीं करता: यदि AI को बाजार के हिलने से पहले कार्य करने के लिए प्रशिक्षित किया गया था, तो इसने बहुत अच्छा किया। लेकिन यदि शोधकर्ताओं ने इसे बाजार के हिलने के बाद कार्य करने के लिए मजबूर किया (एक अलग "ऑर्डरिंग"), तो इसके प्रदर्शन में गिरावट आई। हालांकि, यदि उन्होंने उस विशिष्ट नए नियम के लिए AI को पुनः प्रशिक्षित (retrain) किया, तो यह वापस आया और फिर से जीत गया। यह साबित करता है कि AI खेल की विशिष्ट लय को सीख रहा था, न कि केवल कोई ट्रिक याद कर रहा था।

यह पेपर क्या नहीं कह रहा है

यह जानना बहुत महत्वपूर्ण है कि यह पेपर किन चीजों को खारिज करता है:

  • यह कोई इतिहास का पाठ नहीं है: परिणाम पूरी तरह से सिमुलेशन पर आधारित हैं। लेखक स्पष्ट रूप से कहते हैं कि यह इस बारे में कोई प्रमाण नहीं है कि अतीत में वास्तविक ट्रेडर्स ने कैसा व्यवहार किया था।
  • यह कोई मुनाफे की गारंटी नहीं है: पेपर यह दावा नहीं करता कि इस AI को वास्तविक एक्सचेंज पर तैनात करने से आप अमीर हो जाएंगे। यह नियंत्रण के बारे में एक 'प्रूफ ऑफ कॉन्सेप्ट' है, न कि कोई बिजनेस प्लान।
  • यह कोई "हल की गई" समस्या नहीं है: AI ने पूर्णतः "परफेक्ट" रणनीति (हindsight perfect strategy) नहीं खोजी (वह रणनीति अभी भी AI से बेहतर थी)। AI ने बस एक ऐसा तरीका खोजा जिससे वह आज के मानक स्मार्ट नियमों से बेहतर प्रदर्शन कर सके।

निचोड़ (The Bottom Line)

इस विशिष्ट, सिम्युलेटेड दुनिया में, एक छोटा, सीखने वाला AI, एक स्मार्ट इंसान (जो एक सरल नियम का पालन कर रहा है) की तुलना में डायनेमिक फीस के साथ बेहतर तालमेल बिठा सकता है। इसने कम फीस वाले सही क्षण का इंतजार करना सीखा, जिससे ट्रेड पर लगभग 13.3 बेसिस पॉइंट्स की बचत हुई। लेकिन यह कौशल उन बाजारों के लिए विशिष्ट है जहाँ फीस बदलती है; यदि फीस स्थिर है, तो AI साधारण नियमों जितना ही सामान्य है।

यह पेपर सुझाव देता है कि विकेंद्रीकृत वित्त (DeFi) की जटिल और बदलती दुनिया में, अनुकूलन (adapt) करना सीखना ही फीस से आगे रहने का एकमात्र तरीका हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →