← नवीनतम पेपर
💰 quantitative finance

TT-DAC-PS: Twin-Target Deterministic Actor-Critic with Policy Smoothing for Optimal Trade Execution

यह शोध पत्र TT-DAC-PS प्रस्तुत करता है, जो एक नवीन नियत (deterministic) एक्टर-क्रिटिक एल्गोरिदम है जिसे पॉलिसी स्मूथिंग और कंजर्वेटिव Q-लर्निंग तकनीकों के साथ उन्नत किया गया है, जो वास्तविक लिमिट ऑर्डर बुक डेटा का उपयोग करके बड़े स्टॉक सेल प्रोग्रामों के लिए इम्प्लीमेंटेशन शॉर्टफॉल को कम करने में शास्त्रीय निष्पादन रणनीतियों और मानक सुदृढीकरण शिक्षण (reinforcement learning) बेसलाइनों दोनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Ilia Zaznov, Atta Badii, Julian Kunkel, Alfonso Dufour

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ilia Zaznov, Atta Badii, Julian Kunkel, Alfonso Dufour

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: जल्दबाजी में घर बेचना

कल्पना कीजिए कि आपके पास एक बहुत बड़ी हवेली (स्टॉक शेयरों की एक विशाल संख्या) है और आपको आज ही इसे पूरा बेचना है। आपके पास दो बड़ी समस्याएँ हैं:

  1. यदि आप बहुत तेज़ी से बेचते हैं: तो आप बाज़ार में बाढ़ ला देते हैं। खरीदार घबरा जाते हैं, कीमतें गिर जाती हैं, और अंत में आप अपनी हवेली कौड़ियों के दाम पर बेच देते हैं। इसे मार्केट इम्पैक्ट (Market Impact) कहा जाता है।
  2. यदि आप बहुत धीरे बेचते हैं: तो आप बेहतर कीमत की उम्मीद में इंतज़ार करते रहते हैं, लेकिन बाज़ार अचानक गिर सकता है, या जब तक आप लिस्टिंग कर रहे होते हैं तब तक हवेली का मूल्य कम हो सकता है। इसे टाइमिंग रिस्क (Timing Risk) कहा जाता है।

इस पेपर का लक्ष्य एक आदर्श "गोल्डिलॉक्स" (Goldilocks) गति खोजना है: न बहुत तेज़, न बहुत धीमा, बल्कि सबसे अधिक पैसा पाने के लिए बिल्कुल सही। लेखक इसे ऑप्टिमल ट्रेड एग्जीक्यूशन (Optimal Trade Execution) कहते हैं।

पुराने तरीके बनाम नया तरीका

इस पेपर से पहले, लोग बेचने के तीन मुख्य तरीकों का उपयोग करते थे:

  • TWAP (Time-Weighted): जैसे बिना सोचे-समझे हर घंटे हवेली के टुकड़े बेचना। यह सरल है लेकिन अगर बाज़ार पागल हो जाए तो यह मूर्खतापूर्ण है।
  • VWAP (Volume-Weighted): जब बाज़ार व्यस्त हो तब ज़्यादा बेचना और जब शांत हो तब कम। यह बेहतर है, लेकिन फिर भी एक कठोर स्क्रिप्ट का पालन करता है।
  • Almgren–Chriss (AC): एक फैंसी गणितीय सूत्र जो गति और सुरक्षा के बीच संतुलन बनाने की कोशिश करता है। यह स्मार्ट है, लेकिन अगर बाज़ार अजीब व्यवहार करता है (जो अक्सर करता है) तो यह टूट जाता है।

समस्या: वास्तविक बाज़ार अस्त-व्यस्त होते हैं। वे लगातार अपना मन बदलते रहते हैं। एक कठोर स्क्रिप्ट (जैसे TWAL) या एक स्थिर गणितीय सूत्र (जैसे AC) तब अनुकूलित नहीं हो सकता जब बाज़ार अस्थिर हो जाता है या लिक्विडिटी (तरलता) खत्म हो जाती है।

समाधान: TT-DAC-PS (स्मार्ट, अनुकूलन योग्य रोबोट)

लेखकों ने एक नया AI रोबोट बनाया जिसे TT-DAC-PS कहा जाता है। इसे एक सुपर-स्मार्ट, सतर्क ट्रेडर के रूप में समझें जो करके सीखता है। यह कैसे काम करता है, इसके विशेष फीचर्स यहाँ दिए गए हैं:

1. "ट्विन-टारगेट" सुरक्षा जाल (जुड़वां जज)

AI में, कभी-कभी रोबोट बहुत अधिक आत्मविश्वासी हो जाता है। वह सोचता है, "मैं दस लाख डॉलर कमाने वाला हूँ!" जबकि वास्तव में वह पैसा खोने वाला होता है। इसे ओवरएस्टिमेशन (Overestimation) कहा जाता है।

  • समाधान: लेखकों ने रोबोट को एक के बजाय दो जज (Twin Critics) दिए।
  • उपमा: कल्पना कीजिए कि आप घोड़े की दौड़ पर दांव लगा रहे हैं। एक दोस्त से भविष्यवाणी पूछने के बजाय, आप दो लोगों से पूछते हैं। यदि वे असहमत हैं, तो रोबोट निराशावादी (सबसे खराब स्थिति) अनुमान लेता है। यह मान लेता है कि परिणाम उम्मीद से बदतर होगा।
  • यह कैसे मदद करता है: यह रोबोट को विनम्र रखता है और झूठी उम्मीदों के आधार पर जोखिम भरे दांव लगाने से रोकता है। यह सीखने की प्रक्रिया को स्थिर करता है।

2. "पॉलिसी स्मूथिंग" (सतर्क ड्राइवर)

कभी-कभी, एक रोबोट एक ऐसी रणनीति सीख लेता है जो ट्रेनिंग जिम में तो एकदम सही काम करती है लेकिन वास्तविक दुनिया में विफल हो जाती है क्योंकि वह बहुत कठोर होती है।

  • समाधान: रोबोट को अपने कदमों में छोटे, यादृच्छिक (random) समायोजन करने के लिए सिखाया जाता है, जैसे कि एक ड्राइवर केंद्र में रहने के लिए स्टीयरिंग व्हील को थोड़ा हिलाता है।
  • उपमा: यदि आप कार चला रहे हैं और केवल एक पूरी तरह से सीधी, खाली सड़क पर अभ्यास करते हैं, तो गड्ढा आने पर आप दुर्घटनाग्रस्त हो सकते हैं। थोड़े उतार-चढ़ाव (noise) के साथ अभ्यास करके, रोबोट bumps और टर्न को सुचारू रूप से संभालना सीखता है। इसे पॉलिसी स्मूथिंग (Policy Smoothing) कहा जाता है।

3. "हाइब्रिड" एक्सप्लोरेशन (स्मार्ट खोजकर्ता)

रोबोट को सीखने के लिए नई चीजें आज़माने की ज़रूरत होती है, लेकिन बहुत अधिक आज़माना खतरनाक है (वह बहुत तेज़ी से बेचकर कीमत गिरा सकता है)।

  • समाधान: रोबोट एक विशेष "नॉइज़" जनरेटर (Ornstein–Uhlenbeck noise) का उपयोग करता है जो एक स्मार्ट थर्मोस्टेट की तरह काम करता है।
    • डिटरमिनिस्टिक डिके (Deterministic Decay): जैसे-जैसे रोबोट अपने काम में बेहतर होता जाता है, वह स्वाभाविक रूप से कम "नॉइज़ी" और अधिक केंद्रित होता जाता है।
    • वैरिएंस-अवेयर (Variance-Aware): यदि रोबोट देखता है कि उसके हालिया प्रयास बहुत अनिश्चित (high variance) रहे हैं, तो वह अपनी बुरी आदत से बाहर निकलने के लिए नॉइज़ को स्वतः बढ़ा देता है। यदि चीजें बहुत अराजक हैं, तो वह चीज़ों को शांत करने के लिए नॉइज़ को कम कर देता है।
  • उपमा: एक छात्र की कल्पना करें जो परीक्षा के लिए पढ़ाई कर रहा है। यदि वह किसी समस्या में फंसा हुआ है, तो वह एक बिल्कुल नया दृष्टिकोण आज़मा सकता है (उच्च शोर/noise)। यदि वह सही कर रहा है, तो वह सिद्ध तरीके पर टिका रहता है (कम शोर/noise)। यह रोबट अपनी सफलता के आधार पर अपनी "जिज्ञासा" को समायोजित करता है।

4. "सेफ्टी बेल्ट" (सीमाएं/Constraints)

रोबोट को कुछ भी अवैध या असंभव करने से सख्ती से रोका गया है।

  • नियम: वह अपने पास मौजूद शेयरों से अधिक शेयर नहीं बेच सकता और वह एक सेकंड में कुल ऑर्डर का 1% से अधिक नहीं बेच सकता।
  • उपमा: यह एक ऐसे ड्राइवर की तरह है जिसके पास सीटबेल्ट और स्पीड गवर्नर है। चाहे रोबोट कितनी भी तेज़ी से भागना चाहे, कार भौतिक रूप से उसे ऐसा करने नहीं देगी। यह सुनिश्चित करता है कि रोबोट नियमों को तोड़ने वाली कोई गलती न करे।

उन्होंने इसका परीक्षण कैसे किया

लेखकों ने इस रोबोट का परीक्षण 10 अलग-अलग अमेरिकी शेयरों (जैसे Intel, Apple, आदि) पर किया। उन्होंने इसकी तुलना इनके साथ की:

  • पुराने गणितीय सूत्रों (AC, TWAP, VWAP) के साथ।
  • अन्य प्रसिद्ध AI रोबोट्स (PPO, SAC, A2C) के साथ।

परिणाम:

  • TT-DAC-PS रोबोट ने लगातार अन्य सभी की तुलना में कम पैसा खोया (कम "इम्प्लीमेंटेशन शॉर्टफॉल")।
  • यह विशेष रूप से कठिन, अस्थिर शेयरों को संभालने में बहुत अच्छा था जहाँ अन्य रोबोट और पुराने सूत्र बुरी तरह विफल रहे।
  • जब उन्होंने "ट्विन जजेस" या "स्मार्ट थर्मोस्टेट" को हटा दिया (एब्लेशन प्रयोगों में), तो रोबोट खराब प्रदर्शन करने लगा, जिससे साबित हुआ कि ये विशिष्ट फीचर्स ही इसकी असली सफलता का राज थे।

निचोड़ (The Bottom Line)

यह पेपर एक नया AI सिस्टम पेश करता है जो पारंपरिक तरीकों की तुलना में स्टॉक को अधिक कुशलता से बेचता है। यह ऐसा इसलिए कर पाता है क्योंकि यह:

  1. सतर्क है (ओवरकॉन्फिडेंस से बचने के लिए ट्विन जजेस का उपयोग करता है)।
  2. लचीला है (बाज़ार कैसा व्यवहार कर रहा है, इसके आधार पर अपनी जिज्ञासा को समायोजित करता है)।
  3. सुरक्षित है (कभी भी नियमों को नहीं तोड़ता)।

यह एक कठोर, प्री-प्रोग्राम्ड वेंडिंग मशीन को एक मानव-समान ट्रेडर से बदलने जैसा है जो अपने पैरों पर खड़े होकर सोच सकता है, दबाव में शांत रह सकता है, और हमेशा सुरक्षित खेलना जानता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →