← नवीनतम पेपर
💻 computer science

EVOQUANT: Self-Evolving Verifier-Guided Strategy Optimization for Robust Quantitative Trading

EVOQUANT एक स्व-विकसित (self-evolving), सत्यापनकर्ता-निर्देशित (verifier-guided) ढांचा है जो मात्रात्मक ट्रेडिंग रणनीतियों के निदान, संपादन और सत्यापन को स्वचालित करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे उनके प्रदर्शन और मजबूती में महत्वपूर्ण सुधार होता है और मैन्युअल परीक्षण-और-त्रुटि (trial-and-error) प्रक्रियाओं को समाप्त किया जाता है।

मूल लेखक: Jie Mao, Changlun Li, Xiang Li, Qiqi Duan, Jinhui Yuan, Xiang Liu, Yuyu Luo, Jing Tang, Xiaowen Chu, Nan Tang

प्रकाशित 2026-07-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jie Mao, Changlun Li, Xiang Li, Qiqi Duan, Jinhui Yuan, Xiang Liu, Yuyu Luo, Jing Tang, Xiaowen Chu, Nan Tang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत पुराने, बहुत जटिल केक की रेसिपी को ठीक करने की कोशिश कर रहे हैं, जिसका उद्देश्य एक बेकिंग प्रतियोगिता जीतना है। आमतौर पर, एक मानव शेफ को केक चखना पड़ता है, यह अनुमान लगाना पड़ता है कि वह सूखा क्यों है, ओवन का तापमान बदलना पड़ता है, फिर से चखना पड़ता है, और उम्मीद करनी पड़ती है कि उन्होंने गलती से चीनी की जगह नमक न डाल दिया हो। यह धीमा, थकाऊ है, और अक्सर इस बात की ओर ले जाता है कि शेफ बार-बार वही गलती करता रहे।

अब, कल्पना कीजिए कि आपने इस रोबोट शेफ (एक लार्ज लैंग्वेज मॉडल) को मदद के लिए काम पर रखा है। समस्या यह है कि यदि आप रोबोट को सिर्फ यह कह देते हैं, "इस केक को बेहतर बनाओ," तो वह बहुत उत्साहित हो सकता है। वह एक ऐसा नया घटक (ingredient) बना सकता है जिसका अस्तित्व ही नहीं है, या वह रेसिपी को इतना बदल सकता है कि केक एक ईंट में बदल जाए। वह खुद को धोखा भी दे सकता है, जैसे कि केवल एक छोटे, भाग्यशाली टुकड़े पर टेस्ट करके यह दिखाना कि यह एकदम सही है, जबकि वास्तव में यह वास्तविक दुनिया में विफल हो जाएगा।

यह बिल्कुल वही समस्या है जिसे EVOQUANT पेपर हल करने की कोशिश करता है। लेखक सुझाव देते हैं कि रोबोट शेफ को बेकाबू छोड़ने के बजाय, हमें एक सख्त स्वाद-परीक्षक पर्यवेक्षक (एक "वेरिफायर") की आवश्यकता है जो रोबोट द्वारा किए गए हर बदलाव पर नज़र रखे।

जादुई रेसिपी बुक: द "स्ट्रेटजी जीनोम"

सबसे पहले, सिस्टम मूल ट्रेडिंग रणनीति (रेसिपी) को एक विशेष, संरचित "जीनोम" में बदल देता है। इसे एक लेगो (LEGO) निर्देश पुस्तिका की तरह समझें जहाँ हर ईंट लेबल की गई है। आप पूरी चीज़ को बस तोड़ नहीं सकते; आपको विशिष्ट ईंटों को बदलना होगा (जैसे कि एक "खरीद" संकेत या "स्टॉप-लॉस" नियम को बदलना) ताकि इसकी संरचना बरकरार रहे। यह सुनिश्चित करता है कि रोबोट केवल अनुमान नहीं लगा रहा है; वह नियंत्रित, तार्किक संपादन कर रहा है।

जासूस और संपादक

यह सिस्टम एक लूप में काम करता है, जैसे कोई जासूस रहस्य सुलझा रहा हो:

  1. निदान (The Diagnosis): रोबोट एक जासूस की तरह कार्य करता है, "अपराध स्थल" (पिछले प्रदर्शन के डेटा) को देखता है। वह पूछता है, "इस रणनीति ने पैसा क्यों खोया? क्या यह बहुत जोखिम भरा था? क्या इसने बाजार बदलने पर ट्रेडिंग बंद कर दी थी?" वह केवल यह नहीं कहता कि "यह विफल रहा"; वह विशिष्ट विफलता मोड (failure mode) को ढूंढ निकालता है।
  2. नियंत्रित संपादन (The Controlled Edit): उस निदान के आधार पर, रोबट एक सुधार का प्रस्ताव देता है। लेकिन यहाँ एक पेच है: वह कोई भी सुधार प्रस्तावित नहीं कर सकता। उसे एक योजना का पालन करना होगा। यदि समस्या यह है कि रणनीति बाजार के छोटे बदलावों के प्रति बहुत संवेदनशील है, तो रोबोट को रणनीति को अधिक स्थिर बनाने के लिए कहा जाता है, न कि अधिक जटिल नियम जोड़ने के लिए।
  3. सख्त स्वाद-परीक्षक (The Verifier): यह सबसे महत्वपूर्ण हिस्सा है। नई रेसिपी को उपयोग में लेने की अनुमति देने से पहले, इसे उस डेटा पर कड़े "टेस्ट" से गुजरना पड़ता है जिसे रोबोट ने पहले कभी नहीं देखा है (आउट-ऑफ-सैंपल डेटा)।
    • यदि नई रेसिपी केवल ट्रेनिंग डेटा पर काम करती है लेकिन नए डेटा पर विफल हो जाती है, तो वेरिफायर कहता है, "नहीं, यह एक चाल है। अस्वीकार करें।"
    • यदि नई रेसिपी सबसे खराब स्थिति (worst-case scenario) में बहुत अधिक पैसा खो देती है, तो वेरिफायर कहता है, "बहुत जोखिम भरा। अस्वीकार करें।"
    • केवल तभी जब नई रेसिपी यह साबित करती है कि वह वास्तव में बेहतर और सुरक्षित है, उसे "चैंपियन" के स्थान पर पदोन्नत किया जाता है।

परिणाम: "यख" (Yuck) से "यम" (Yum) तक

लेखकों ने इस सिस्टम का परीक्षण सात अलग-अलग ट्रेडिंग रणनीतियों (चार चीनी शेयर बाजार से और तीन बिटकॉइन बाजार से) पर किया। उन्होंने पाया कि इस सिस्टम ने रणनीतियों के प्रदर्शन में महत्वपूर्ण सुधार किया।

रोबोट की मदद से पहले, औसत "स्कोर" (जिसे शार्प रेशियो कहा जाता है, जो यह मापता है कि आप जोखिम के बदले कितना लाभ कमाते हैं) -0.298 था। यह एक हारने वाला खेल है। EVOQUANT सिस्टम के काम करने के बाद, औसत स्कोर उछलकर 0.538 हो गया। यह एक जीतने वाला खेल है। सबसे अच्छी रणनीतियों में से एक अपने मूल स्वरूप की तुलना में 199% सुधरी।

पेपर दिखाता है कि यह केवल किस्मत नहीं है। जब उन्होंने उच्च शुल्क (जैसे कि एक कठिन बेकिंग प्रतियोगिता) या विभिन्न समय अवधियों के साथ इस सिस्टम का परीक्षण किया, तो रणनीतियाँ अभी भी टिकी रहीं, हालांकि लाभ थोड़ा कम था। यह सुझाव देता है कि सुधार वास्तविक हैं और केवल एक इत्तेफाक नहीं हैं।

यह सिस्टम क्या नहीं है

लेखक बहुत स्पष्ट हैं कि यह क्या नहीं है।

  • यह कोई जादू की छड़ी नहीं है जो गारंटी देती है कि आप अमीर हो जाएंगे। पेपर स्पष्ट रूप से कहता है कि यह एक शोध प्रोटोटाइप है, वित्तीय सलाह नहीं।
  • यह ऐसा सिस्टम नहीं है जो बस तब तक यादृच्छिक (random) बदलाव करता रहता है जब तक कि कुछ काम न कर जाए। लेखकों ने सिद्ध किया कि यदि आप "निदान" चरण को हटा देते हैं और केवल रोबोट को यादृच्छिक संपादन करने देते हैं, तो परिणाम बहुत खराब होते हैं। "जासूस" वाला हिस्सा अनिवार्य है।
  • यह एक ऐसा सिस्टम नहीं है जो सभी जोखिमों को समाप्त कर देता है। वास्तव में, कुछ रणनीतियों के लिए, सिस्टम ने उच्च जोखिम (मूल्य में बड़ी गिरावट) स्वीकार किया क्योंकि संभावित लाभ बहुत बेहतर था। लक्ष्य एक बेहतर संतुलन था, न कि जोखिम-मुक्त होना।

निचोड़ (The Bottom Line)

पेपर सुझाव देता है कि हम ट्रेडिंग रणनीतियों को ठीक करने के अव्यवस्थित, मैनुअल काम को एक स्वच्छ, स्वचालित लूप में बदल सकते हैं। एक रोबोट का उपयोग बदलाव प्रस्तावित करने के लिए और एक सख्त पर्यवेक्षक का उपयोग उन्हें सत्यापित करने के लिए करके, हम ऐसी रणनीतियों को विकसित कर सकते हैं जो स्मार्ट और अधिक मजबूत हों। लेखकों ने ऐतिहासिक डेटा पर सिमुलेशन और बैकटेस्ट के माध्यम से इसे मापा, जिससे पता चलता है कि यह "वेरिफायर-गाइडेड" दृष्टिकोण AI को स्वतंत्र रूप से छोड़ने या इसे पूरी तरह से हाथ से करने की तुलना में बेहतर काम करता है।

यह एक ऐसी टीम की तरह है जहाँ रचनात्मक कलाकार (LLM) नए डिज़ाइन बनाता है, लेकिन सुरक्षा निरीक्षक (Verifier) हर एक बोल्ट की जाँच करता है इससे पहले कि विमान को उड़ने की अनुमति दी जाए। और इन सिमुलेशन में, विमान पहले की तुलना में बहुत बेहतर उड़े।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →