AlphaCrafter: Harnessing Multi-Agent Workflows for Cross-Sectional Quantitative Trading
यह शोध पत्र AlphaCrafter को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो ढीले प्राकृतिक-भाषा वर्कफ़्लो के स्थान पर प्रोग्राम करने योग्य नीति विशिष्टताओं और स्पष्ट सत्यापन तंत्रों वाले एक संरचित, हार्नेस-संचालित डिज़ाइन का उपयोग करके मात्रात्मक व्यापार की विश्वसनीयता, नियंत्रणीयता और सत्यापन क्षमता को बढ़ाता है, जिसके अनुभवजन्य परिणाम कम विचरण के साथ बेहतर जोखिम-समायोजित रिटर्न की ओर ले जाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल एक कठोर रेसिपी का पालन नहीं करते बल्कि जटिल समस्याओं को हल करने के लिए वास्तव में "सोच" सकते हैं। यह आर्टिफिशियल इंटेलिजेंस (AI) का क्षेत्र है, विशेष रूप से क्वांटिटेटिव ट्रेडिंग (Quantitative Trading) नामक एक शाखा। इसे एक उच्च-दांव वाले वीडियो गेम की तरह समझें जहाँ लक्ष्य यह अनुमान लगाना है कि कौन से शेयर ऊपर या नीचे जाएंगे ताकि पैसा बनाया जा सके। दशकों से, मनुष्यों ने ऐसा करने के लिए सख्त कंप्यूटर प्रोग्राम लिखे हैं, लेकिन बाजार एक अराजक महासागर की तरह है—तूफान बदलते हैं, धाराएं बदलती हैं, और पुराने नक्शे अक्सर जहाज तोड़ देते हैं। हाल ही में, वैज्ञानिकों ने लार्ज लैंग्वेज मॉडल्स (LLMs) का उपयोग करना शुरू किया है, जो सुपर-स्मार्ट AI मस्तिष्क हैं जिन्हें दुनिया के लगभग सभी टेक्स्ट पर प्रशिक्षित किया गया है, ताकि वे ट्रेडर के रूप में कार्य कर सकें। विचार यह है कि ये AI मस्तिष्क समाचार पढ़ सकते हैं, पैटर्न समझ सकते हैं, और एक स्थिर कंप्यूटर प्रोग्राम की तुलना में बेहतर निर्णय ले सकते हैं। हालाँकि, एक पेंच है: यदि आप बस एक AI से कहें कि "मेरे लिए व्यापार करो," तो वह भ्रमित हो सकता है, मतिभ्रम (hallucinate) का शिकार हो सकता है, या हर बार पूछने पर अलग तरह से व्यवहार कर सकता है, जिससे वास्तविक धन के साथ भरोसा करना बहुत जोखिम भरा हो जाता है।
यहीं नानजिंग यूनिवर्सिटी के शोधकर्ताओं का एक नया पेपर एक चतुर समाधान के साथ आता है। वे AlphaCrafter पेश करते हैं, एक ऐसा सिस्टम जो केवल AI को "मनमर्जी" करने नहीं देता। इसके बजाय, उन्होंने AI के चारों ओर एक सख्त "हार्नेस" (harness) बनाया है, जैसे किसी जंगली जानवर के लिए सुरक्षा पिंजरा या किसी अराजक खेल के लिए नियम पुस्तिका। उन्होंने पाया कि AI को एक संरचित, चरण-दर-चरण वर्कफ़्लो के साथ चलने के लिए मजबूर करने से, जिसमें जांच और संतुलन के अंतर्निहित तंत्र हों, सिस्टम बहुत अधिक विश्वसनीय हो जाता है। उनके प्रयोग बताते हैं कि यह "हार्नेस-संचालित" दृष्टिकोण AI को अधिक निरंतर रूप से बेहतर पैसा बनाने वाले निर्णय लेने में मदद करता है और जोखिम कम करता है, भले ही बाजार पागल हो जाए। यह कुछ ऐसा है जैसे यह महसूस करना कि एक प्रतिभाशाली शेफ को केवल "कुछ स्वादिष्ट पकाएं" कहने और सबसे अच्छे की उम्मीद करने के बजाय, उसे एक सख्त, सत्यापित रेसिपी और एक सुरक्षा निरीक्षक देना बेहतर है।
समस्या: "लूज प्रॉम्प्ट" (Loose Prompt) का जाल
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े अराजक मित्र से एक विशाल पार्टी आयोजित करने के लिए कहते हैं। यदि आप केवल कहते हैं, "इसे शानदार बनाओ!" (एक "लूस प्रॉम्प्ट"), तो वे एक जोकर, एक जैज़ बैंड और एक पिज्जा ओवन के साथ आ सकते हैं, लेकिन कुर्सियां लाना भूल सकते हैं। वे एक दिन बहुत अच्छा काम कर सकते हैं और दूसरे दिन बहुत बुरा, यह उनके मूड पर निर्भर करता है। AI ट्रेडिंग की दुनिया में, कई मौजूदा सिस्टम इसी तरह काम करते हैं। वे AI को क्या करना है यह बताने के लिए सरल टेक्स्ट निर्देशों पर भरोसा करते हैं। समस्या यह है कि ये AI मस्तिष्क अप्रत्याशित हो सकते हैं। वे एक नियम भूल सकते हैं, बीच में अपना मन बदल सकते हैं, या इस आधार पर अलग तरह से कार्य कर सकते हैं कि आप किस विशिष्ट AI मॉडल का उपयोग कर रहे हैं। शेयर बाजार में, जहाँ लाखों डॉलर दांव पर लगे होते हैं, यह "ढीला" व्यवहार खतरनाक है। यह असंगत परिणाम देता है और लंबे समय तक सिस्टम पर भरोसा करना असंभव बना देता है।
समाधान: AlphaCrafter का "हार्नेस"
AlphaCrafter के पीछे के शोधकर्ताओं ने AI के साथ एक स्वतंत्र कलाकार की तरह व्यवहार करना बंद करने और उसे एक कारखाने में एक अनुशासित कार्यकर्ता की तरह व्यवहार करने का निर्णय लिया। उन्होंने एक मल्टी-एजेंट फ्रेमवर्क (multi-agent framework) बनाया, जिसका अर्थ है कि उन्होंने केवल एक AI को सब कुछ करने के लिए नहीं छोड़ा। इसके बजाय, उन्होंने विशिष्ट AI एजेंटों की एक टीम बनाई, जिनमें से प्रत्येक का एक विशिष्ट कार्य है, और उन्होंने प्रत्येक के चारों ओर एक "हार्नेस" लगाया।
इस हार्नेस को एक रॉक क्लाइंबर के लिए सुरक्षा हार्नेस के रूप में सोचें। यह पर्वतारोही को हिलने-डुलने से नहीं रोकता; यह केवल यह सुनिश्चित करता है कि यदि वे फिसलते हैं तो वे चट्टान से गिर न जाएं। AlphaCrafter में, हार्नेस में शामिल हैं:
- प्रोग्रामेबल पॉलिसीज (Programmable Policies): सख्त नियम जिनका AI को पालन करना चाहिए।
- एग्जीक्यूशन कंस्ट्रेंट्स (Execution Constraints): AI जो कर सकता है उस पर सीमाएं।
- वेरिफिकेशन मैकेनिज्म (Verification Mechanisms): यह सुनिश्चित करने के लिए स्वचालित जांच कि AI ने कोई गलती नहीं की है।
यह सिस्टम तीन मुख्य "हार्नेस" में विभाजित है जो एक लूप में मिलकर काम करते हैं:
- द माइनर (The Miner - कारक शिकारी): एक सोने के खोजकर्ता की कल्पना करें। इस AI एजेंट का काम नए "फैक्टर्स" (factors) का आविष्कार करना है। ट्रेडिंग में, एक फैक्टर एक संकेत या सुराग है जो भविष्यवाणी कर सकता है कि कोई स्टॉक ऊपर जाएगा या नहीं (जैसे "कम कीमत वाले स्टॉक बढ़ने की प्रवृत्ति रखते हैं")। माइनर हजारों ऐसे सुराग बनाता है, लेकिन यह उन सभी को नहीं रखता है। यह उन्हें एक कठोर परीक्षण से गुजारता है। यदि कोई सुराग अतीत में अच्छा काम नहीं करता है, तो हार्नेस उसे हटा देता है। केवल सबसे अच्छे, सबसे विश्वसनीय सुरागों को ही लाइब्रेरी में जोड़ा जाता है।
- द स्क्रीनर (The Screener - रेजिम डिटेक्टिव): एक मौसम पूर्वानुमानकर्ता की कल्पना करें। बाजार "रेजीम्स" (regimes) बदलता है (जैसे धूप वाले दिन, तूफान, या कोहरा)। एक सुराग जो शांत बाजार में काम करता है, वह तूफान में विफल हो सकता है। स्क्रीनर वर्तमान बाजार स्थितियों को देखता है, AI से पूछता है, "आज कैसा मौसम है?" और फिर केवल उन्हीं सुरागों को चुनता है जो आज के मौसम के लिए अच्छे हैं। यह खराब वाले को फ़िल्टर करता है और अच्छे वाले को एक साथ समूहित करता है।
- द ट्रेडर (The Trader - निष्पादन पायलट): यह विमान उड़ाने वाला पायलट है। यह स्क्रीनर से मिले अच्छे सुरागों की सूची लेता है और यह तय करता है कि प्रत्येक पर कितना पैसा लगाना है। यह विभिन्न रणनीतियों का परीक्षण करने के लिए सिमुलेशन (जैसे फ्लाइट सिम्युलेटर) चलाता है। यह केवल उस रणनीति को चुनता है जो कम से कम जोखिम के साथ सबसे अच्छा रिटर्न देने का वादा करती है, और फिर ट्रेड निष्पादित करता है।
उन्होंने क्या पाया: स्थिरता ही नई महाशक्ति है
शोधकर्ताओं ने दो बड़े शेयर बाजारों पर AlphaCrafter का परीक्षण किया: CSI 300 (चीन की शीर्ष 300 कंपनियां) और S&P 500 (अमेरिका की शीर्ष 500 कंपनियां)। उन्होंने अपने सिस्टम की तुलना अन्य तरीकों से की, जिसमें पुराने गणितीय सूत्र, मानक मशीन लर्निंग और अन्य AI ट्रेडिंग बॉट्स शामिल थे जिनमें यह "हार्नेस" सिस्टम नहीं था।
परिणाम स्पष्ट थे। जबकि अन्य AI सिस्टम एक रोलरकोस्टर की तरह थे—कभी भारी मुनाफा कमाते थे तो कभी बुरी तरह गिर जाते थे—AlphaCrafter स्थिर था।
- बेहतर रिटर्न: AlphaCrafter ने अधिकांश अन्य तरीकों की तुलना में लगातार अधिक पैसा बनाया, जिसमें उनके सर्वश्रेष्ठ परीक्षणों में चीनी बाजार पर लगभग 1.67 का शार्प रेशियो (Sharpe Ratio) (एक स्कोर जो मापता है कि आप जोखिम के लिए कितना लाभ प्राप्त करते हैं) और अमेरिकी बाजार में 1.34 का शार्प रेशियो रहा।
- कम अराजकता: सबसे बड़ी जीत केवल पैसा कमाना नहीं थी; बल्कि विश्वसनीयता के साथ पैसा कमाना था। जब शोधकर्ताओं ने एक ही परीक्षण 10 बार चलाया, तो AlphaCrafter के परिणाम हर बार लगभग एक जैसे थे। अन्य AI सिस्टम बहुत भिन्न थे; एक रन बहुत अच्छा हो सकता था, अगला बहुत खराब। AlphaCrafter के "हार्नेस" ने AI को ट्रैक पर रखा, चाहे सिस्टम के अंदर कौन सा भी विशिष्ट AI मस्तिष्क (जैसे GPT, Claude, या Gemini) उपयोग किया गया हो।
- तूफान में जीवित रहना: उन्होंने "अल्फा डिके" (Alpha Decay) को भी देखा, जो तब होता है जब एक ट्रेडिंग सुराग काम करना बंद कर देता है क्योंकि बाकी सब ने इसे समझ लिया होता है। AlphaCrafter का माइनर पुराने सुरागों को बदलने के लिए नए सुराग खोजने का काम जारी रखता है, जिससे सिस्टम समय के साथ ताज़ा और प्रभावी बना रहता है, जबकि अन्य सिस्टमों का प्रदर्शन बाजार बदलने के साथ गिर जाता है।
निष्कर्ष
यह पेपर सुझाव देता है कि AI को एक विश्वसनीय ट्रेडर बनाने का रहस्य केवल AI को "स्मार्ट" बनाना नहीं है। यह इसके चारों ओर एक बेहतर संरचना (structure) बनाने के बारे में है। AI को एक ऐसे हार्नेस में लपेटकर जो इसे नियमों का पालन करने, अपने काम की जांच करने और विशिष्ट कार्यों में विशेषज्ञता हासिल करने के लिए मजबूर करता है, AlphaCrafter एक अराजक, अप्रत्याशित AI को एक अनुशासित, विश्वसनीय ट्रेडिंग पार्टनर में बदल देता है। यह साबित करता है कि वित्त के उच्च-दांव वाले खेल में, एक ढीली योजना वाले अकेले जीनियस की तुलना में एक सुरक्षा जाल के साथ एक अच्छी तरह से संगठित टीम कहीं अधिक शक्तिशाली होती है। यह दृष्टिकोण न केवल पैसा बनाता है; यह पूरी प्रक्रिया को सुरक्षित, पारदर्शी और भरोसेमंद बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।