BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting
यह शोध पत्र BacktestBench को प्रस्तुत करता है, जो 6 मिलियन मार्केट रिकॉर्ड्स से प्राप्त 18,000 से अधिक एनोटेटेड कार्यों वाला स्वचालित क्वांटिटेटिव बैकटेस्टिंग के लिए पहला बड़े पैमाने का बेंचमार्क है, साथ ही AutoBacktest को भी प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जिसे प्राकृतिक भाषा रणनीतियों को पुनरुत्पादित बैकटेस्ट में अनुवादित करने और 23 मुख्यधारा के LLMs की क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शेफ हैं जो एक नया व्यंजन बनाना चाहते हैं जो आपको अमीर बना दे। वित्त की दुनिया में, यह "व्यंजन" एक ट्रेडिंग स्ट्रैटेजी (व्यापार रणनीति) है। इससे पहले कि आप इसे दुनिया के सामने परोसें (या अपना पैसा निवेश करें), आपको इसका बैकटेस्ट (backtest) करना होगा। इसका मतलब है कि आप अपनी रेसिपी लेते हैं और उसे ऐतिहासिक डेटा के एक विशाल बर्तन (पिछले कुछ वर्षों में शेयर बाजार में क्या हुआ) का उपयोग करके पकाते हैं ताकि यह देखा जा सके कि इसने वास्तव में पैसा बनाया या इसने रसोई को जलाकर राख कर दिया।
परंपरागत रूप से, इस बैकटेस्टिंग को करना ऐसा है जैसे हर बार एक नया व्यंजन टेस्ट करने के लिए शून्य से एक जटिल रोबोट बनाने की कोशिश करना। इसके लिए आपको एक मास्टर मैकेनिक (प्रोग्रामर), एक डेटा लाइब्रेरियन (सही ऐतिहासिक सामग्री खोजने के लिए), और एक वित्तीय जादूगर (विज़ार्ड) सभी एक साथ होना पड़ेगा। यह धीमा, महंगा और केवल कुछ विशेषज्ञों के लिए ही संभव है।
BacktestBench एक नया प्रोजेक्ट है जो पूछता है: "क्या आर्टिफिशियल इंटेलिजेंस (AI) एक साथ उस मास्टर मैकेनिक, लाइब्रेरियन और विज़ार्ड बनने के काबिल है?"
यहाँ इस पेपर का एक सरल विवरण दिया गया है:
1. समस्या: वित्त का "ब्लैक बॉक्स" (The "Black Box" of Finance)
लेखकों का तर्क है कि जबकि AI (विशेष रूप से लार्ज लैंग्वेज मॉडल्स या LLMs) कोड लिखने और चैट करने में बहुत अच्छा है, लेकिन वास्तव में किसी ने यह परीक्षण नहीं किया है कि क्या यह विशिष्ट, उच्च-दांव वाली नौकरी—स्वचालित मात्रात्मक बैकटेस्टिंग (automated quantitative backtesting)—को संभालने में सक्षम है।
- चुनौती: यह केवल कोड लिखने के बारे में नहीं है। AI को एक अस्पष्ट मानवीय अनुरोध जैसे, "जब कीमत 5 दिनों तक ऊपर जाए तो खरीदें," को समझना होगा और फिर:
- डेटाबेस से सटीक सही स्टॉक डेटा खोजना होगा।
- एक प्रोग्राम लिखना होगा जो बिना धोखाधड़ी किए (भविष्य के डेटा का उपयोग किए बिना) "5-दिन ऊपर" के नियम की गणना करता है।
- सिमुलेशन चलाना होगा।
- अंतिम स्कोर की गणना करनी होगी (जैसे कि "शार्प रेशियो" (Sharpe Ratio), जो एक फैंसी तरीका है यह बताने का कि "हमने जोखिम के बदले कितना लाभ कमाया?")।
यदि AI स्टेप 2 में एक छोटी सी भी गलती करता है, तो पूरा परिणाम बेकार हो जाता है।
2. समाधान: एक विशाल "अभ्यास परीक्षा" (BacktestBench)
AI यह कर सकता है या नहीं, यह परीक्षण करने के लिए, शोधकर्ताओं ने BacktestBench बनाया है। इसे एक विशाल, मानकीकृत ड्राइवर लाइसेंस टेस्ट की तरह समझें, जहाँ AI कार नहीं चला रहा है, बल्कि एक ट्रेडिंग स्ट्रैटेजी चला रहा है।
- डेटा: उन्होंने चीनी शेयर बाजारों (जैसे इतिहास का एक विशाल पुस्तकालय) से 6 मिलियन से अधिक वास्तविक मार्केट रिकॉर्ड्स का उपयोग किया।
- प्रश्न: उन्होंने 18,246 विशिष्ट परीक्षण प्रश्न बनाए। ये साधारण गणित के सवाल नहीं हैं; ये जटिल परिदृश्य हैं जैसे कि:
- "इस विशिष्ट स्टॉक के लिए इस विशेष स्ट्रैटेजी का लाभ निकालें।"
- "इस स्ट्रैटेजी के साथ किस स्टॉक ने सबसे अच्छा प्रदर्शन किया?"
- "कौन सा सेटिंग (पैरामीटर) सबसे अच्छा काम करता है?"
- ग्राउंड ट्रुथ (Ground Truth): क्योंकि उन्होंने इन प्रश्नों को खुद लिखे गए वास्तविक कोड से बनाया है, इसलिए वे जानते हैं कि सटीक सही उत्तर क्या है। यह उन्हें AI को सख्ती से ग्रेड करने की अनुमति देता है: सही या गलत।
3. परीक्षण विषय: "AutoBacktest" (द एआई टीम)
शोधकर्ताओं ने केवल एक AI को सब कुछ करने के लिए नहीं कहा। उन्होंने तीन विशिष्ट AI एजेंटों की एक टीम बनाई जिसे AutoBacktest कहा जाता है, जो एक किचन क्रू की तरह मिलकर काम करती है:
- समराइज़र (द ट्रांसलेटर - अनुवादक): आप इसे एक अव्यवस्थित मानवीय वाक्य देते हैं। यह उसे सटीक वित्तीय "सामग्रियों" (इंडिकेटर्स) की एक सटीक सूची में बदल देता है जिनकी सिस्टम को आवश्यकता है।
- रिट्राइवर (द लाइब्रेरियन - लाइब्रेरियन): यह उस सूची को लेता है और डेटाबेस में जाकर आवश्यक सटीक कच्चा डेटा (जैसे "ओपन प्राइस" और "वॉल्यूम") प्राप्त करता है। यह डेटा प्राप्त करने के लिए एक क्वेरी (SQL) लिखता है।
- कोडर (द शेफ - शेफ): यह डेटा और निर्देशों को लेता है, सिमुलेशन चलाने के लिए पायथन कोड लिखता है, उसे निष्पादित करता है, और अंतिम संख्या देता है।
4. परिणाम: कौन पास हुआ?
उन्होंने 23 अलग-अलग AI मॉडल्स (ओपन-सोर्स और सशुल्क "क्लोज्ड-सोर्स" दोनों) का इस परीक्षा पर परीक्षण किया।
- विजेता: शीर्ष क्लोज्ड-सोर्स मॉडल्स (जैसे Gemini 3 Pro) ने सबसे अच्छा प्रदर्शन किया, लेकिन वे भी केवल लगभग 67% सही थे। इसका मतलब है कि सबसे स्मार्ट AI भी वर्तमान में जटिल वित्तीय तर्क (logic) को संभालने में संघर्ष कर रहा है।
- "लॉजिक गैप" (तर्क की कमी): उन्होंने पाया कि कई AI ऐसे कोड लिखने में अच्छे हैं जो दिखने में सही लगते हैं (सिंटैक्स), लेकिन तर्क (लॉजिक) में विफल हो जाते हैं। उदाहरण के लिए, एक AI "वोलैटिलिटी" (जो जोखिम का एक माप है) की गणना करने वाला कोड लिख सकता है, लेकिन वह गणित में गलत हो सकता है क्योंकि वह वित्तीय परिभाषा को नहीं समझता है।
- "छोटे मॉडल" का संघर्ष: छोटे AI मॉडल (जिनके पास कम "दिमाग की कोशिकाएं" या पैरामीटर्स हैं) गणितीय कार्यों में बहुत खराब थे। यदि प्रश्न के लिए जटिल सांख्यिकीय तर्क की आवश्यकता थी, तो छोटे मॉडल अक्सर पूरी तरह से विफल हो गए, जबकि बड़े मॉडल्स ने बेहतर प्रदर्शन किया।
- सीक्रेट सॉस (गुप्त नुस्खा): उन्होंने पाया कि AI को मानकीकृत शॉर्ट कोड्स का एक "चीट शीट" (जैसे एक डिक्शनरी जो कहती है "वोलैटिलिटी = यह विशिष्ट फॉर्मूला") देने से AI को बहुत बेहतर कोड लिखने में मदद मिली।
5. निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि हालांकि AI स्वचालित वित्तीय अनुसंधान को ऑटोमेट करने में बेहतर हो रहा है, लेकिन हम अभी वहां तक नहीं पहुंचे हैं।
- वर्तमान AI मॉडल उन प्रतिभाशाली छात्रों की तरह हैं जो एक शानदार निबंध तो लिख सकते हैं लेकिन अक्सर गणित की परीक्षा में फेल हो जाते हैं।
- BacktestBench डेटासेट अब सभी के लिए उपयोग करने के लिए उपलब्ध है ताकि वे अपने स्वयं के AI मॉडल्स को प्रशिक्षित और परीक्षण कर सकें, जिससे यह सुनिश्चित हो सके कि भविष्य का वित्तीय AI वास्तव में विश्वसनीय है और केवल "हैलुसिनेटिंग" (भ्रमित) नंबर नहीं दिखा रहा है।
संक्षेप में: इस पेपर ने एक कठोर "फाइनल एग्जाम" बनाया है ताकि यह साबित किया जा सके कि क्या AI जटिल, त्रुटि-पूर्ण स्टॉक मार्केट बैकटेस्टिंग की दुनिया को संभाल सकता है। परिणाम दिखाते हैं कि हालांकि AI आशाजनक है, फिर भी इसे वास्तविक पैसा सौंपने से पहले गणित को पूरी तरह से सीखने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।