← नवीनतम पेपर
💬 NLP

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

यह शोधपत्र QuantCode-Bench प्रस्तुत करता है, जो Backtrader फ्रेमवर्क के लिए निष्पादन योग्य एल्गोरिद्मिक ट्रेडिंग रणनीतियों को उत्पन्न करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल मुख्य रूप से सिंटैक्टिक कोड शुद्धता के बजाय वित्तीय तर्क को सही ढंग से संचालित करने और कार्य अर्थविज्ञान (task semantics) का पालन करने में संघर्ष करते हैं।

मूल लेखक: Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

प्रकाशित 2026-04-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, अति-बुद्धिमान रोबोट शेफ है। आप इस शेफ को कुछ भी बनाने के लिए कह सकते हैं, और यह आमतौर पर एक रेसिपी का पूरी तरह से पालन कर सकता है, सब्जियों को काटने और मांस को सटीक रूप से सीजन करने में सक्षम है।

लेकिन अब, कल्पना कीजिए कि आप इसे एक नई, गुप्त रेसिपी बनाने के लिए कहते हैं जो अभी तक अस्तित्व में नहीं है, और यह केवल आपके द्वारा दिए गए एक अस्पष्ट विवरण पर आधारित है। और यहाँ पेंच यह है: वह व्यंजन न केवल कागज़ पर अच्छा दिखना चाहिए; उसे वास्तव में खाने में स्वादिष्ट भी होना चाहिए, और यह बिल्कुल वही व्यंजन होना चाहिए जो आपने माँगा था, न कि कोई रैंडम सूप जो बस खाने योग्य हो।

यह बिल्कुल वही है जिसके बारे में QuantCode-Bench पेपर है, लेकिन यहाँ एक शेफ के बजाय, यह लार्ज लैंग्वेज मॉडल्स (AI) की स्टॉक मार्केट के लिए ट्रेडिंग रणनीतियाँ लिखने की क्षमता का परीक्षण कर रहा है।

यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. समस्या: "यह कंपाइल होता है, लेकिन काम नहीं करता"

अधिकांश AI बेंचमार्क यह परीक्षण करते हैं कि क्या एक रोबोट ऐसा कोड लिख सकता है जो क्रैश न हो (सिंटैक्स)। यह एक रोबोट शेफ को प्याज काटने के बिना अपनी उंगली काटने के परीक्षण जैसा है।

  • पुराना तरीका: यदि कोड बिना किसी त्रुटि के चलता है, तो AI को पासिंग ग्रेड मिलता है।
  • ट्रेडिंग की वास्तविकता: स्टॉक मार्केट में, कोड जो बिना किसी एरर के चलता है, वह फिर भी बेकार हो सकता है। कल्पना कीजिए कि एक रोबोट शेफ पानी का एक आदर्श कटोरा बनाता है। यह "खाने योग्य" और "सुरक्षित" है, लेकिन यदि आपने "स्पाइसी करी" माँगी थी, तो रोबोट विफल रहा।
  • लक्ष्य: शोधकर्ता यह देखना चाहते थे कि क्या AI एक मानव विचार (जैसे, "जब कीमत गिरे तो खरीदें, जब बढ़े तो बेचें") को एक ऐसी रणनीति में बदल सकता है जो वास्तविक दुनिया में ट्रेड करती है।

2. परीक्षण: "QuantCode-Bench"

टीम ने एक विशाल टेस्ट किचन बनाया जिसे QuantCode-Bench कहा जाता है।

  • सामग्री: उन्होंने Reddit, Twitter (TradingView) और GitHub जैसी जगहों से 400 अलग-अलग ट्रेडिंग विचार एकत्र किए। कुछ सरल थे ("कम पर खरीदें, ऊंचे पर बेचें"), और कुछ जटिल थे ("मौसम की भविष्यवाणी करने के लिए एक विशिष्ट गणितीय सूत्र का उपयोग करें और उसके आधार पर ट्रेड करें")।
  • फ्रेमवर्क: उन्होंने AI को मजबूर किया कि वह Backtrader नामक एक विशिष्ट टूल का उपयोग करे। इसे एक बहुत ही चयनात्मक, सख्त किचन के रूप में सोचें। यदि आप चाकू गलत पकड़ते हैं, तो किचन लॉक हो जाता है। सफल होने के लिए AI को इस किचन के विशिष्ट नियमों को सीखना होगा।

3. चार-चरणीय फ़िल्टर (द "टेस्ट ऑफ टेस्ट")

इस परीक्षण को पास करने के लिए, AI के कोड को चार कठिन बाधाओं से गुजरना होगा:

  1. ग्रामर चेक (कंपाइलेशन): क्या कोड में टाइपो हैं? क्या कंप्यूटर इसे पढ़ सकता है?
    • परिणाम: लगभग सभी शीर्ष AI इसे पास कर लेते हैं। वे व्याकरण में बहुत अच्छे हैं।
  2. सेफ्टी चेक (बैकटेस्ट): क्या ऐतिहासिक डेटा को खिलाने पर कोड बिना क्रैश हुए चलता है?
    • परिणाम: अधिकांश शीर्ष AI इसे भी पास कर लेते हैं।
  3. एक्शन चेक (ट्रेड्स): क्या रणनीति ने वास्तव में कुछ खरीदा या बेचा?
    • परिणाम: यहीं पर चीजें गड़बड़ा जाती हैं। कई AI ऐसा कोड लिखते हैं जो पूरी तरह से चलता है लेकिन एक भी ट्रेड नहीं करता है। यह एक ऐसे शेफ की तरह है जो भोजन तैयार तो करता है लेकिन उसे कभी परोसता ही नहीं।
  4. "क्या आपने सुना?" चेक (द जज): एक AI जज कोड को पढ़ता है और आपके मूल अनुरोध के साथ उसकी तुलना करता है। क्या आपने "स्पाइसी करी" माँगी थी और क्या रोबोट ने "स्पाइसी करी" बनाई, या उसने बस कोई भी खाना बना दिया?
    • परिणाम: यह सबसे कठिन हिस्सा है। सबसे स्मार्ट AI भी मानव के इरादे (intent) को पूरी तरह से समझने में संघर्ष करते हैं।

4. परिणाम: वन-शॉट बनाम द "डू-ओवर"

शोधकर्ताओं ने AI का दो तरीकों से परीक्षण किया:

  • "वन-शॉट" चुनौती: AI को कोड लिखने का एक ही मौका मिलता है। यदि वह विफल होता है, तो वह विफल हो जाता है।
    • परिणाम: यहाँ तक कि सबसे स्मार्ट AI भी केवल 70-76% कार्यों को सही कर पाए। वे कोड लिख सकते थे, लेकिन वे अक्सर ट्रेड के लॉजिक को समझने में विफल रहे।
  • "एजेंटिक" चुनौती (द "डू-ओवर"): AI कोड लिखता है, एक एरर मैसेज प्राप्त करता है (जैसे, "आपने पर्याप्त नहीं खरीदा"), और 10 बार तक फिर से प्रयास करने का मौका पाता है।
    • परिणाम: यह गेम-चेंजर साबित हुआ। फीडबैक के साथ, सर्वश्रेष्ठ AI 95-98% सफलता तक पहुँच गए।
    • सबक: AI "बेवकूफ" नहीं है; उसे बस एक इंसान (या कंप्यूटर) की आवश्यकता है जो कहे, "हे, आपने एक विवरण मिस कर दिया," और फिर वह इसे ठीक कर सकता है।

5. वे क्यों विफल होते हैं?

शोधकर्ताओं ने पाया कि AI इसलिए विफल नहीं हो रहा है क्योंकि वह Python कोड नहीं लिख सकता। वह इसलिए विफल हो रहा है क्योंकि:

  • "घोस्ट" लॉजिक: AI ऐसा कोड लिखता है जो दिखने में सही लगता है लेकिन स्थितियाँ इतनी सख्त होती हैं कि स्टॉक की कीमत कभी भी ट्रेड को ट्रिगर नहीं करती।
  • "गलत टूल" की समस्या: AI काम के लिए गलत गणितीय सूत्र का उपयोग करता है।
  • "हैलुसिनेशन" (भ्रम): AI सोचता है कि वह एक विशिष्ट वित्तीय टूल कैसे काम करता है, लेकिन वास्तव में उसे नहीं पता।

मुख्य निष्कर्ष

ऐसा कोड लिखना जो चलता है, आधुनिक AI के लिए आसान है। ऐसा कोड लिखना जो वास्तव में वही करे जो आपका मतलब था, अभी भी बहुत कठिन है।

पेपर यह निष्कर्ष निकालता है कि वित्त (या किसी भी जटिल क्षेत्र) में AI को वास्तव में उपयोगी बनाने के लिए, हम केवल इसे "कोड लिखने" के लिए नहीं कह सकते। हमें इसे विफल होने, सीखने और खुद को ठीक करने का मौका देना होगा। यदि हम इसे एक जूनियर कर्मचारी की तरह देखते हैं जिसे अपने काम की समीक्षा करने और यह कहने के लिए एक मैनेजर की आवश्यकता है कि, "फिर से प्रयास करें, लेकिन इस विशिष्ट भाग को ठीक करें," तो वे अविश्वसनीय रूप से शक्तिशाली बन जाते हैं। लेकिन यदि हम उनसे पहली बार में ही परफेक्ट होने की उम्मीद करते हैं, तो वे अक्सर हमें निराश करेंगे।

संक्षेप में: AI एक प्रतिभाशाली प्रशिक्षु (apprentice) शेफ है। वह पूरी तरह से काट सकता है, लेकिन उसे एक हेड शेफ की आवश्यकता होती है जो उसे बताए, "नहीं, मुझे यह अधिक मसालेदार चाहिए था," इससे पहले कि वह एक मास्टरपीस बना सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →