← नवीनतम पेपर
💰 quantitative finance

PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management

यह शोध पत्र पोर्टबेंच (PortBench) का परिचय देता है, जो पोर्टफोलियो प्रबंधन पर LLMs का मूल्यांकन करने के लिए एक स्थिर QA डेटासेट और एक गतिशील पांच-चरणीय आवंटन पाइपलाइन वाली एक व्यापक बेंचमार्क प्रणाली है, जो यह प्रकट करती है कि स्थिर वित्तीय प्रश्नों पर मजबूत प्रदर्शन के बावजूद, अधिकांश मॉडल बुनियादी समान-भार (equal-weight) रणनीतियों से बेहतर प्रदर्शन करने में विफल रहते हैं और अनदेखी सहसंबंध संरचनाओं (correlation structures) तथा संचयी तर्क त्रुटियों के कारण तनाव की स्थिति में विनाशकारी गिरावट (catastrophic drawdowns) का सामना करते हैं।

मूल लेखक: Yuxuan Zhao, Sijia Chen, Ningxin Su

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxuan Zhao, Sijia Chen, Ningxin Su

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपनी जीवन भर की बचत को प्रबंधित करने के लिए वित्तीय सलाहकारों (AI मॉडल्स) की एक टीम को काम पर रख रहे हैं, जो बेहद बुद्धिमान हैं। आप चाहते हैं कि वे केवल पैसे के बारे में सामान्य ज्ञान वाले सवालों के जवाब न दें; आप चाहते हैं कि वे वास्तव में एक ऐसा पोर्टफोलियो बनाएं जो आपकी संपत्ति को बढ़ाए और बाजार गिरने पर भी आपको सुरक्षित रखे।

PORTBENCH नामक शोध पत्र एक नया, अत्यंत कठोर "ड्राइवर लाइसेंस टेस्ट" है, जिसे यह देखने के लिए बनाया गया है कि क्या ये AI सलाहकार वास्तव में गाड़ी चलाने के लिए तैयार हैं, या वे केवल नियम पुस्तिका को रटने में अच्छे हैं।

यहाँ इस शोध पत्र के निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "पाठ्यपुस्तक बनाम वास्तविकता" का अंतर

वित्तीय AI के पिछले परीक्षण ऐसे थे जैसे किसी छात्र को कागज पर गणित के सवाल हल करने के लिए कहना। वे सूत्रों पर सटीक अंक प्राप्त कर सकते थे। लेकिन वास्तविक दुनिया में, निवेश केवल गणित के बारे में नहीं है; यह इस बारे में है कि विभिन्न संपत्तियां (स्टॉक्स, बॉन्ड्स, क्रिप्टो, रियल एस्टेट आदि) एक साथ कैसे चलती हैं।

  • कमी: पुराने परीक्षण यह जांच नहीं पाते थे कि AI कोरिलेशन (सहसंबंध) को समझता है या नहीं। कल्पना कीजिए कि एक शेफ एक "विविध" (diversified) सलाद बनाता है जिसमें वह 50 अलग-अलग प्रकार की लेट्यूस (सलाद पत्ता) डाल देता है। यह बहुत सारी सामग्रियों जैसा दिखता है, लेकिन यह सब एक ही चीज़ है। यदि लेट्यूस बीमार हो जाता है, तो पूरा सलाद बर्बाद हो जाता है।
  • वास्तविकता: सच्चा विविधीकरण (diversification) लेट्यूस, टमाटर, पनीर और मेवों वाला सलाद बनाने जैसा है। यदि लेट्यूस मुरझा जाता है, तो मेवे अभी भी कुरकुरे हो सकते हैं। शोध पत्र ने पाया कि मौजूदा बेंचमार्क "सभी-लेट्यूस" वाले सलाद और असली सलाद के बीच अंतर नहीं कर सके।

2. समाधान: PORTBENCH (पूर्ण ड्राइविंग टेस्ट)

लेखकों ने PORTBENCH बनाया है, जो एक विशाल सिमुलेशन है जो 10 साल के बाजार इतिहास और 6 विभिन्न प्रकार की संपत्तियों (स्टॉक्स, बॉन्ड्स, क्रिप्टो आदि) को कवर करता है।

केवल प्रश्न पूछने के बजाय, उन्होंने AI को एक 5-चरणीय निर्णय पाइपलाइन (5-Stage Decision Pipeline) के माध्यम से डाला, जो एक रिले रेस की तरह है जहाँ बैटन आपका पैसा है:

  1. बाजार व्याख्या (Market Interpretation): मौसम की रिपोर्ट पढ़ना (क्या यह तेजी का बाजार है या तूफान आ रहा है?)।
  2. सिग्नल जनरेशन (Signal Generation): मौसम के आधार पर खरीदने या बेचने का निर्णय लेना।
  3. वेट ऑप्टिमाइजेशन (Weight Optimization): यह तय करना कि प्रत्येक टोकरी में कितना हिस्सा रखना है।
  4. निष्पादन (Execution): वास्तव में ट्रेड करना (और लेनदेन शुल्क देना)।
  5. जोखिम निगरानी (Risk Monitoring): यह देखना कि क्या नाव में पानी भर रहा है और डूबने से पहले उसे ठीक करना।

उन्होंने एक नया मीट्रिक भी पेश किया जिसे CEPS कहा जाता है। इसे एक "चेन रिएक्शन स्कोर" के रूप में सोचें। यदि AI चरण 1 में एक छोटी सी गलती करता है, तो क्या वह चरण 5 तक एक आपदा में बदल जाती है? CEPS मापता है कि त्रुटियाँ कितनी बुरी तरह से बढ़ती हैं।

3. स्ट्रेस टेस्ट: "तूफान" का सिमुलेशन

यह परीक्षण केवल शांत मौसम में नहीं चलता है। यह AI को तीन ऐतिहासिक "तूफानों" से निपटने के लिए मजबूर करता है:

  • 2015 का चीन शॉक।
  • 2020 का कोविड क्रैश।
  • 2022 का क्रिप्टो पतन।

उन्होंने AI को तीन अलग-अलग "पर्सोना" (व्यक्तित्व) भी दिए जिन्हें प्रबंधित करना है:

  • रूढ़िवादी (The Conservative): "मैं एक भी पैसा नहीं खो सकता।"
  • संतुलित (The Balanced): "मैं विकास चाहता हूँ, लेकिन मैं कुछ उतार-चढ़ाव झेल सकता हूँ।"
  • आक्रामक (The Aggressive): "मैं जल्दी अमीर बनना चाहता हूँ, भले ही मुझे सब कुछ गंवाना पड़े।"

4. चौंकाने वाले परिणाम: AI टेस्ट में फेल रहा

लेखकों ने दुनिया के 10 सबसे उन्नत AI मॉडल्स का परीक्षण किया। परिणाम विनम्र करने वाले थे:

  • "90% विफलता" दर: "स्थिर प्रश्नोत्तर" (static QA) पर अविश्वसनीय रूप से उच्च स्कोर करने के बावजूद, 90% AI संयोजन एक सरल रणनीति को हराने में विफल रहे जहाँ आप बस अपना पैसा सभी संपत्तियों के बीच समान रूप से बांट देते हैं (जिसे "इक्वल वेट" रणनीति कहा जाता है)।
  • "सभी-लेट्यूस" वाला सलाद: AI मॉडल कोरिलेशन को समझने में बहुत खराब थे। एक संतुलित पोर्टफोलियो बनाने के बजाय, वे अपना पैसा हर चीज़ में इतना पतला फैला देते थे कि वे एक "लगभग समान" (near-uniform) पोर्टफोलियो बन जाता था। वे यह नहीं जानते थे कि जोखिम के खिलाफ बचाव (hedge) करने के लिए सही चीजों पर ध्यान कैसे केंद्रित किया जाए।
  • "पेपर टाइगर" प्रभाव: जब बाजार शांत था, तो AI शानदार दिख रहा था। लेकिन जब "तूफान" आया (जैसे 2022 का क्रिप्टो क्रैश), तो जो मॉडल सुरक्षित दिख रहे थे, उन्हें अचानक भारी नुकसान हुआ। उन्होंने सभी नियमों का पालन किया लेकिन फिर भी जहाज डुबो दिया क्योंकि वे जोखिम की प्रकृति को नहीं समझते थे।
  • निष्पादन का पतन (Execution Collapse): भले ही AI ने कागज पर सही रणनीति बना ली थी, लेकिन वह उसे लागू करने में विफल रहा। यह उस शेफ की तरह है जो सही रेसिपी जानता है लेकिन ओवन चालू करना भूल जाता है। वे वास्तव में पोर्टफोलियो को वहां तक ले जाने के लिए पर्याप्त ट्रेड नहीं कर पाए जहाँ उसे होना चाहिए था।

5. एक चीज़ जो AI कर सकता है

शोध पत्र निष्कर्ष निकालता है कि हालांकि ये AI वर्तमान में रिटर्न (पैसा बनाने) के मामले में बहुत खराब हैं, लेकिन उनके पास एक अनूठी सुपरपावर है जो साधारण गणितीय सूत्रों के पास नहीं होती: अनुकूलन क्षमता (Adaptability)

यदि आप एक साधारण गणितीय सूत्र को कहते हैं, "आप केवल 40% स्टॉक्स में निवेश कर सकते हैं," तो वह हर बार वही करता है। लेकिन ये AI मॉडल वास्तव में आपके विशिष्ट व्यक्तित्व ("मैं पैसा खोने से डरता हूँ") को सुन सकते हैं और अपने डर से मेल खाने के लिए अपनी रणनीति को थोड़ा समायोजित कर सकते हैं। वे बाजार को हराने की तुलना में क्लाइंट की बात सुनने में बेहतर हैं।

निचोड़

शोध पत्र का तर्क है कि हमें अभी इन AI मॉडल्स को अपना पैसा प्रबंधित करने के लिए भरोसा नहीं करना चाहिए। वे उन प्रतिभाशाली छात्रों की तरह हैं जो लिखित ड्राइविंग टेस्ट में 'A' ग्रेड पा सकते हैं लेकिन वास्तविक गड्ढे आते ही कार क्रैश कर देंगे। वे जटिल बाजार डेटा को शोर (noise) की तरह देखते हैं, यह समझने में विफल रहते हैं कि विभिन्न संपत्तियां एक-दूसरे की रक्षा कैसे करती हैं, और तनाव के समय ढह जाते हैं।

सीख: केवल इसलिए कि किसी AI ने क्विज़ में 'A' प्राप्त किया है, उसे अपना पोर्टफोलियो चलाने की अनुमति न दें। उसे अभी भी बारिश में गाड़ी चलाना नहीं आता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →