← नवीनतम पेपर
💰 quantitative finance

Constructing a Portfolio Optimization Benchmark Framework for Evaluating Large Language Models

यह शोध पत्र बड़े भाषा मॉडल (LLMs) की मात्रात्मक तर्क क्षमता का मूल्यांकन करने के लिए गणितीय रूप से स्पष्ट पोर्टफोलियो अनुकूलन समस्याओं का उपयोग करते हुए एक नवीन बेंचमार्क फ्रेमवर्क प्रस्तुत करता है, जो जोखिम-आधारित उद्देश्यों, रिटर्न-आधारित कार्यों और निवेश संबंधी बाधाओं को संभालने में GPT-4, Gemini 1.5 Pro और Llama 3.1-70B के बीच विशिष्ट प्रदर्शन पैटर्न को प्रकट करता है।

मूल लेखक: Hanyong Cho, Jang Ho Kim

प्रकाशित 2026-03-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanyong Cho, Jang Ho Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नया वित्तीय सलाहकार (financial advisor) नियुक्त कर रहे हैं। आपके पास तीन उम्मीदवार हैं: GPT, Gemini, और Llama। आप यह जानना चाहते हैं कि वास्तव में पैसे का प्रबंधन करने में कौन बेहतर है, न कि केवल वह जो पैसे के बारे में निबंध लिखने में अच्छा है।

इन AI "मस्तिष्कों" के लिए किए गए अधिकांश पिछले परीक्षण ऐसे थे जैसे उन्हें कोई समाचार लेख पढ़ने और उसका सारांश लिखने के लिए कहना। वे उन परीक्षणों को आसानी से पास कर लेते थे। लेकिन वास्तविक दुनिया में, निवेश करना केवल पढ़ने के बारे में नहीं है; यह सबसे अधिक पैसा कमाने के लिए और सबसे कम जोखिम के साथ शेयरों का सही मिश्रण (mix) निर्धारित करने के लिए जटिल गणित करने के बारे में है।

यह शोध पत्र एक नया, कठिन परीक्षण पेश करता है जिसे PortBench कहा जाता है। इसे AI के लिए एक "ड्राइविंग टेस्ट" की तरह समझें, लेकिन इसमें कार चलाने के बजाय, उन्हें निवेश के पोर्टफोलियो को नियंत्रित करना होता है।

परीक्षण: एक गणितीय पहेली, न कि एक रीडिंग क्विज़

शोधकर्ताओं ने 9,500 पहेलियों का एक विशाल प्रश्न बैंक बनाया है। प्रत्येक पहेली एक बहुविकल्पीय प्रश्न (multiple-choice question) की तरह दिखती है:

  • परिदृश्य (Scenario): "यहाँ 5 स्टॉक हैं। आप जोखिम को कम करना चाहते हैं (या लाभ को अधिकतम करना चाहते हैं)। यहाँ नियम दिए गए हैं (जैसे, आप एक स्टॉक में 20% से अधिक नहीं लगा सकते)।"
  • विकल्प (Options): AI को चार विकल्पों में से एक गणितीय रूप से सटीक उत्तर चुनना होगा।
  • जाल (Trap): तीन विकल्प "डिस्ट्रैक्टर्स" (distractors) हैं। वे विश्वसनीय लगते हैं लेकिन गणितीय रूप से गलत होते हैं। कुछ थोड़े से अलग होते हैं, जबकि अन्य पूरी तरह से गलत होते हैं।

इस परीक्षण की खूबसूरती यह है कि इसमें एक ही, गणितीय रूप से सही उत्तर होता है। इसमें अनुमान लगाने या "शायद" की कोई गुंजाइश नहीं है। यह एक गणित की समस्या की तरह है जहाँ आप स्केल (ruler) से उत्तर की जाँच कर सकते हैं।

परिणाम: किसने पास किया ड्राइविंग टेस्ट?

शोधकर्ताओं ने इस परीक्षण को तीन लोकप्रिय AI मॉडल पर चलाया। यहाँ उनके प्रदर्शन का विवरण दिया गया है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. GPT-4 (सावधान जोखिम प्रबंधक - The Cautious Risk Manager)

  • प्रदर्शन: स्पष्ट विजेता, विशेष रूप से जब लक्ष्य पैसे खोने से बचना (जोखिम कम करना) था।
  • उपमा: कल्पना कीजिए कि GPT एक सतर्क कप्तान है जो तूफान में जहाज चला रहा है। जब लक्ष्य "क्रैश न होना" हो, तो GPT अविश्वसनीय रूप से स्थिर होता है। यह सुरक्षा के गणित को बहुत अच्छी तरह समझता है और नियमों (constraints) से भ्रमित नहीं होता है।
  • कमजोरी: यह उन सबसे जटिल पहेलियों के साथ थोड़ा संघर्ष करता जिनमें उच्च गति (रिटर्न) और सुरक्षा (जोखिम) दोनों को एक साथ संतुलित करने की आवश्यकता थी, जैसे कि "शार्प रेशियो" (Sharpe Ratio)।

2. Gemini 1.5 Pro (हाई-रोलर जुआरी - The High-Roller Gambler)

  • प्रदर्शन: इसने तब बहुत अच्छा प्रदर्शन किया जब लक्ष्य केवल सबसे अधिक पैसा बनाना (रिटर्न को अधिकतम करना) था।
  • उपमा: Gemini को एक रेस कार ड्राइवर के रूप में सोचें जिसे गति से प्यार है। यदि ट्रैक साफ है और लक्ष्य "तेज़ जाना" है, तो यह जीत जाता है। लेकिन जैसे ही आप बाधाएं (constraints) जोड़ते हैं या इसे सावधानी से चलाने के लिए कहते हैं, यह घबराने लगता है। यह उच्च संख्या के पीछे भागने के लिए अक्सर नियमों की अनदेखी करता है, जिससे गलतियाँ होती हैं।
  • कमजोरी: जब नियम जटिल हो गए या जब "गलत" उत्तर "सही" उत्तरों के बहुत समान दिखने लगे, तो यह बिखर गया।

3. Llama 3.1 (वह छात्र जिसे और अध्ययन की आवश्यकता है - The Student Who Needs More Study)

  • प्रदर्शन: कुल मिलाकर सबसे कम स्कोर।
  • उपमा: Llama उस छात्र की तरह है जिसने पाठ्यपुस्तक रट ली है लेकिन उसने गणित को वास्तविक जीवन में लागू करना नहीं सीखा है। यह लगभग हर चीज़ के साथ संघर्ष करता है, विशेष रूप से जब नियम सख्त हो जाते हैं। यह अक्सर गलत उत्तर चुन लेता है भले ही गणित सरल हो।

मुख्य निष्कर्ष

यह अध्ययन वर्तमान AI के बारे में एक चौंकाने वाला सच प्रकट करता है:

  • वे वित्त (finance) के बारे में पढ़ने और बात करने में माहिर हैं।
  • वे अभी भी वित्त करने (doing finance) के बारे में सीख रहे हैं।

जब कार्य सरल था (जैसे "सबसे सुरक्षित विकल्प चुनें"), तो GPT विश्वसनीय था। लेकिन जब कार्य में कई लक्ष्यों को संभालना शामिल था (उच्च रिटर्न + कम जोखिम + सख्त नियम), तो तीनों मॉडल गलतियाँ करने लगे।

यह क्यों मायने रखता है?

यदि आप एक ऐसा ऐप बना रहे हैं जो आपके रिटायरमेंट फंड को प्रबंधित करने के लिए AI का उपयोग करता है, तो यह शोध पत्र कहता है: "सावधान रहें।"

  • आप इन AI पर समाचारों का विश्लेषण करने या अवधारणाओं को समझाने के लिए भरोसा कर सकते हैं।
  • आप अभी भी उन्हें जटिल रणनीतियों के लिए, विशेष रूप से मानव विशेषज्ञ द्वारा गणित की दोबारा जाँच किए बिना, अपने स्टॉक को स्वचालित रूप से चुनने के लिए भरोसा नहीं कर सकते।

शोधकर्ता उम्मीद करते हैं कि यह नया "ड्राइविंग टेस्ट" डेवलपर्स को बेहतर, सुरक्षित AI उपकरण बनाने में मदद करेगा, जिससे यह सुनिश्चित हो सके कि जब हम रोबोट को अपना पैसा प्रबंधित करने दें, तो वे कार को क्रैश न करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →