← नवीनतम पेपर
💬 NLP

Herculean: An Agentic Benchmark for Financial Intelligence

यह शोध पत्र हर्कुलियन (Herculean) को प्रस्तुत करता है, जो वित्तीय बुद्धिमत्ता के लिए पहला एजेंटिक बेंचमार्क है जो मानकीकृत MCP-आधारित वातावरणों का उपयोग करके चार जटिल वर्कफ़्लो (ट्रेडिंग, हेजिंग, मार्केट इनसाइट्स और ऑडिटिंग) में AI एजेंटों का मूल्यांकन करता है, जिससे यह पता चलता है कि जहाँ एजेंट ट्रेडिंग और इनसाइट्स पर अच्छा प्रदर्शन करते हैं, वहीं वे हेजिंग और ऑडिटिंग के लिए आवश्यक दीर्घकालिक समन्वय (long-horizon coordination) और संरचित सत्यापन (structured verification) में काफी संघर्ष करते हैं।

मूल लेखक: Xueqing Peng, Zhuohan Xie, Yupeng Cao, Haohang Li, Lingfei Qian, Yan Wang, Vincent Jim Zhang, Huan He, Xuguang Ai, Linhai Ma, Ruoyu Xiang, Yueru He, Yi Han, Shuyao Wang, Yuqing Guo, Mingyang Jiang, Yi
प्रकाशित 2026-05-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xueqing Peng, Zhuohan Xie, Yupeng Cao, Haohang Li, Lingfei Qian, Yan Wang, Vincent Jim Zhang, Huan He, Xuguang Ai, Linhai Ma, Ruoyu Xiang, Yueru He, Yi Han, Shuyao Wang, Yuqing Guo, Mingyang Jiang, Yilun Zhao, Youzhong Dong, Xiaoyu Wang, Yankai Chen, Ye Yuan, Qiyuan Zhang, Fuyuan Lyu, Haolun Wu, Yonghan Yang, Zichen Zhao, Yuyang Dai, Fan Zhang, Rania Elbadry, Ayesha Gull, Muhammad Usman Safder, Nuo Chen, Fengbin Zhu, Tianshi Cai, Zimu Wang, Polydoros Giannouris, Yuechen Jiang, Zhiwei Liu, Mohsinul Kabir, Yuyan Wang, Yixiang Zheng, Yangyang Yu, Weijin Liu, Wenbo Cao, Anke Xu, Peng Lu, Jerry Huang, Fengran Mo, Mingquan Lin, Prayag Tiwari, Yijia Zhao, Victor Gutierrez Basulto, Xiao-Yang Liu, Kaleb E Smith, Jiahuan Pei, Arman Cohan, Jimin Huang, Yuehua Tang, Alejandro Lopez-Lira, Xi Chen, Xue Liu, Junichi Tsujii, Jian-Yun Nie, Sophia Ananiadou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नया वित्तीय सहायक (financial assistant) काम पर रख रहे हैं। अतीत में, आप उन्हें परखने के लिए पूछ सकते थे, "कल एप्पल का स्टॉक प्राइस क्या था?" या "इस अर्निंग रिपोर्ट का सारांश दें।" यदि वे सही उत्तर देते, तो आप उन्हें बुद्धिमान समझते।

लेकिन इस शोध पत्र के लेखक तर्क देते हैं कि एक सही उत्तर देना, वास्तविक काम करने में सक्षम होने के समान नहीं है। उन्होंने एक नया परीक्षण बनाया जिसे HERCULEAN कहा जाता है (एक नाम जो किसी "हर्कुलियन" या विशाल कार्य की अवधारणा से प्रेरित है) यह देखने के लिए कि क्या AI एजेंट वास्तव में पेशेवर वित्तीय विशेषज्ञों की तरह काम कर सकते हैं, न कि केवल सामान्य ज्ञान के प्रश्नों के उत्तर दे सकते हैं।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

वे चार "काम" जो उन्होंने AI को दिए

एक साधारण क्विज़ के बजाय, शोधकर्ताओं ने AI को चार अलग-अलग, जटिल काम दिए जो वास्तविक मनुष्य हर दिन करते हैं। इसे एक वित्तीय कारखाने में चार अलग-अलग शिफ्टों की तरह समझें:

  1. ट्रेडर (ट्रेडिंग):

    • काम: तीन महीने तक हर दिन, AI को यह निर्णय लेना होगा कि किसी विशिष्ट स्टॉक को खरीदना है, बेचना है या होल्ड करना है।
    • चुनौती: यह शतरंज खेलने जैसा है जहाँ बोर्ड हर दिन बदलता है, और आप भविष्य नहीं देख सकते। आपको एक चाल चलनी होती है, उसके परिणामों के साथ जीना होता है, और फिर केवल उसी जानकारी के आधार पर अगली चाल चलनी होती है जो आपके पास अभी उपलब्ध है।
    • परिणाम: AI इसमें ठीक था। वह निर्णय ले सकता था, हालांकि हमेशा लाभदायक निर्णय नहीं थे।
  2. रिस्क मैनेजर (हेजिंग):

    • काम: यह एक रस्सी पर चलने वाले (tightrope walker) की तरह है। AI को दो ऐसे स्टॉक चुनने होते हैं जो विपरीत दिशाओं में चलते हैं (या कम से कम अलग तरह से चलते हैं) और बाजार के ऊपर या नीचे जाने पर नहीं, बल्कि उनके बीच के अंतर पर दांव लगाना होता है।
    • चुनौती: इसके लिए लंबे समय तक दो अलग-अलग चीजों के बीच के संबंध को याद रखने की आवश्यकता होती है। यदि आप दूसरे स्टॉक को देखते समय पहले स्टॉक के विवरण को भूल जाते हैं, तो आप रस्सी से गिर जाएंगे।
    • परिणाम: AI इसमें संघर्ष करता रहा। उसे दो संपत्तियों के बीच दीर्घकालिक संबंध को ट्रैक करने में कठिनाई हुई।
  3. एनालिस्ट (मार्केट इनसाइट्स):

    • काम: AI को समाचार, कीमतें और रिपोर्ट पढ़नी होती है, और फिर हर सप्ताह एक पेशेवर निवेश रिपोर्ट लिखनी होती है जिसमें यह सिफारिश की गई हो कि खरीदना है या बेचना है।
    • चुनौती: यह केवल तथ्यों को खोजने के बारे में नहीं है; यह उन्हें एक सुसंगत कहानी में बुनने के बारे में है जो एक मानव निवेशक के लिए तर्कसंगत हो।
    • परिणाम: AI इसमें आश्चर्यजनक रूप से अच्छा था। इसने बहुत ही पेशेवर दिखने वाली, प्रवाहपूर्ण और सुव्यवस्थित रिपोर्ट लिखीं।
  4. ऑडिटर (ऑडिटिंग):

    • काम: AI को एक सख्त अकाउंटेंट की तरह काम करना है। उसे किसी कंपनी के आधिकारिक वित्तीय दस्तावेजों को देखना है और यह जांचना है कि क्या संख्याएं जटिल सरकारी नियमों के अनुसार सही ढंग से जुड़ती हैं।
    • चुनौती: यहाँ "शायद" या "यह सही लग रहा है" के लिए कोई जगह नहीं है। यह एक गणितीय पहेली है जहाँ यदि आप एक छोटा सा दशमलव भी चूक जाते हैं या किसी नियम की गलत व्याख्या करते हैं, तो पूरी चीज़ गलत हो जाती है।
    • परिणाम: यह सबसे कठिन काम था। AI अक्सर विफल रहा। वह अक्सर सख्त नियमों का पालन करने या गणित को सही ढंग से करने में असमर्थ रहा, भले ही वह कहानियाँ लिखने में अच्छा था।

बड़ी खोज: "प्रवाह" (Fluency) बनाम "विश्वसनीयता" (Reliability)

शोध पत्र ने AI के सोचने के तरीके में एक अजीब अंतर पाया।

  • "कहानीकार" की समस्या: AI प्रवाहपूर्ण जनरेशन (fluent generation) में उत्कृष्ट है। यदि आप इसे एक रिपोर्ट लिखने या किसी रुझान (trend) को समझाने के लिए कहते हैं, तो यह आत्मविश्वास से भरा और स्मार्ट लगता है। यह एक ऐसे छात्र की तरह है जो एक सुंदर निबंध तो लिख सकता है लेकिन गणित के टेस्ट में फेल हो जाता है।
  • "निष्पादक" (Executor) की समस्या: AI संरचित सत्यापन (structured verification) में खराब है। जब काम के लिए सख्त तर्क, तथ्यों की जांच या लंबे समय तक एक स्थिति (state) को याद रखने की आवश्यकता होती है (जैसे ऑडिटर या रिस्क मैनेजर के काम में), तो यह बिखर जाता है।

"टूलबॉक्स" की उपमा

शोधकर्ताओं ने विभिन्न "फ्रेमवर्क" (सॉफ्टवेयर शेल्स जिनके भीतर AI चलता है) का भी परीक्षण किया। उन्होंने पाया कि AI का प्रदर्शन इस बात पर बहुत अधिक निर्भर करता है कि उसे अपने उपकरणों का उपयोग करने की अनुमति कैसे दी गई थी।

  • "लाइटवेट" एजेंट: कल्पना कीजिए कि एक AI जो सब कुछ अपने दिमाग में करने की कोशिश करता है बिना कुछ लिखे। वह आसानी से भ्रमित हो जाता है, विशेष रूपकर लंबे कार्यों में।
  • "स्ट्रक्चर्ड" एजेंट: कल्पना कीजिए कि एक AI को एक चेकलिस्ट का उपयोग करने, हर चरण को लिखने और आगे बढ़ने से पहले अपने काम को सत्यापित करने के लिए मजबूर किया जाता है। इस संस्करण ने बहुत बेहतर प्रदर्शन किया।

सबक: यह केवल एक "स्मार्ट" मस्तिष्क (बेहतर AI मॉडल) होने के बारे में नहीं है; यह उस मस्तिष्क को प्रबंधित करने के लिए एक बेहतर सिस्टम होने के बारे में है। एक स्मार्ट मस्तिष्क बिना एक अच्छे सिस्टम के, जो उसे ट्रैक पर रख सके, उच्च-जोखिम वाले कार्यों में गलतियाँ करेगा।

निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि हालांकि AI वित्त के बारे में बात करने में बेहतर हो रहा है, लेकिन यह अभी भी एक पेशेवर वित्तीय कार्यकर्ता का काम करने के लिए तैयार नहीं है। यह रिपोर्ट लिख सकता है (मार्केट इनसाइट्स), लेकिन यह जोखिम प्रबंधन (हेजिंग) या गणित के सत्यापन (ऑडिटिंग) में संघर्ष करता है।

शोधकर्ताओं ने HERCULEAN को इसलिए बनाया ताकि वे हमें दिखा सकें कि उनकी ये "मांसपेशियां" कहाँ कमजोर हैं, ताकि डेवलपर्स ऐसे बेहतर सिस्टम बना सकें जो न केवल स्मार्ट लगें, बल्कि वास्तव में विश्वसनीय रूप से काम भी करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →