Herculean: An Agentic Benchmark for Financial Intelligence
यह शोध पत्र हर्कुलियन (Herculean) को प्रस्तुत करता है, जो वित्तीय बुद्धिमत्ता के लिए पहला एजेंटिक बेंचमार्क है जो मानकीकृत MCP-आधारित वातावरणों का उपयोग करके चार जटिल वर्कफ़्लो (ट्रेडिंग, हेजिंग, मार्केट इनसाइट्स और ऑडिटिंग) में AI एजेंटों का मूल्यांकन करता है, जिससे यह पता चलता है कि जहाँ एजेंट ट्रेडिंग और इनसाइट्स पर अच्छा प्रदर्शन करते हैं, वहीं वे हेजिंग और ऑडिटिंग के लिए आवश्यक दीर्घकालिक समन्वय (long-horizon coordination) और संरचित सत्यापन (structured verification) में काफी संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक नया वित्तीय सहायक (financial assistant) काम पर रख रहे हैं। अतीत में, आप उन्हें परखने के लिए पूछ सकते थे, "कल एप्पल का स्टॉक प्राइस क्या था?" या "इस अर्निंग रिपोर्ट का सारांश दें।" यदि वे सही उत्तर देते, तो आप उन्हें बुद्धिमान समझते।
लेकिन इस शोध पत्र के लेखक तर्क देते हैं कि एक सही उत्तर देना, वास्तविक काम करने में सक्षम होने के समान नहीं है। उन्होंने एक नया परीक्षण बनाया जिसे HERCULEAN कहा जाता है (एक नाम जो किसी "हर्कुलियन" या विशाल कार्य की अवधारणा से प्रेरित है) यह देखने के लिए कि क्या AI एजेंट वास्तव में पेशेवर वित्तीय विशेषज्ञों की तरह काम कर सकते हैं, न कि केवल सामान्य ज्ञान के प्रश्नों के उत्तर दे सकते हैं।
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
वे चार "काम" जो उन्होंने AI को दिए
एक साधारण क्विज़ के बजाय, शोधकर्ताओं ने AI को चार अलग-अलग, जटिल काम दिए जो वास्तविक मनुष्य हर दिन करते हैं। इसे एक वित्तीय कारखाने में चार अलग-अलग शिफ्टों की तरह समझें:
ट्रेडर (ट्रेडिंग):
- काम: तीन महीने तक हर दिन, AI को यह निर्णय लेना होगा कि किसी विशिष्ट स्टॉक को खरीदना है, बेचना है या होल्ड करना है।
- चुनौती: यह शतरंज खेलने जैसा है जहाँ बोर्ड हर दिन बदलता है, और आप भविष्य नहीं देख सकते। आपको एक चाल चलनी होती है, उसके परिणामों के साथ जीना होता है, और फिर केवल उसी जानकारी के आधार पर अगली चाल चलनी होती है जो आपके पास अभी उपलब्ध है।
- परिणाम: AI इसमें ठीक था। वह निर्णय ले सकता था, हालांकि हमेशा लाभदायक निर्णय नहीं थे।
रिस्क मैनेजर (हेजिंग):
- काम: यह एक रस्सी पर चलने वाले (tightrope walker) की तरह है। AI को दो ऐसे स्टॉक चुनने होते हैं जो विपरीत दिशाओं में चलते हैं (या कम से कम अलग तरह से चलते हैं) और बाजार के ऊपर या नीचे जाने पर नहीं, बल्कि उनके बीच के अंतर पर दांव लगाना होता है।
- चुनौती: इसके लिए लंबे समय तक दो अलग-अलग चीजों के बीच के संबंध को याद रखने की आवश्यकता होती है। यदि आप दूसरे स्टॉक को देखते समय पहले स्टॉक के विवरण को भूल जाते हैं, तो आप रस्सी से गिर जाएंगे।
- परिणाम: AI इसमें संघर्ष करता रहा। उसे दो संपत्तियों के बीच दीर्घकालिक संबंध को ट्रैक करने में कठिनाई हुई।
एनालिस्ट (मार्केट इनसाइट्स):
- काम: AI को समाचार, कीमतें और रिपोर्ट पढ़नी होती है, और फिर हर सप्ताह एक पेशेवर निवेश रिपोर्ट लिखनी होती है जिसमें यह सिफारिश की गई हो कि खरीदना है या बेचना है।
- चुनौती: यह केवल तथ्यों को खोजने के बारे में नहीं है; यह उन्हें एक सुसंगत कहानी में बुनने के बारे में है जो एक मानव निवेशक के लिए तर्कसंगत हो।
- परिणाम: AI इसमें आश्चर्यजनक रूप से अच्छा था। इसने बहुत ही पेशेवर दिखने वाली, प्रवाहपूर्ण और सुव्यवस्थित रिपोर्ट लिखीं।
ऑडिटर (ऑडिटिंग):
- काम: AI को एक सख्त अकाउंटेंट की तरह काम करना है। उसे किसी कंपनी के आधिकारिक वित्तीय दस्तावेजों को देखना है और यह जांचना है कि क्या संख्याएं जटिल सरकारी नियमों के अनुसार सही ढंग से जुड़ती हैं।
- चुनौती: यहाँ "शायद" या "यह सही लग रहा है" के लिए कोई जगह नहीं है। यह एक गणितीय पहेली है जहाँ यदि आप एक छोटा सा दशमलव भी चूक जाते हैं या किसी नियम की गलत व्याख्या करते हैं, तो पूरी चीज़ गलत हो जाती है।
- परिणाम: यह सबसे कठिन काम था। AI अक्सर विफल रहा। वह अक्सर सख्त नियमों का पालन करने या गणित को सही ढंग से करने में असमर्थ रहा, भले ही वह कहानियाँ लिखने में अच्छा था।
बड़ी खोज: "प्रवाह" (Fluency) बनाम "विश्वसनीयता" (Reliability)
शोध पत्र ने AI के सोचने के तरीके में एक अजीब अंतर पाया।
- "कहानीकार" की समस्या: AI प्रवाहपूर्ण जनरेशन (fluent generation) में उत्कृष्ट है। यदि आप इसे एक रिपोर्ट लिखने या किसी रुझान (trend) को समझाने के लिए कहते हैं, तो यह आत्मविश्वास से भरा और स्मार्ट लगता है। यह एक ऐसे छात्र की तरह है जो एक सुंदर निबंध तो लिख सकता है लेकिन गणित के टेस्ट में फेल हो जाता है।
- "निष्पादक" (Executor) की समस्या: AI संरचित सत्यापन (structured verification) में खराब है। जब काम के लिए सख्त तर्क, तथ्यों की जांच या लंबे समय तक एक स्थिति (state) को याद रखने की आवश्यकता होती है (जैसे ऑडिटर या रिस्क मैनेजर के काम में), तो यह बिखर जाता है।
"टूलबॉक्स" की उपमा
शोधकर्ताओं ने विभिन्न "फ्रेमवर्क" (सॉफ्टवेयर शेल्स जिनके भीतर AI चलता है) का भी परीक्षण किया। उन्होंने पाया कि AI का प्रदर्शन इस बात पर बहुत अधिक निर्भर करता है कि उसे अपने उपकरणों का उपयोग करने की अनुमति कैसे दी गई थी।
- "लाइटवेट" एजेंट: कल्पना कीजिए कि एक AI जो सब कुछ अपने दिमाग में करने की कोशिश करता है बिना कुछ लिखे। वह आसानी से भ्रमित हो जाता है, विशेष रूपकर लंबे कार्यों में।
- "स्ट्रक्चर्ड" एजेंट: कल्पना कीजिए कि एक AI को एक चेकलिस्ट का उपयोग करने, हर चरण को लिखने और आगे बढ़ने से पहले अपने काम को सत्यापित करने के लिए मजबूर किया जाता है। इस संस्करण ने बहुत बेहतर प्रदर्शन किया।
सबक: यह केवल एक "स्मार्ट" मस्तिष्क (बेहतर AI मॉडल) होने के बारे में नहीं है; यह उस मस्तिष्क को प्रबंधित करने के लिए एक बेहतर सिस्टम होने के बारे में है। एक स्मार्ट मस्तिष्क बिना एक अच्छे सिस्टम के, जो उसे ट्रैक पर रख सके, उच्च-जोखिम वाले कार्यों में गलतियाँ करेगा।
निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि हालांकि AI वित्त के बारे में बात करने में बेहतर हो रहा है, लेकिन यह अभी भी एक पेशेवर वित्तीय कार्यकर्ता का काम करने के लिए तैयार नहीं है। यह रिपोर्ट लिख सकता है (मार्केट इनसाइट्स), लेकिन यह जोखिम प्रबंधन (हेजिंग) या गणित के सत्यापन (ऑडिटिंग) में संघर्ष करता है।
शोधकर्ताओं ने HERCULEAN को इसलिए बनाया ताकि वे हमें दिखा सकें कि उनकी ये "मांसपेशियां" कहाँ कमजोर हैं, ताकि डेवलपर्स ऐसे बेहतर सिस्टम बना सकें जो न केवल स्मार्ट लगें, बल्कि वास्तव में विश्वसनीय रूप से काम भी करें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।