← नवीनतम पेपर
🤖 AI

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

यह शोध पत्र वित्तीय एआई एजेंटों के मूल्यांकन के लिए एक बेंचमार्क, FinProBench, और रोल-ग्राउंडेड रूब्रिक कंस्ट्रक्शन (RGRC) को प्रस्तुत करता है, जो एक ऐसा पाइपलाइन है जो पेशेवर डिलिवरेबल्स से मूल्यांकन मानदंड प्राप्त करता है ताकि प्रभावी रूप से अंतर्निहित मानकों को पकड़ सके और भूमिका-विशिष्ट वित्तीय कार्यों में प्रॉम्प्ट-आधारित विधियों की तुलना में काफी बेहतर प्रदर्शन कर सके।

मूल लेखक: Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

प्रकाशित 2026-08-06
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक पेशेवर, जैसे कि डॉक्टर, वकील या वित्तीय विश्लेषक (फाइनांशियल एनालिस्ट) बनना सिखाने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, हमारे पास ये सुपर-स्मार्ट "एजेंट्स" हैं जो चैट कर सकते हैं, कोड लिख सकते हैं और पहेलियाँ सुलझा सकते हैं। लेकिन हमें यह कैसे पता चलेगा कि वे वास्तव में एक अच्छा काम कर रहे हैं, या सिर्फ वैसा लग रहे हैं? यह AI मूल्यांकन (इवैल्यूएशन) के क्षेत्र में एक बड़ा सवाल है। लंबे समय तक, हमने AI का परीक्षण सरल प्रश्नों के साथ किया है जिनके उत्तर सही या गलत होते हैं, जैसे कि एक बहुविकल्पीय प्रश्नोत्तरी (मल्टीपल चॉइस क्विज़)। लेकिन वास्तविक पेशेवर काम एक क्विज़ नहीं है; यह एक जटिल और विस्तृत प्रोजेक्ट है, जैसे कि 50 पन्नों की रिपोर्ट लिखना या कोई वित्तीय मॉडल बनाना। इस तरह के काम को आंकने के लिए, हमें एक "रूब्रिक" (rubric) की आवश्यकता होती है—एक विस्तृत स्कोरिंग शीट जो हमें ठीक से बताती है कि किसी काम को उत्कृष्ट बनाम केवल ठीक बनाने वाले कारक क्या हैं। समस्या यह है कि इनमें से अधिकांश स्कोरिंग शीट इस अनुमान पर आधारित होती हैं कि AI को क्या करना चाहिए, या वे AI के अपने उत्तरों को देखकर बनाई जाती हैं, जो कि एक छात्र से अपना होमवर्क खुद ग्रेड करने के लिए कहने जैसा है। हमें एक ऐसा तरीका चाहिए जिससे हम इन स्कोरिंग शीट को इस आधार पर बना सकें कि वास्तविक मनुष्य वास्तव में अपने काम में क्या करते हैं।

यह पेपर वित्तीय AI एजेंटों का परीक्षण करने के लिए एक नया तरीका पेश करता है जिसे FinProBench कहा जाता है, साथ ही स्कोरिंग शीट बनाने की एक चतुर विधि, जिसे Role-Grounded Rubric Construction (RGRC) के रूप में जाना जाता है। RGRC को एक जासूस के रूप में समझें जो नियमों को समझने के लिए संदिग्धों (AI) को नहीं देखता, बल्कि अपराध स्थल (वास्तविक, पेशेवर कार्य दस्तावेज़ों) का अध्ययन करता है ताकि यह देख सके कि विशेषज्ञों ने वास्तव में इसे कैसे किया। शोधकर्ताओं ने 1,700 से अधिक वास्तविक दस्तावेज़ एकत्र किए—जैसे कि निवेश रिपोर्ट और अनुपालन जाँच (कम्प्लायंस चेक)—जो वास्तविक वित्तीय पेशेवरों द्वारा लिखे गए थे। उन्होंने इन वास्तविक उदाहरणों का उपयोग AI को अन्य AI कार्यों को ग्रेड करना सिखाने के लिए किया।

यहाँ वह मोड़ आया जो उन्होंने खोजा: यह काम पर निर्भर करता है। सामान्य, रोज़मर्रा के वित्तीय कार्यों के लिए जो पहले से ही अच्छी तरह से ज्ञात हैं (जैसे कि एक मानक बाजार रिपोर्ट लिखना), केवल AI को "अच्छा काम करने" के लिए कहना (एक प्रॉम्प्ट का उपयोग करना) उनके शानदार नए तरीके के लगभग बराबर ही काम करता है। हालाँकि, विशेष, कठिन भूमिकाओं के लिए जहाँ नियम छिपे हुए या बहुत विशिष्ट होते हैं (जैसे कि एक विशिष्ट बीमा एक्चुरी), वहां साधारण "अच्छे से पूछने" वाला दृष्टिकोण बुरी तरह विफल हो जाता है। उन मामलों में, RGRC विधि, जो वास्तविक मानवीय डिलिवरेबल्स से सीखती है, एक गेम-चेंजर है, जो साधारण विधि के 78% के मुकाबले 99.1% आवश्यक मानकों को पकड़ लेती है।

जब उन्होंने इन नई, उच्च-गुणवत्ता वाली स्कोरिंग शीट का उपयोग करके वास्तविक मानव विशेषज्ञों के विरुद्ध AI एजेंटों का परीक्षण किया, तो मानव अभी भी औसतन जीत गए, जिनका स्कोर 100 में से 73.7 था, जबकि सर्वश्रेष्ठ AI एजेंट लगभग 70 के आसपास रहे। लेकिन यह पूरी तरह से एकतरफा हार नहीं थी। AI सिस्टम के अपने सुपरपावर थे: कुछ गणित में गहराई तक जाने में बेहतर थे, जबकि अन्य फॉर्मेटिंग में बेहतरीन थे। हालाँकि, मनुष्य सबसे सुसंगत ऑल-राउंडर थे, जिन्होंने संरचना, डेटा सटीकता और अनुपालन नियमों को बखूबी निभाया। पेपर सुझाव देता है कि हालांकि AI बहुत अच्छा हो रहा है, उसे वास्तव में जटिल नौकरियों में महारत हासिल करने के लिए वास्तविक पेशेवरों के "टैसिट" (अनकहे) रहस्यों से सीखने की आवश्यकता है। सबसे अच्छी बात? क्योंकि उन्होंने प्रत्येक भूमिका के लिए एक "मास्टर स्कोरिंग शीट" बनाई थी, वे इसे कई अलग-अलग कार्यों के लिए पुन: उपयोग कर सकते थे, जिससे बहुत समय बचा—हर असाइनमेंट के लिए एक नई ग्रेडिंग शीट बनाने की तुलना में लगभग 6.7 गुना तेज़।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →