FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables
यह शोध पत्र वित्तीय एआई एजेंटों के मूल्यांकन के लिए एक बेंचमार्क, FinProBench, और रोल-ग्राउंडेड रूब्रिक कंस्ट्रक्शन (RGRC) को प्रस्तुत करता है, जो एक ऐसा पाइपलाइन है जो पेशेवर डिलिवरेबल्स से मूल्यांकन मानदंड प्राप्त करता है ताकि प्रभावी रूप से अंतर्निहित मानकों को पकड़ सके और भूमिका-विशिष्ट वित्तीय कार्यों में प्रॉम्प्ट-आधारित विधियों की तुलना में काफी बेहतर प्रदर्शन कर सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक पेशेवर, जैसे कि डॉक्टर, वकील या वित्तीय विश्लेषक (फाइनांशियल एनालिस्ट) बनना सिखाने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, हमारे पास ये सुपर-स्मार्ट "एजेंट्स" हैं जो चैट कर सकते हैं, कोड लिख सकते हैं और पहेलियाँ सुलझा सकते हैं। लेकिन हमें यह कैसे पता चलेगा कि वे वास्तव में एक अच्छा काम कर रहे हैं, या सिर्फ वैसा लग रहे हैं? यह AI मूल्यांकन (इवैल्यूएशन) के क्षेत्र में एक बड़ा सवाल है। लंबे समय तक, हमने AI का परीक्षण सरल प्रश्नों के साथ किया है जिनके उत्तर सही या गलत होते हैं, जैसे कि एक बहुविकल्पीय प्रश्नोत्तरी (मल्टीपल चॉइस क्विज़)। लेकिन वास्तविक पेशेवर काम एक क्विज़ नहीं है; यह एक जटिल और विस्तृत प्रोजेक्ट है, जैसे कि 50 पन्नों की रिपोर्ट लिखना या कोई वित्तीय मॉडल बनाना। इस तरह के काम को आंकने के लिए, हमें एक "रूब्रिक" (rubric) की आवश्यकता होती है—एक विस्तृत स्कोरिंग शीट जो हमें ठीक से बताती है कि किसी काम को उत्कृष्ट बनाम केवल ठीक बनाने वाले कारक क्या हैं। समस्या यह है कि इनमें से अधिकांश स्कोरिंग शीट इस अनुमान पर आधारित होती हैं कि AI को क्या करना चाहिए, या वे AI के अपने उत्तरों को देखकर बनाई जाती हैं, जो कि एक छात्र से अपना होमवर्क खुद ग्रेड करने के लिए कहने जैसा है। हमें एक ऐसा तरीका चाहिए जिससे हम इन स्कोरिंग शीट को इस आधार पर बना सकें कि वास्तविक मनुष्य वास्तव में अपने काम में क्या करते हैं।
यह पेपर वित्तीय AI एजेंटों का परीक्षण करने के लिए एक नया तरीका पेश करता है जिसे FinProBench कहा जाता है, साथ ही स्कोरिंग शीट बनाने की एक चतुर विधि, जिसे Role-Grounded Rubric Construction (RGRC) के रूप में जाना जाता है। RGRC को एक जासूस के रूप में समझें जो नियमों को समझने के लिए संदिग्धों (AI) को नहीं देखता, बल्कि अपराध स्थल (वास्तविक, पेशेवर कार्य दस्तावेज़ों) का अध्ययन करता है ताकि यह देख सके कि विशेषज्ञों ने वास्तव में इसे कैसे किया। शोधकर्ताओं ने 1,700 से अधिक वास्तविक दस्तावेज़ एकत्र किए—जैसे कि निवेश रिपोर्ट और अनुपालन जाँच (कम्प्लायंस चेक)—जो वास्तविक वित्तीय पेशेवरों द्वारा लिखे गए थे। उन्होंने इन वास्तविक उदाहरणों का उपयोग AI को अन्य AI कार्यों को ग्रेड करना सिखाने के लिए किया।
यहाँ वह मोड़ आया जो उन्होंने खोजा: यह काम पर निर्भर करता है। सामान्य, रोज़मर्रा के वित्तीय कार्यों के लिए जो पहले से ही अच्छी तरह से ज्ञात हैं (जैसे कि एक मानक बाजार रिपोर्ट लिखना), केवल AI को "अच्छा काम करने" के लिए कहना (एक प्रॉम्प्ट का उपयोग करना) उनके शानदार नए तरीके के लगभग बराबर ही काम करता है। हालाँकि, विशेष, कठिन भूमिकाओं के लिए जहाँ नियम छिपे हुए या बहुत विशिष्ट होते हैं (जैसे कि एक विशिष्ट बीमा एक्चुरी), वहां साधारण "अच्छे से पूछने" वाला दृष्टिकोण बुरी तरह विफल हो जाता है। उन मामलों में, RGRC विधि, जो वास्तविक मानवीय डिलिवरेबल्स से सीखती है, एक गेम-चेंजर है, जो साधारण विधि के 78% के मुकाबले 99.1% आवश्यक मानकों को पकड़ लेती है।
जब उन्होंने इन नई, उच्च-गुणवत्ता वाली स्कोरिंग शीट का उपयोग करके वास्तविक मानव विशेषज्ञों के विरुद्ध AI एजेंटों का परीक्षण किया, तो मानव अभी भी औसतन जीत गए, जिनका स्कोर 100 में से 73.7 था, जबकि सर्वश्रेष्ठ AI एजेंट लगभग 70 के आसपास रहे। लेकिन यह पूरी तरह से एकतरफा हार नहीं थी। AI सिस्टम के अपने सुपरपावर थे: कुछ गणित में गहराई तक जाने में बेहतर थे, जबकि अन्य फॉर्मेटिंग में बेहतरीन थे। हालाँकि, मनुष्य सबसे सुसंगत ऑल-राउंडर थे, जिन्होंने संरचना, डेटा सटीकता और अनुपालन नियमों को बखूबी निभाया। पेपर सुझाव देता है कि हालांकि AI बहुत अच्छा हो रहा है, उसे वास्तव में जटिल नौकरियों में महारत हासिल करने के लिए वास्तविक पेशेवरों के "टैसिट" (अनकहे) रहस्यों से सीखने की आवश्यकता है। सबसे अच्छी बात? क्योंकि उन्होंने प्रत्येक भूमिका के लिए एक "मास्टर स्कोरिंग शीट" बनाई थी, वे इसे कई अलग-अलग कार्यों के लिए पुन: उपयोग कर सकते थे, जिससे बहुत समय बचा—हर असाइनमेंट के लिए एक नई ग्रेडिंग शीट बनाने की तुलना में लगभग 6.7 गुना तेज़।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।