← नवीनतम पेपर
🤖 machine learning

GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

यह शोध पत्र GAUGE को प्रस्तुत करता है, जो एक नया बेंचमार्क है जो किसी एकल "स्वर्ण" (गोल्डन) उत्तर के बजाय प्रेक्षित विश्लेषक प्रथाओं के विरुद्ध एआई-निर्मित वित्तीय मॉडलों का मूल्यांकन करता है, जिससे यह पता चलता है कि जबकि वर्तमान एजेंट यांत्रिक मॉडल निर्माण में उत्कृष्ट हैं, वे मूल्यांकन निर्णय लेने में अभी भी मानव पेशेवरों से काफी पीछे हैं।

मूल लेखक: Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

प्रकाशित 2026-07-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कुकिंग शो में जज हैं। आमतौर पर, जजों के पास एक ही "परफेक्ट" रेसिपी कार्ड होता है। यदि किसी प्रतियोगी का व्यंजन उस कार्ड से थोड़ा भी अलग स्वाद देता है, तो वह अंक खो देता है। लेकिन क्या होगा यदि लासग्ना (lasagna) बनाने के दस अलग-अलग तरीके हों? क्या होगा यदि "परफेक्ट" रेसिपी केवल एक व्यक्ति की राय हो, और प्रतियोगी का संस्करण भी उतना ही स्वादिष्ट हो लेकिन उसमें अलग मसालों का उपयोग किया गया हो? यही वह समस्या है जिसका सामना वैज्ञानिक जटिल कार्यों जैसे कि वित्तीय मॉडलिंग (financial modeling) पर एआई (AI) का परीक्षण करते समय करते हैं। वित्तीय मॉडलिंग एक कंपनी के भविष्य के लिए एक विस्तृत भविष्यवाणी मशीन बनाने जैसा है; इसमें ठोस तथ्य (जैसे पिछले बिक्री के आंकड़े) और शिक्षित अनुमानों (जैसे कि कंपनी कितनी तेजी से बढ़ेगी) का मिश्रण होता है। दशकों से, हम एआई का परीक्षण उसके अनुमानों की तुलना किसी एक विशेषज्ञ के उत्तर से करके करते रहे हैं। लेकिन यदि विशेषज्ञ स्वयं भी सबसे अच्छे अनुमान पर असहमत हैं, तो एआई को उसके एक अलग, फिर भी तर्कसंगली उत्तर के लिए दंडित करना उचित नहीं लगता। यह शोध पत्र पूछता है: जब केवल एक "सही" उत्तर न हो, तो हम एआई को ग्रेड कैसे दें?

इस अध्ययन के पीछे के शोधकर्ताओं ने, जिसका शीर्षक GAUGE है, एक ही परफेक्ट वित्तीय मॉडल होने का ढोंग करना बंद करने का निर्णय लिया। उन्होंने यह देखने के लिए एक नया परीक्षण मैदान बनाया कि क्या एआई एजेंट इन जटिल वित्तीय "भविष्यवाणी मशीनों" को बना सकते हैं और अधिक महत्वपूर्ण बात यह है कि क्या वे वे निर्णय ले सकते हैं जो मानव विशेषज्ञ लेते हैं।

सबसे पहले, उन्होंने ग्रेडिंग के पुराने तरीके का परीक्षण किया। उन्होंने एक ही कंपनियों के लिए विभिन्न मानव विशेषज्ञों द्वारा बनाए गए 108 वित्तीय मॉडलों के जोड़े लिए। जब उन्होंने पुराने "एकल परफेक्ट उत्तर" के नियम का उपयोग करके एक विशेषज्ञ के मॉडल को दूसरे के विरुद्ध ग्रेड किया, तो परिणाम चौंकाने वाले थे। औसत स्कोर 1.0 में से केवल 0.33 था। वास्तव में, 92.6% जोड़े 0.70 से नीचे स्कोर करते थे। इसका मतलब है कि यहाँ तक कि पेशेवर इंसान, जो सभी विशेषज्ञ हैं, अक्सर इतना असहमत होते हैं कि यदि आप एक को "सत्य" मान लें, तो आप दूसरे को फेल कर देंगे। यह पता चला है कि वित्त में, "अलग" होने का मतलब "गलत" होना नहीं है।

इसे ठीक करने के लिए, टीम ने GAUGE (बिना किसी गोल्डन आंसर के एजेंट-निर्मित वित्तीय मॉडलों की ग्रेडिंग) बनाया। एक एकल रेसिपी कार्ड के बजाय, उन्होंने वास्तविक विशेषज्ञों के व्यवहार पर आधारित एक "सेफ्टी एनवेलप" (सुरक्षा लिफाफा) बनाया। कल्पना कीजिए कि एक लक्ष्य है जहाँ बुल्सआई (bullseye) एक अकेला बिंदु नहीं, बल्कि एक चौड़ा घेरा है। यदि किसी एआई का अनुमान उस घेरे के भीतर कहीं भी आता है जो "तर्कसंगत विशेषज्ञ व्यवहार" का है, तो उसे क्रेडिट मिलता है। यह प्रणाली दो चीजें जांचती है:

  1. मैकेनिक्स (Mechanics): क्या गणित काम कर रहा था? क्या स्प्रेडशीट संतुलित थी? (जैसे यह जांचना कि ओवन वास्तव में चालू किया गया था या नहीं)।
  2. जजमेंट (Judgment): क्या एआई के अनुमान उस सीमा के भीतर थे जिसे वास्तविक विशेषज्ञ तर्कसंगत मानते हैं? (जैसे यह जांचना कि मसाला एक अच्छे शेफ के स्वाद की सीमा के भीतर है या नहीं)।

उन्होंने इस नई प्रणाली पर 24 अलग-अलग एआई एजेंटों का परीक्षण किया, साथ ही वित्त के छात्रों से लेकर वरिष्ठ विश्लेषकों तक के 55 मनुष्यों के एक समूह का भी। यहाँ उन्हें क्या मिला:

  • एआई गणित में अच्छा हो रहा है, लेकिन अंतर्ज्ञान (gut feeling) में बुरा है। एआई एजेंट मैकेनिकल भागों में उत्कृष्ट थे। सर्वश्रेष्ठ एआई ने 93% मैकेनिकल चेक (यह सुनिश्चित करना कि स्प्रेडशीट फॉर्मूला सही हैं) पास किए। हालांकि, जब निर्णय लेने वाले भागों (वास्तविक भविष्यवाणियां करने) की बात आई, तो सर्वश्रेष्ठ एआई केवल 78% ही पास हो सका।
  • "गैप" (अंतर) वास्तविक है। औसतन, एआई एजेंट मॉडल बनाने में मूल्यांकन संबंधी निर्णयों की तुलना में 26 अंक बेहतर थे। वे कार तो बना सकते हैं, लेकिन वे अभी तक उसे चलाने में बहुत अच्छे नहीं हैं।
  • इंसान अभी भी जीत रहे हैं। सर्वश्रेष्ठ एआई ने 53.4 स्कोर किया। यह औसत वित्त छात्र (43.2) से बेहतर था लेकिन प्रत्येक वरिष्ठ विश्लेषक (जिनका औसत 88.3 था) और अधिकांश जूनियर विश्लेषकों से कम था। एआई होमवर्क करने के लिए पर्याप्त स्मार्ट है, लेकिन बॉस बनने के लिए अभी पर्याप्त स्मार्ट नहीं है।

अध्ययन बताता है कि हालांकि एआई जटिल वित्तीय मॉडल बनाने में बहुत सक्षम हो रहा है, लेकिन सबसे कठिन हिस्सा—वे सूक्ष्म, तर्कसंगत निर्णय लेना जिनका उपयोग विशेषज्ञ कंपनी के मूल्यांकन के लिए करते हैं—एक महत्वपूर्ण चुनौती बनी हुई है। लेखकों ने केवल एक स्कोर नहीं खोजा; उन्होंने यह साबित किया कि पुराने तरीके से ग्रेडिंग करना (एक पूर्ण उत्तर की तलाश करना) इंसानों और मशीनों दोनों के लिए अनुचित था, और उन्होंने प्रगति को मापने का एक नया तरीका पेश किया जो विशेषज्ञ असहमति की वास्तविक वास्तविकता का सम्मान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →