GAUGE: Grading Agent-Built Financial Models Without a Golden Answer
यह शोध पत्र GAUGE को प्रस्तुत करता है, जो एक नया बेंचमार्क है जो किसी एकल "स्वर्ण" (गोल्डन) उत्तर के बजाय प्रेक्षित विश्लेषक प्रथाओं के विरुद्ध एआई-निर्मित वित्तीय मॉडलों का मूल्यांकन करता है, जिससे यह पता चलता है कि जबकि वर्तमान एजेंट यांत्रिक मॉडल निर्माण में उत्कृष्ट हैं, वे मूल्यांकन निर्णय लेने में अभी भी मानव पेशेवरों से काफी पीछे हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कुकिंग शो में जज हैं। आमतौर पर, जजों के पास एक ही "परफेक्ट" रेसिपी कार्ड होता है। यदि किसी प्रतियोगी का व्यंजन उस कार्ड से थोड़ा भी अलग स्वाद देता है, तो वह अंक खो देता है। लेकिन क्या होगा यदि लासग्ना (lasagna) बनाने के दस अलग-अलग तरीके हों? क्या होगा यदि "परफेक्ट" रेसिपी केवल एक व्यक्ति की राय हो, और प्रतियोगी का संस्करण भी उतना ही स्वादिष्ट हो लेकिन उसमें अलग मसालों का उपयोग किया गया हो? यही वह समस्या है जिसका सामना वैज्ञानिक जटिल कार्यों जैसे कि वित्तीय मॉडलिंग (financial modeling) पर एआई (AI) का परीक्षण करते समय करते हैं। वित्तीय मॉडलिंग एक कंपनी के भविष्य के लिए एक विस्तृत भविष्यवाणी मशीन बनाने जैसा है; इसमें ठोस तथ्य (जैसे पिछले बिक्री के आंकड़े) और शिक्षित अनुमानों (जैसे कि कंपनी कितनी तेजी से बढ़ेगी) का मिश्रण होता है। दशकों से, हम एआई का परीक्षण उसके अनुमानों की तुलना किसी एक विशेषज्ञ के उत्तर से करके करते रहे हैं। लेकिन यदि विशेषज्ञ स्वयं भी सबसे अच्छे अनुमान पर असहमत हैं, तो एआई को उसके एक अलग, फिर भी तर्कसंगली उत्तर के लिए दंडित करना उचित नहीं लगता। यह शोध पत्र पूछता है: जब केवल एक "सही" उत्तर न हो, तो हम एआई को ग्रेड कैसे दें?
इस अध्ययन के पीछे के शोधकर्ताओं ने, जिसका शीर्षक GAUGE है, एक ही परफेक्ट वित्तीय मॉडल होने का ढोंग करना बंद करने का निर्णय लिया। उन्होंने यह देखने के लिए एक नया परीक्षण मैदान बनाया कि क्या एआई एजेंट इन जटिल वित्तीय "भविष्यवाणी मशीनों" को बना सकते हैं और अधिक महत्वपूर्ण बात यह है कि क्या वे वे निर्णय ले सकते हैं जो मानव विशेषज्ञ लेते हैं।
सबसे पहले, उन्होंने ग्रेडिंग के पुराने तरीके का परीक्षण किया। उन्होंने एक ही कंपनियों के लिए विभिन्न मानव विशेषज्ञों द्वारा बनाए गए 108 वित्तीय मॉडलों के जोड़े लिए। जब उन्होंने पुराने "एकल परफेक्ट उत्तर" के नियम का उपयोग करके एक विशेषज्ञ के मॉडल को दूसरे के विरुद्ध ग्रेड किया, तो परिणाम चौंकाने वाले थे। औसत स्कोर 1.0 में से केवल 0.33 था। वास्तव में, 92.6% जोड़े 0.70 से नीचे स्कोर करते थे। इसका मतलब है कि यहाँ तक कि पेशेवर इंसान, जो सभी विशेषज्ञ हैं, अक्सर इतना असहमत होते हैं कि यदि आप एक को "सत्य" मान लें, तो आप दूसरे को फेल कर देंगे। यह पता चला है कि वित्त में, "अलग" होने का मतलब "गलत" होना नहीं है।
इसे ठीक करने के लिए, टीम ने GAUGE (बिना किसी गोल्डन आंसर के एजेंट-निर्मित वित्तीय मॉडलों की ग्रेडिंग) बनाया। एक एकल रेसिपी कार्ड के बजाय, उन्होंने वास्तविक विशेषज्ञों के व्यवहार पर आधारित एक "सेफ्टी एनवेलप" (सुरक्षा लिफाफा) बनाया। कल्पना कीजिए कि एक लक्ष्य है जहाँ बुल्सआई (bullseye) एक अकेला बिंदु नहीं, बल्कि एक चौड़ा घेरा है। यदि किसी एआई का अनुमान उस घेरे के भीतर कहीं भी आता है जो "तर्कसंगत विशेषज्ञ व्यवहार" का है, तो उसे क्रेडिट मिलता है। यह प्रणाली दो चीजें जांचती है:
- मैकेनिक्स (Mechanics): क्या गणित काम कर रहा था? क्या स्प्रेडशीट संतुलित थी? (जैसे यह जांचना कि ओवन वास्तव में चालू किया गया था या नहीं)।
- जजमेंट (Judgment): क्या एआई के अनुमान उस सीमा के भीतर थे जिसे वास्तविक विशेषज्ञ तर्कसंगत मानते हैं? (जैसे यह जांचना कि मसाला एक अच्छे शेफ के स्वाद की सीमा के भीतर है या नहीं)।
उन्होंने इस नई प्रणाली पर 24 अलग-अलग एआई एजेंटों का परीक्षण किया, साथ ही वित्त के छात्रों से लेकर वरिष्ठ विश्लेषकों तक के 55 मनुष्यों के एक समूह का भी। यहाँ उन्हें क्या मिला:
- एआई गणित में अच्छा हो रहा है, लेकिन अंतर्ज्ञान (gut feeling) में बुरा है। एआई एजेंट मैकेनिकल भागों में उत्कृष्ट थे। सर्वश्रेष्ठ एआई ने 93% मैकेनिकल चेक (यह सुनिश्चित करना कि स्प्रेडशीट फॉर्मूला सही हैं) पास किए। हालांकि, जब निर्णय लेने वाले भागों (वास्तविक भविष्यवाणियां करने) की बात आई, तो सर्वश्रेष्ठ एआई केवल 78% ही पास हो सका।
- "गैप" (अंतर) वास्तविक है। औसतन, एआई एजेंट मॉडल बनाने में मूल्यांकन संबंधी निर्णयों की तुलना में 26 अंक बेहतर थे। वे कार तो बना सकते हैं, लेकिन वे अभी तक उसे चलाने में बहुत अच्छे नहीं हैं।
- इंसान अभी भी जीत रहे हैं। सर्वश्रेष्ठ एआई ने 53.4 स्कोर किया। यह औसत वित्त छात्र (43.2) से बेहतर था लेकिन प्रत्येक वरिष्ठ विश्लेषक (जिनका औसत 88.3 था) और अधिकांश जूनियर विश्लेषकों से कम था। एआई होमवर्क करने के लिए पर्याप्त स्मार्ट है, लेकिन बॉस बनने के लिए अभी पर्याप्त स्मार्ट नहीं है।
अध्ययन बताता है कि हालांकि एआई जटिल वित्तीय मॉडल बनाने में बहुत सक्षम हो रहा है, लेकिन सबसे कठिन हिस्सा—वे सूक्ष्म, तर्कसंगत निर्णय लेना जिनका उपयोग विशेषज्ञ कंपनी के मूल्यांकन के लिए करते हैं—एक महत्वपूर्ण चुनौती बनी हुई है। लेखकों ने केवल एक स्कोर नहीं खोजा; उन्होंने यह साबित किया कि पुराने तरीके से ग्रेडिंग करना (एक पूर्ण उत्तर की तलाश करना) इंसानों और मशीनों दोनों के लिए अनुचित था, और उन्होंने प्रगति को मापने का एक नया तरीका पेश किया जो विशेषज्ञ असहमति की वास्तविक वास्तविकता का सम्मान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।