WorkstreamBench: Evaluating LLM Agents on End-to-End Spreadsheet Tasks in Finance
यह शोध पत्र WorkstreamBench प्रस्तुत करता है, जो सटीकता (Accuracy), फॉर्मूला (Formula) और फॉर्मेट (Format) के बहुआयामी वर्गीकरण का उपयोग करके एंड-टू-एंड वित्तीय स्प्रेडशीट कार्यों पर LLM एजेंटों का मूल्यांकन करने वाला एक नवीन बेंचमार्क है, जो यह प्रकट करता है कि हालांकि क्लॉड (Claude) जैसे शीर्ष मॉडल पेशेवर दिखने वाले आउटपुट उत्पन्न करते हैं, फिर भी वर्तमान एजेंट वास्तविक दुनिया के वित्तीय वर्कफ़्लो के लिए आवश्यक जटिलता और गुणवत्ता मानकों को विश्वसनीय रूप से संभालने में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपनी कंपनी के लिए एक जटिल वित्तीय मॉडल (financial model) बनाने के लिए एक नया सहायक (assistant) रख रहे हैं। आप नहीं चाहते कि वे केवल एक गणित की समस्या हल करें; आप चाहते हैं कि वे शून्य से एक संपूर्ण, पेशेवर-ग्रेड स्प्रेडशीट तैयार करें जिसे आप अपने बॉस, अपने निवेशकों और अपने ऑडिटर्स को सौंप सकें।
यह शोध पत्र, WorkstreamBench, वास्तव में AI एजेंटों (स्मार्ट कंप्यूटर प्रोग्राम) के लिए एक "अंतिम परीक्षा" है यह देखने के लिए कि क्या वे वास्तव में वह काम कर सकते हैं।
यहाँ बताया गया है कि लेखकों ने क्या किया, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: "लेगो ब्रिक" बनाम "किला"
AI के लिए पिछले परीक्षण ऐसे थे जैसे किसी निर्माता से कहना कि "एक लेगो ब्रिक को दूसरे के ऊपर रखें" या "लाल ब्रिक ढूँढें।" ये सरल, अलग-थलग कार्य हैं (जैसे कोई प्रश्न पूछना या एक संख्या बदलना)।
लेकिन वित्त (finance) की वास्तविक दुनिया में, पेशेवर केवल एक ब्रिक नहीं रखते। वे पूरे किले का निर्माण करते हैं। उन्हें एक ऐसी स्प्रेडशीट की आवश्यकता होती है जो:
- तीन अलग-अलग रिपोर्टों (आय, बैलेंस शीट, कैश फ्लो) को जोड़ती हो ताकि यदि आप एक संख्या बदलते हैं, तो सब कुछ अपने आप अपडेट हो जाए।
- "क्या-होता-अगर" (what-if) परिदृश्यों को संभाल सके (जैसे, "यदि बिक्री में 10% की गिरावट आती है तो क्या होगा?")।
- पेशेवर दिखे, पढ़ने में आसान हो और बाद में मानव द्वारा संपादित करने में आसान हो।
लेखकों ने महसूस किया कि मौजूदा परीक्षण बहुत आसान थे। उन्होंने यह परीक्षण नहीं किया कि क्या AI पूरा किला बना सकता है, बल्कि केवल यह देखा कि क्या वह कुछ ब्रिक्स रख सकता है।
2. समाधान: AI के लिए एक नया "जिम"
लेखकों ने WorkstreamBench बनाया, जो पेशेवर प्रतियोगिताओं और प्रशिक्षण पाठ्यक्रमों से लिए गए वास्तविक दुनिया के वित्तीय चुनौतियों से भरा एक नया परीक्षण मैदान है।
केवल यह जाँचने के बजाय कि अंतिम संख्या सही है या नहीं (जैसे एक गणित शिक्षक उत्तर कुंजी की जाँच करता है), उन्होंने AI के काम की गुणवत्ता को आंकने के लिए एक तीन-भाग वाला ग्रेडिंग रूब्रिक बनाया, जो बिल्कुल वैसा ही है जैसे एक मानव बॉस रिपोर्ट की समीक्षा करता है:
- सटीकता (गणित): क्या अंतिम संख्या सही है? क्या AI ने वास्तव में अनुरोधित परिदृश्य विश्लेषण (scenario analysis) किया है?
- फॉर्मूला (तर्क/लॉजिक): क्या इसके अंदर का "इंजन" अच्छी तरह से बना है?
- उपमा: एक कार की कल्पना करें। एक बुरा निर्माता इंजन के हिस्सों को सुपरग्लू (superglue) से चिपका सकता है (hardcoded numbers)। यदि आपको बाद में इंजन बदलने की आवश्यकता है, तो आपको कार को तोड़ना पड़ेगा। एक अच्छा निर्माता बोल्ट और स्क्रू (डायनेमिक फॉर्मूला) का उपयोग करता है ताकि कार को ठीक करना और अपग्रेड करना आसान हो। AI को गोंद के बजाय बोल्ट का उपयोग करना चाहिए।
- वे यह भी जाँचते हैं कि क्या तर्क (logic) पढ़ने योग्य है। एक विशाल, भ्रमित करने वाला फॉर्मूला ऊन के उलझे हुए गोले जैसा है; एक चरण-दर-चरण फॉर्मूला स्पष्ट निर्देश पुस्तिका जैसा है।
- फॉर्मेट (प्रस्तुति): क्या यह पेशेवर दिखता है?
- क्या संख्याएँ संरेखित (aligned) हैं? क्या ऋणात्मक संख्याओं को माइनस चिह्न के बजाय कोष्ठक (parentheses) में दिखाया गया है (जो एक वित्तीय मानक है)? क्या फ़ॉन्ट सुसंगत है? यदि स्प्रेडशीट अव्यवस्थित दिखती है, तो एक मानव बॉस इसे अस्वीकार कर सकता है भले ही गणित सही हो।
3. परीक्षण: परीक्षा किसने दी?
लेखकों ने आज उपलब्ध कई सबसे स्मार्ट AI एजेंटों का परीक्षण किया, जिसमें Claude, ChatGPT, Gemini और अन्य के संस्करण शामिल हैं। इनमें से कुछ "वेब" संस्करण (ब्राउज़र में चैट करने वाले) थे और कुछ "एक्सेल" संस्करण (प्लगइन्स जो स्प्रेडशीट सॉफ़्टवेयर के भीतर रहते हैं) थे।
4. परिणाम: "ईमानदार" रिपोर्ट कार्ड
परिणाम "आशाजनक" और "अभी पूरी तरह तैयार नहीं" का मिश्रण थे।
- लीडर: Claude Web एजेंट ने सबसे अच्छा प्रदर्शन किया। इसने सबसे पेशेवर दिखने वाली स्प्रेडशीट बनाई जो मनुष्यों के लिए पढ़ने और संपादित करने में सबसे आसान थी।
- अंतराल (Gap): सबसे अच्छे AI का स्कोर भी लगभग 69 आउट ऑफ 100 था।
- संघर्ष: जैसे-जैसे कार्य कठिन होते गए (जिसमें गणनाओं की लंबी श्रृंखला की आवश्यकता थी), AI का प्रदर्शन तेजी से गिर गया।
- उपमा: यह एक ऐसे छात्र की तरह है जो एक साधारण जोड़ की समस्या को पूरी तरह से हल कर सकता है लेकिन जब उसे एक जटिल बीजगणित (algebra) की समस्या हल करने के लिए कहा जाता है तो भ्रमित हो जाता है और गलतियाँ करता है।
- सामान्य गलतियाँ:
- हार्डकोडिंग (Hardcoding): संख्या की गणना करने के लिए फॉर्मूला लिखने के बजाय, AI कभी-कभी केवल वह संख्या टाइप कर देता था। यह चेक पर "100" लिखने के बजाय सीधे "100" लिखने जैसा है और बैंक द्वारा इसकी गणना करने के बजाय। यदि इनपुट बदलता है, तो AI का उत्तर गलत हो जाता है।
- अव्यवस्थित फॉर्मेटिंग: AI अक्सर संख्याओं को संरेखित करना भूल जाता था या गलत रंगों का उपयोग करता था, जिससे स्प्रेडशीट अपूर्ण और अव्यवसायिक दिखती थी।
- हार मान लेना: बहुत कठिन कार्यों पर, कुछ AI स्प्रेडशीट के पूरे अनुभाग को खाली छोड़ देते थे या बस संख्याएँ बना लेते थे।
5. निष्कर्ष
लेख का निष्कर्ष है कि हालांकि AI एजेंट सरल कार्यों में अच्छे हो रहे हैं, लेकिन वे अभी भी स्वतंत्र रूप से पेशेवर-ग्रेड वित्तीय मॉडल बनाने के लिए पूरी तरह तैयार नहीं हैं।
वे एक बहुत ही प्रतिभाशाली इंटर्न की तरह हैं जो गणित तो कर सकता है लेकिन उसे फॉर्मेटिंग की जांच करने, लॉजिक की त्रुटियों को ठीक करने और यह सुनिश्चित करने के लिए एक मानव पर्यवेक्षक की आवश्यकता होती है कि अंतिम उत्पाद ऐसा हो जिस पर क्लाइंट वास्तव में भरोसा कर सके। तकनीक मौजूद है, लेकिन मानव वित्तीय विश्लेषक की जगह लेने से पहले इसे और अधिक काम करने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।