Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows
यह शोध पत्र FinWorkBench (Finch) को प्रस्तुत करता है, जो वास्तविक उद्यम डेटा से प्राप्त एक व्यापक बेंचमार्क है जो जटिल, मल्टीमॉडल वित्त और लेखा वर्कफ़्लो पर फ्रंटियर एआई एजेंटों का मूल्यांकन करता है, जिससे महत्वपूर्ण प्रदर्शन अंतराल का पता चलता है जहाँ GPT 5.1 Pro जैसे उन्नत मॉडल भी केवल 38.4% सफलता दर प्राप्त करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को अपना काम करने के लिए सिखाने की कोशिश कर रहे हैं। आप सोच सकते हैं, "कोई समस्या नहीं! बस इसे 'नंबरों को जोड़ने' या 'चार्ट बनाने' के लिए कह दें।"
लेकिन वित्त (finance) की वास्तविक दुनिया में, यह इतना सरल नहीं है। यह एक साफ व्हाइटबोर्ड पर गणित का सवाल हल करने जैसा नहीं है, बल्कि यह एक डगमगाती सीढ़ी पर खड़े होकर, बारिश में, एक मुड़े हुए और टेप से चिपकाए गए नक्शे को पकड़े हुए, एक टपकती हुई छत को ठीक करने जैसा है, और वह नक्शा तीन अलग-अलग भाषाओं में लिखा गया है।
FINCH पेपर बिल्कुल इसी बारे में है।
यहाँ इस पेपर का सरल हिंदी में विवरण दिया गया है, जिसमें कुछ रोज़मर्रा के उदाहरणों का उपयोग किया गया है।
1. समस्या: वित्त की "अव्यवस्थित रसोई" (The Messy Kitchen)
आजकल के अधिकांश AI परीक्षण एक रोबोट से केक बनाने के लिए पूछने जैसे हैं, जिसके पास एक सटीक, पूर्व-मापी गई रेसिपी और एक साफ-सुथरी रसोई है। सामग्री व्यवस्थित कटोरे में है, निर्देश स्पष्ट हैं, और ओवन सही तापमान पर सेट है।
लेकिन वास्तविक वित्त कार्य एक अव्यवस्थित रसोई की तरह है।
- सामग्री बिखरी हुई है: डेटा एक व्यवस्थित सूची में नहीं है। यह 50 अलग-अलग एक्सेल फाइलों, कुछ PDF, कुछ ईमेल और कुछ चार्ट्स में है।
- रेसिपी टूटी हुई है: निर्देश पुराने ईमेल के अंदर छिपे हैं ("हे, क्या आप 2002 का बजट अपडेट कर सकते हैं?") या समय के साथ एक स्प्रेडशीट कैसे बदली, इसके इतिहास में दबे हुए हैं।
- टूल्स अजीब हैं: "टेबल्स" आदर्श ग्रिड नहीं हैं। उनमें मर्ज किए गए सेल्स (merged cells), अजीब फोंट, टेक्स्ट के बीच में एम्बेडेड चार्ट और ऐसे फॉर्मूले हैं जो गुप्त कोड की तरह दिखते हैं।
- काम लंबा है: आप केवल "नंबर नहीं जोड़ते।" आपको डेटा खोजना होता है, उसे साफ करना होता है, यह जांचना होता है कि क्या वह समझ में आता है, नई भविष्यवाणियां (projections) करनी होती हैं, ग्राफ बनाना होता है और रिपोर्ट लिखनी होती है। यह चरणों की एक लंबी श्रृंखला है जहाँ एक भी गलती पूरे काम को बिगाड़ सकती है।
2. समाधान: FINCH (द "रियल-वर्ल्ड जिम")
लेखकों ने FINCH (फाइनेंस एंड अकाउंटिंग बेंचमार्क) नामक एक नया बेंचमार्क बनाया है। इसे AI रोबोटों के लिए एक जिम के रूप में सोचें, लेकिन वजन उठाने के बजाय, उन्हें एक अव्यवस्थित कार्यालय में रास्ता खोजना है।
- उन्होंने डेटा कहाँ से प्राप्त किया? उन्होंने नकली समस्याएं नहीं बनाईं। उन्होंने वास्तविक ऐतिहासिक अभिलेखागारों (जैसे प्रसिद्ध एनरॉन ईमेल और वास्तविक बैंक दस्तावेज़) को खंगाला जो 2000 से 2025 तक के हैं। उन्हें 172 वास्तविक कार्य मिले जिन्हें वास्तव में मनुष्यों ने किया था।
- उन्होंने इसे कैसे बनाया? उन्होंने AI और मानव विशेषज्ञों के मिश्रण का उपयोग किया। कल्पना कीजिए कि जासूसों की एक टीम एक पुराने ईमेल थ्रेड और स्प्रेडशीट के ढेर को देख रही है, और यह समझने की कोशिश कर रही है: "मानव यहाँ क्या करने की कोशिश कर रहा था? उसने क्या कदम उठाए? अंतिम परिणाम क्या था?" फिर, उन्होंने उस कहानी के आधार पर एक "टेस्ट" लिखा।
- पैमाना (Scale): यह कोई छोटा टेस्ट नहीं है। इसमें 1,710 स्प्रेडशीट्स और 27 मिलियन सेल्स शामिल हैं। यह वित्तीय डेटा का एक विशाल, अराजक पुस्तकालय है।
3. टेस्ट: क्या रोबोट यह कर सकते हैं?
लेखकों ने आज के सबसे स्मार्ट AI रोबोट्स (जैसे GPT-5, Claude और Gemini) को इस अव्यवस्थित रसोई में झोंक दिया।
परिणाम चौंकाने वाले थे:
यहाँ तक कि "सुपर-ब्रेन" भी ज्यादातर समय विफल रहे।
- पास रेट (Pass Rate): सबसे अच्छा AI केवल लगभग 38% कार्यों को सही कर पाया। इसका मतलब है कि वे 10 में से 6 बार से अधिक बार असफल रहे।
- समय: AI को एक कार्य को हल करने की कोशिश करने में औसतन 17 मिनट लगे, और फिर भी वे गलत साबित हुए।
- "लॉन्ग चेन" की समस्या: यदि किसी कार्य में केवल एक या दो चरण थे, तो AI ठीक था। लेकिन यदि कार्य में तीन या अधिक चरण थे (जैसे: डेटा खोजें -> उसे साफ करें -> गणना करें -> चार्ट बनाएं), तो AI की सफलता दर तेजी से गिर गई। यह एक ऐसे रोबोट की तरह है जो एक जूता तो बांध सकता है लेकिन दूसरा बांधना भूल जाता है, या भ्रमित हो जाता है।
4. वे क्यों विफल होते हैं? (The "Gotchas")
पेपर ने पाया कि रोबोटों के संघर्ष करने के पांच मुख्य कारण हैं:
- "यह कहाँ है?" की समस्या: डेटा 10 अलग-अलग फाइलों में फैला हुआ है। AI अक्सर गलत फ़ाइल देखता है या नंबरों की गलत पंक्ति ले लेता है। यह 1,000 बिना लेबल वाले जार वाले पेंट्री में विशिष्ट सामग्री खोजने जैसा है।
- "गुप्त कोड" की समस्या: वित्त में, सेल में मौजूद फॉर्मूला अक्सर दिखने वाले नंबर से अधिक महत्वपूर्ण होता है। AI "100" नंबर देखता है लेकिन उस छिपे हुए तर्क को मिस कर देता है जो कहता है, "यह 100 वास्तव में 55-दिवसीय भुगतान अनुसूची है।" यह पर्दे के पीछे के निर्देशों को अनदेखा कर देता है।
- "अव्यवस्थित टेबल" की समस्या: वास्तविक स्प्रेडशीट्स बदसूरत होती हैं। उनमें मर्ज किए गए सेल्स, खाली पंक्तियाँ और अजीब हेडर होते हैं। AI लेआउट से भ्रमित हो जाता है और एक हेडर को डेटा पॉइंट समझ लेता है, या पूरा कॉलम ही छोड़ देता है।
- "मल्टीमॉडल" की समस्या: कभी डेटा PDF में होता है, कभी चार्ट की तस्वीर में, और कभी ईमेल में। AI इन विभिन्न प्रारूपों को एक सुसंगत चित्र में मिलाने में संघर्ष करता है।
- "मेमोरी" की समस्या: क्योंकि कार्य इतने लंबे होते हैं, AI स्टेप 10 तक पहुँचते-पहुँचते स्टेप 1 में जो किया था उसे भूल जाता है। वह कहानी का धागा खो देता है।
5. बड़ा निष्कर्ष (The Big Takeaway)
पेपर यह निष्कर्ष निकालता है कि हालांकि AI कविता लिखने या सरल स्क्रिप्ट कोडिंग करने में अद्भुत है, यह अभी भी एक मानव वित्तीय विश्लेषक (financial analyst) की जगह लेने के लिए तैयार नहीं है।
वास्तविक वित्त कार्य बहुत अव्यवस्थित, बहुत लंबा और छिपे हुए संदर्भों से भरा होता है जिसे वर्तमान रोबोट विश्वसनीय रूप से संभालने के लिए नहीं हैं। AI एक ऐसे प्रतिभाशाली छात्र की तरह है जो बहुविकल्पीय प्रश्न (multiple-choice quiz) में तो अच्छा कर सकता है लेकिन वास्तविक दुनिया के प्लंबिंग लीक को ठीक करने के लिए कहा जाने पर जम जाता है।
भविष्य:
लेखकों को उम्मीद है कि FINCH वित्तीय AI के लिए मानक "ड्राइविंग टेस्ट" बन जाएगा। जब तक AI इस टेस्ट को पास नहीं कर लेता, हमें बिना किसी मानव की निगरानी के अपने पैसे, अपने बजट या अपने टैक्स को प्रबंधित करने के लिए इस पर भरोसा नहीं करना चाहिए।
संक्षेप में: FINCH एक वास्तविकता की जाँच (reality check) है। यह हमें दिखाता है कि वास्तविक दुनिया के काम का "अव्यवस्थित मध्य भाग" (messy middle) अभी भी AI के लिए नेविगेट करना बहुत कठिन है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।