FinAuditing: A Financial Taxonomy-Structured Multi-Document Benchmark for Evaluating LLMs
यह शोध पत्र FinAuditing प्रस्तुत करता है, जो वास्तविक XBRL फाइलिंग से प्राप्त एक बड़े पैमाने का, वर्गीकरण-संरेखित (taxonomy-aligned) बेंचमार्क है, जो तीन वित्तीय ऑडिटिंग कार्यों में 13 अत्याधुनिक LLMs की क्षमताओं का मूल्यांकन करता है, और संरचना-जागरूक अर्थ संबंधी मिलान (structure-aware semantic matching), संबंध निष्कर्षण (relationship extraction) और गणितीय तर्क (mathematical reasoning) करने की उनकी क्षमता में महत्वपूर्ण अंतराल को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक बहुत बड़े वित्तीय रहस्य को सुलझाने की कोशिश कर रहे हैं। संदिग्ध एक विशाल निगम (कॉरपोरेशन) है, और सबूत वित्तीय रिपोर्टों के हजारों पन्नों का एक ढेर है। लेकिन यहाँ एक पेच है: ये सामान्य टेक्स्ट वाले पन्ने नहीं हैं। ये लेगो ब्रिक्स (Lego bricks) से बने एक विशाल, आपस में जुड़े हुए पहेली की तरह हैं, जहाँ हर एक संख्या, शब्द और संबंध को US-GAAP नामक एक सख्त नियम पुस्तिका (जो लेखांकन का "संविधान" है) के अनुसार पूरी तरह से फिट होना चाहिए।
यह पेपर एक नए टूल के बारे में बताता है जिसे FINAUDITING कहा जाता है, जो मूल रूप से आर्टिफिशियल इंटेलिजेंस (AI) के लिए एक "अंतिम परीक्षा" है, यह देखने के लिए कि क्या वह एक वित्तीय जासूस बनने के लिए पर्याप्त स्मार्ट है।
यहाँ समस्या और समाधान का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: "अदृश्य" गलतियाँ
कल्पना कीजिए कि एक कंपनी कहती है, "हमारे पास 95 मिलियन तक ही पहुँचता है।
पुराने दिनों में, एक मानव ऑडिटर को इस $5 मिलियन के अंतर को खोजने के लिए मैन्युअल रूप से हर एक पन्ने की जांच करनी पड़ती। यह एक लाख किताबों की लाइब्रेरी में एक विशिष्ट टाइपो (लिखावट की गलती) को खोजने जैसा है। यह धीमा, उबाऊ और थका देने वाला काम है।
अब, हमारे पास लार्ज लैंग्वेज मॉडल्स (LLMs) हैं—सुपर-स्मार्ट AI जो टेक्स्ट को पढ़ और समझ सकते हैं। लेकिन क्या वे यह विशिष्ट काम कर सकते हैं?
- समस्या: अधिकांश AI कविता लिखने या चैट करने में माहिर होते हैं। लेकिन वित्तीय ऑडिटिंग केवल शब्दों को पढ़ने के बारे में नहीं है; यह संरचना (structure), गणित और नियमों की जांच करने के बारे में है।
- अंतराल (The Gap): मौजूदा परीक्षण AI से यह पूछने जैसे हैं कि, "क्या आप पैसे के बारे में एक वाक्य लिख सकते हैं?" जबकि FINAUDITING पूछता है, "क्या आप 30,000 शब्दों के कानूनी दस्तावेज़ में छिपी $5 मिलियन की झूठ को ढूंढ सकते हैं जो एक सख्त 1,000 पन्नों की नियम पुस्तिका का पालन करता है?"
2. समाधान: FINAUDITING (द "फाइनेंशियल जिम")
लेखकों ने वास्तविक दुनिया के डेटा (SEC—अमेरिकी वित्तीय पुलिस—से प्राप्त) का उपयोग करके एक विशाल, यथार्थवादी प्रशिक्षण मैदान (बेंचमार्क) बनाया है। उन्होंने AI की मांसपेशियों का परीक्षण करने के लिए तीन विशिष्ट "वर्कआउट" बनाए हैं:
वर्कआउट A: "नेम टैग" टेस्ट (वित्तीय सिमेंटिक मैचिंग)
- उपमा: एक ऐसी लाइब्रेरी की कल्पना करें जहाँ हर किताब की रीढ़ (spine) पर एक विशिष्ट लेबल होना चाहिए। यदि कोई किताब "सेब" के बारे में है, तो उसे "फल" लेबल किया जाना चाहिए, न कि "सब्जी"।
- कार्य: AI को एक वित्तीय रिपोर्ट देखनी होती है और यह जांचना होता है कि क्या कंपनी ने अपने नंबरों के लिए सही "आधिकारिक लेबल" (टैग) का उपयोग किया है। क्या उन्होंने "कैश" (नकद) को वही नाम दिया जो नियम पुस्तिका के अनुसार होना चाहिए?
- परिणाम: AI संघर्ष करते दिखे। वे अक्सर "मिलते-जुलते दिखने वाले" शब्द चुन लेते थे बजाय इसके कि वे सही कानूनी शब्द चुनें। यह एक "स्पैटुला" को "चम्मच" कहने जैसा है क्योंकि वे दोनों रसोई के उपकरण दिखते हैं, भले ही वे एक ही चीज़ नहीं हैं।
वर्कआउट B: "फैमिली ट्री" टेस्ट (वित्तीय संबंध निष्कर्षण)
- उपमा: एक फैमिली ट्री (वंशवृक्ष) के बारे में सोचें। एक "पिता" को "पुत्र" का माता-पिता होना चाहिए। आप "पोते" को "पिता" का माता-पिता के रूप में सूचीबद्ध नहीं कर सकते।
- कार्य: वित्तीय रिपोर्टों में पदानुक्रम (hierarchies) होते हैं। "कुल संपत्ति" (Total Assets) को "चालू संपत्ति" (Current Assets) का जनक होना चाहिए। AI को यह जांचना होता है कि क्या कंपनी ने फैमिली ट्री में गड़बड़ी की है। क्या उन्होंने किसी "बच्चे" को "माता-पिता" से ऊपर रखा?
- परिणाम: यह बहुत कठिन था। AI जटिल संरचनाओं से भ्रमित हो गए। वे शब्दों को पढ़ सकते थे, लेकिन वे उनके बीच के संबंधों को नहीं समझ सके।
वर्कआउट C: "मैथ चेक" टेस्ट (वित्तीय गणितीय तर्क)
- उपमा: आपके पास एक रसीद है जो कहती है "कुल: 20 + 15 हैं। गणित मेल नहीं खाता।
- कार्य: AI को नंबरों को देखना होता है, छिपे हुए गणित के नियमों को ढूंढना होता है (जैसे "कुल = भागों का योग"), और यह गणना करनी होती है कि क्या कंपनी के नंबर झूठ बोल रहे हैं।
- परिणाम: यह सबसे कठिन हिस्सा था। सबसे स्मार्ट AI भी गणित सही ढंग से करने में विफल रहे। वे नंबर तो ढूंढ सकते थे, लेकिन वे अंकगणित करने या झूठ को साबित करने के लिए तर्क की श्रृंखला का पालन करने में असमर्थ थे।
3. बड़ा खुलासा: AI अभी तैयार नहीं है
लेखकों ने दुनिया के 13 सबसे स्मार्ट AI मॉडल्स का परीक्षण किया (GPT-4o और विशेष वित्तीय AI सहित)।
- निर्णय: परिणाम निराशाजनक थे। "सुपर-स्मार्ट" मॉडल भी अधिकांश सवालों के गलत जवाब दे रहे थे।
- क्यों? ये AI शानदार पाठक लेकिन खराब अकाउंटेंट की तरह हैं। वे कहानी को समझ सकते हैं, लेकिन वे उन सख्त नियमों, गणित या गहरी संरचना को नहीं समझते जिसकी ऑडिटिंग के लिए आवश्यकता होती है। वे तथ्यों पर आधारित "तर्क" के बजाय पैटर्न के आधार पर "अनुमान" लगाने पर निर्भर करते हैं।
4. यह क्यों महत्वपूर्ण है
यह पेपर एक चेतावनी है।
- जनता के लिए: इसका मतलब है कि हम अभी तक AI पर हमारे पैसे का ऑडिट करने के लिए भरोसा नहीं कर सकते। यदि हम उन्हें खुला छोड़ देते हैं, तो वे बड़े घोटालों को मिस कर सकते हैं क्योंकि वे "खेल के नियमों" को नहीं समझते हैं।
- भविष्य के लिए: लेखकों ने इस "परीक्षा" को मुफ्त में जारी किया है। अब, अन्य वैज्ञानिक इसका उपयोग बेहतर AI बनाने के लिए कर सकते हैं जो केवल शब्दों को ही नहीं, बल्कि संरचना और गणित को भी समझते हैं।
संक्षेप में:
FINAUDITING एक वास्तविकता की जाँच है। यह दिखाता है कि हालांकि AI लिखने और चैट करने में अद्भुत है, लेकिन यह वर्तमान में एक वित्तीय ऑडिटर बनने के लिए पर्याप्त स्मार्ट नहीं है। इसे हमारे पैसे पर भरोसा करने से पहले सख्त नियमों का पालन करना, अपने गणित की जांच करना और जटिल संरचनाओं को समझना सीखना होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।