← नवीनतम पेपर
💬 NLP

FinAuditing: A Financial Taxonomy-Structured Multi-Document Benchmark for Evaluating LLMs

यह शोध पत्र FinAuditing प्रस्तुत करता है, जो वास्तविक XBRL फाइलिंग से प्राप्त एक बड़े पैमाने का, वर्गीकरण-संरेखित (taxonomy-aligned) बेंचमार्क है, जो तीन वित्तीय ऑडिटिंग कार्यों में 13 अत्याधुनिक LLMs की क्षमताओं का मूल्यांकन करता है, और संरचना-जागरूक अर्थ संबंधी मिलान (structure-aware semantic matching), संबंध निष्कर्षण (relationship extraction) और गणितीय तर्क (mathematical reasoning) करने की उनकी क्षमता में महत्वपूर्ण अंतराल को प्रकट करता है।

मूल लेखक: Yan Wang, Keyi Wang, Shanshan Yang, Jaisal Patel, Jeff Zhao, Fengran Mo, Xueqing Peng, Lingfei Qian, Jimin Huang, Guojun Xiong, Yankai Chen, Víctor Gutiérrez-Basulto, Xiao-Yang Liu, Xue Liu, Jian-Yun
प्रकाशित 2026-02-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yan Wang, Keyi Wang, Shanshan Yang, Jaisal Patel, Jeff Zhao, Fengran Mo, Xueqing Peng, Lingfei Qian, Jimin Huang, Guojun Xiong, Yankai Chen, Víctor Gutiérrez-Basulto, Xiao-Yang Liu, Xue Liu, Jian-Yun Nie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक बहुत बड़े वित्तीय रहस्य को सुलझाने की कोशिश कर रहे हैं। संदिग्ध एक विशाल निगम (कॉरपोरेशन) है, और सबूत वित्तीय रिपोर्टों के हजारों पन्नों का एक ढेर है। लेकिन यहाँ एक पेच है: ये सामान्य टेक्स्ट वाले पन्ने नहीं हैं। ये लेगो ब्रिक्स (Lego bricks) से बने एक विशाल, आपस में जुड़े हुए पहेली की तरह हैं, जहाँ हर एक संख्या, शब्द और संबंध को US-GAAP नामक एक सख्त नियम पुस्तिका (जो लेखांकन का "संविधान" है) के अनुसार पूरी तरह से फिट होना चाहिए।

यह पेपर एक नए टूल के बारे में बताता है जिसे FINAUDITING कहा जाता है, जो मूल रूप से आर्टिफिशियल इंटेलिजेंस (AI) के लिए एक "अंतिम परीक्षा" है, यह देखने के लिए कि क्या वह एक वित्तीय जासूस बनने के लिए पर्याप्त स्मार्ट है।

यहाँ समस्या और समाधान का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "अदृश्य" गलतियाँ

कल्पना कीजिए कि एक कंपनी कहती है, "हमारे पास 100मिलियननकदहै!"लेकिनजबआपरिपोर्टकेपीछेकेविस्तृतरसीदोंकोदेखतेहैं,तोगणितकेवल100 मिलियन** नकद है!" लेकिन जब आप रिपोर्ट के पीछे के विस्तृत रसीदों को देखते हैं, तो गणित केवल **95 मिलियन तक ही पहुँचता है।

पुराने दिनों में, एक मानव ऑडिटर को इस $5 मिलियन के अंतर को खोजने के लिए मैन्युअल रूप से हर एक पन्ने की जांच करनी पड़ती। यह एक लाख किताबों की लाइब्रेरी में एक विशिष्ट टाइपो (लिखावट की गलती) को खोजने जैसा है। यह धीमा, उबाऊ और थका देने वाला काम है।

अब, हमारे पास लार्ज लैंग्वेज मॉडल्स (LLMs) हैं—सुपर-स्मार्ट AI जो टेक्स्ट को पढ़ और समझ सकते हैं। लेकिन क्या वे यह विशिष्ट काम कर सकते हैं?

  • समस्या: अधिकांश AI कविता लिखने या चैट करने में माहिर होते हैं। लेकिन वित्तीय ऑडिटिंग केवल शब्दों को पढ़ने के बारे में नहीं है; यह संरचना (structure), गणित और नियमों की जांच करने के बारे में है।
  • अंतराल (The Gap): मौजूदा परीक्षण AI से यह पूछने जैसे हैं कि, "क्या आप पैसे के बारे में एक वाक्य लिख सकते हैं?" जबकि FINAUDITING पूछता है, "क्या आप 30,000 शब्दों के कानूनी दस्तावेज़ में छिपी $5 मिलियन की झूठ को ढूंढ सकते हैं जो एक सख्त 1,000 पन्नों की नियम पुस्तिका का पालन करता है?"

2. समाधान: FINAUDITING (द "फाइनेंशियल जिम")

लेखकों ने वास्तविक दुनिया के डेटा (SEC—अमेरिकी वित्तीय पुलिस—से प्राप्त) का उपयोग करके एक विशाल, यथार्थवादी प्रशिक्षण मैदान (बेंचमार्क) बनाया है। उन्होंने AI की मांसपेशियों का परीक्षण करने के लिए तीन विशिष्ट "वर्कआउट" बनाए हैं:

वर्कआउट A: "नेम टैग" टेस्ट (वित्तीय सिमेंटिक मैचिंग)

  • उपमा: एक ऐसी लाइब्रेरी की कल्पना करें जहाँ हर किताब की रीढ़ (spine) पर एक विशिष्ट लेबल होना चाहिए। यदि कोई किताब "सेब" के बारे में है, तो उसे "फल" लेबल किया जाना चाहिए, न कि "सब्जी"।
  • कार्य: AI को एक वित्तीय रिपोर्ट देखनी होती है और यह जांचना होता है कि क्या कंपनी ने अपने नंबरों के लिए सही "आधिकारिक लेबल" (टैग) का उपयोग किया है। क्या उन्होंने "कैश" (नकद) को वही नाम दिया जो नियम पुस्तिका के अनुसार होना चाहिए?
  • परिणाम: AI संघर्ष करते दिखे। वे अक्सर "मिलते-जुलते दिखने वाले" शब्द चुन लेते थे बजाय इसके कि वे सही कानूनी शब्द चुनें। यह एक "स्पैटुला" को "चम्मच" कहने जैसा है क्योंकि वे दोनों रसोई के उपकरण दिखते हैं, भले ही वे एक ही चीज़ नहीं हैं।

वर्कआउट B: "फैमिली ट्री" टेस्ट (वित्तीय संबंध निष्कर्षण)

  • उपमा: एक फैमिली ट्री (वंशवृक्ष) के बारे में सोचें। एक "पिता" को "पुत्र" का माता-पिता होना चाहिए। आप "पोते" को "पिता" का माता-पिता के रूप में सूचीबद्ध नहीं कर सकते।
  • कार्य: वित्तीय रिपोर्टों में पदानुक्रम (hierarchies) होते हैं। "कुल संपत्ति" (Total Assets) को "चालू संपत्ति" (Current Assets) का जनक होना चाहिए। AI को यह जांचना होता है कि क्या कंपनी ने फैमिली ट्री में गड़बड़ी की है। क्या उन्होंने किसी "बच्चे" को "माता-पिता" से ऊपर रखा?
  • परिणाम: यह बहुत कठिन था। AI जटिल संरचनाओं से भ्रमित हो गए। वे शब्दों को पढ़ सकते थे, लेकिन वे उनके बीच के संबंधों को नहीं समझ सके।

वर्कआउट C: "मैथ चेक" टेस्ट (वित्तीय गणितीय तर्क)

  • उपमा: आपके पास एक रसीद है जो कहती है "कुल: 50"।लेकिनसूचीबद्धआइटम50"। लेकिन सूचीबद्ध आइटम 20 + 20+20 + 15 हैं। गणित मेल नहीं खाता।
  • कार्य: AI को नंबरों को देखना होता है, छिपे हुए गणित के नियमों को ढूंढना होता है (जैसे "कुल = भागों का योग"), और यह गणना करनी होती है कि क्या कंपनी के नंबर झूठ बोल रहे हैं।
  • परिणाम: यह सबसे कठिन हिस्सा था। सबसे स्मार्ट AI भी गणित सही ढंग से करने में विफल रहे। वे नंबर तो ढूंढ सकते थे, लेकिन वे अंकगणित करने या झूठ को साबित करने के लिए तर्क की श्रृंखला का पालन करने में असमर्थ थे।

3. बड़ा खुलासा: AI अभी तैयार नहीं है

लेखकों ने दुनिया के 13 सबसे स्मार्ट AI मॉडल्स का परीक्षण किया (GPT-4o और विशेष वित्तीय AI सहित)।

  • निर्णय: परिणाम निराशाजनक थे। "सुपर-स्मार्ट" मॉडल भी अधिकांश सवालों के गलत जवाब दे रहे थे।
  • क्यों? ये AI शानदार पाठक लेकिन खराब अकाउंटेंट की तरह हैं। वे कहानी को समझ सकते हैं, लेकिन वे उन सख्त नियमों, गणित या गहरी संरचना को नहीं समझते जिसकी ऑडिटिंग के लिए आवश्यकता होती है। वे तथ्यों पर आधारित "तर्क" के बजाय पैटर्न के आधार पर "अनुमान" लगाने पर निर्भर करते हैं।

4. यह क्यों महत्वपूर्ण है

यह पेपर एक चेतावनी है।

  • जनता के लिए: इसका मतलब है कि हम अभी तक AI पर हमारे पैसे का ऑडिट करने के लिए भरोसा नहीं कर सकते। यदि हम उन्हें खुला छोड़ देते हैं, तो वे बड़े घोटालों को मिस कर सकते हैं क्योंकि वे "खेल के नियमों" को नहीं समझते हैं।
  • भविष्य के लिए: लेखकों ने इस "परीक्षा" को मुफ्त में जारी किया है। अब, अन्य वैज्ञानिक इसका उपयोग बेहतर AI बनाने के लिए कर सकते हैं जो केवल शब्दों को ही नहीं, बल्कि संरचना और गणित को भी समझते हैं।

संक्षेप में:
FINAUDITING एक वास्तविकता की जाँच है। यह दिखाता है कि हालांकि AI लिखने और चैट करने में अद्भुत है, लेकिन यह वर्तमान में एक वित्तीय ऑडिटर बनने के लिए पर्याप्त स्मार्ट नहीं है। इसे हमारे पैसे पर भरोसा करने से पहले सख्त नियमों का पालन करना, अपने गणित की जांच करना और जटिल संरचनाओं को समझना सीखना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →