← नवीनतम पेपर
🤖 AI

FinRule-Bench: A Benchmark for Joint Reasoning over Financial Tables and Principles

यह शोध पत्र FinRule-Bench प्रस्तुत करता है, जो एक नया बेंचमार्क है जो नियम सत्यापन (rule verification), पहचान (identification) और बहु-उल्लंघन स्थानीयकरण (multi-violation localization) कार्यों के माध्यम से नैदानिक क्षमताओं का परीक्षण करके वास्तविक दुनिया की वित्तीय तालिकाओं और स्पष्ट लेखांकन सिद्धांतों पर संयुक्त तर्क करने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है।

मूल लेखक: Arun Vignesh Malarkkan, Manan Roy Choudhury, Guangwei Zhang, Vivek Gupta, Qingyun Wang, Yanjie Fu, Denghui Zhang

प्रकाशित 2026-03-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arun Vignesh Malarkkan, Manan Roy Choudhury, Guangwei Zhang, Vivek Gupta, Qingyun Wang, Yanjie Fu, Denghui Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वित्तीय जासूस (financial detective) हैं। आपका काम किसी कंपनी के रिपोर्ट कार्ड (उनके वित्तीय विवरणों) को देखना है और यह जांचना है कि क्या उन्होंने खेल के सख्त नियमों (लेखांकन सिद्धांतों) का पालन किया है।

लंबे समय से, हम AI (लार्ज लैंग्वेज मॉडल्स) का परीक्षण यह देखने के लिए कर रहे हैं कि वे इन रिपोर्टों को कितनी अच्छी तरह पढ़ सकते हैं या उन पर सवाल का जवाब दे सकते हैं। यह AI से पूछने जैसा है, "कंपनी ने कितना पैसा कमाया?" या "इस कॉलम का कुल योग क्या है?" AI इसमें काफी अच्छा हो रहा है।

लेकिन एक बहुत बड़ा अंतर है: क्या AI वास्तव में ऑडिट कर सकता है? क्या वह एक सही रिपोर्ट को देख सकता है, छोटी गलतियों को ढूंढ सकता है, और कह सकता है, "हे, यह विशिष्ट संख्या गलत है क्योंकि यह नियम #4 का उल्लंघन करती है"?

यह पेपर FinRule-Bench पेश करता है, जो एक नया "परीक्षा" है जिसे विशेष रूप से यह परीक्षण करने के लिए बनाया गया है कि क्या AI इस तरह का जासूसी कार्य कर सकता है।

सरल उपमाओं का उपयोग करके इसका विवरण यहाँ दिया गया है:

1. समस्या: "अच्छा छात्र" बनाम "ऑडिटर"

कल्पना कीजिए कि एक छात्र है जो गणित के सवाल हल करने में बहुत अच्छा है जब आप उसे नंबर देते हैं। लेकिन अगर आप उसे एक पूरा किया हुआ होमवर्क असाइनमेंट देते हैं और पूछते हैं, "क्या आपने कोई गलती की है?" तो वह छोटी गलतियों को मिस कर सकता है या इस बात को लेकर भ्रमित हो सकता है कि उसने कौन सा नियम तोड़ा है।

  • पुराने बेंचमार्क: ये AI से गणित के सवाल हल करने के लिए पूछने जैसे थे। उन्होंने नकली, अव्यवस्थित डेटा का उपयोग किया जहाँ त्रुटियां स्पष्ट थीं।
  • नई वास्तविकता: वास्तविक वित्तीय ऑडिट पूरी तरह से साफ डेटा पर होते हैं। AI को एक आदर्श दीवार में एक छोटी सी दरार ढूंढनी होती है। यदि दीवार आदर्श है, तो AI को कुछ नहीं मिलना चाहिए। यदि दरार है, तो AI को उसे ढूंढना होगा और ठीक से बताना होगा कि वह कहाँ है।

2. समाधान: "FinRule-Bench" परीक्षा

शोधकर्ताओं ने वास्तविक कंपनी रिपोर्टों (जैसे कि कंपनियां सरकार के पास जमा करती हैं 10-K फॉर्म) का उपयोग करके एक परीक्षण बनाया। उन्होंने इन आदर्श रिपोर्टों को लिया और उनमें गुप्त रूप से छोटी, वास्तविक दिखने वाली त्रुटियां डाल दीं।

उन्होंने AI के लिए कठिनाई के तीन स्तर बनाए, जैसे कि एक वीडियो गेम:

  • स्तर 1: "हाँ/नहीं" की जाँच (नियम सत्यापन - Rule Verification)

    • कार्य: "यहाँ एक नियम है: 'कुल संपत्ति (Total Assets), कुल देनदारियों + इक्विटी (Total Liabilities + Equity) के बराबर होनी चाहिए।' इस तालिका को देखें। क्या यह नियम का पालन कर रहा है?"
    • उपमा: एक बाउंसर जो यह देख रहा है कि आपका आईडी आपके चेहरे से मेल खाता है या नहीं। यह एक सरल बाइनरी चेक है।
    • परिणाम: AI इसमें काफी अच्छा है।
  • स्तर 2: "हुडनिट" (नियम पहचान - Rule Identification)

    • कार्य: "यहाँ एक तालिका है जिसमें एक गलती है। यहाँ 10 संभावित नियमों की एक सूची है। तालिका ने कौन सा एक नियम तोड़ा है?"
    • उपमा: आप संदिग्धों की एक सूची के साथ एक जासूस हैं। आप जानते हैं कि एक अपराध हुआ है, लेकिन आपको यह पता लगाना है कि ठीक वही किसने किया।
    • परिणाम: AI संघर्ष करने लगता है। वह समान नियमों के बीच भ्रमित हो जाता है।
  • स्तर 3: "मास्टर डिटेक्टिव" (संयुक्त नियम निदान - Joint Rule Diagnosis)

    • कार्य: "यह तालिका अस्त-व्यस्त है। सभी गलतियाँ खोजें, मुझे बताएं कि उन्होंने कौन से नियम तोड़े, और उस सटीक पंक्ति की ओर इशारा करें जहाँ त्रुटि है।"
    • उपमा: आप एक मैकेनिक हैं जो कार के इंजन को देख रहे हैं जिसमें एक साथ तीन अलग-अलग समस्याएं हैं। आपको तीनों को ढूंढना है, उनका नाम लेना है, और बताना है कि ठीक कौन सा बोल्ट ढीला है।
    • परिणाम: AI यहाँ बुरी तरह विफल हो जाता है। वह अक्सर आधी समस्याओं को मिस कर देता है या गलत पंक्ति की ओर इशारा करता है।

3. विशेष उपकरण: "क्या-होता-अगर" सोचना (What-If Thinking)

शोधकर्ताओं ने AI की मदद करने के लिए एक कूल ट्रिक आजमाई। उन्होंने केवल AI से त्रुटि खोजने के लिए नहीं कहा। उन्होंने उसे ऐसे उदाहरण दिए जो कहते थे:

"यहाँ एक गलती है। यह गलती क्यों है? और यदि हम इस एक नंबर को बदल दें, तो क्या यह ठीक हो जाएगा?"

इसे कॉज़ल-काउंटरफैक्चुअल रीजनिंग (Causal-Counterfactual Reasoning) कहा जाता है।

  • उपमा: केवल यह कहने के बजाय कि "कार शुरू नहीं हो रही है," आप समझाते हैं, "बैटरी खत्म है। यदि हम बैटरी बदलते हैं, तो कार शुरू हो जाती है।"
  • परिणाम: इसने AI को तर्क (logic) को बेहतर ढंग से समझने में मदद की, विशेष रूप से कठिन कार्यों के लिए। इसने AI को त्रुटि के पीछे के "क्यों" को समझने में थोड़ा बेहतर बनाया, हालांकि यह अभी भी हर एक गलती को नहीं पकड़ सका।

4. मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि जबकि AI एक कैलकुलेटर या सारांश बनाने वाला (summarizer) होने में महान है, यह वर्तमान में एक खराब ऑडिटर है।

  • अंतराल (The Gap): AI सरल गणितीय जांच कर सकता है, लेकिन यह विश्वसनीय रूप से एक जटिल दस्तावेज़ को स्कैन नहीं कर सकता, छिपी हुई कई त्रुटियों को ढूंढ सकता है, और यह स्पष्ट रूप से नहीं समझा सकता कि वे गलत क्यों हैं।
  • खतरा: यदि हम आज AI को वित्तीय रिपोर्ट ऑडिट करने के लिए छोड़ देते हैं, तो यह महत्वपूर्ण धोखाधड़ी या त्रुटियों को मिस कर सकता है क्योंकि इसमें "डायग्नोस्टिक पूर्णता" (diagnostic completeness) की कमी है। यह जंगल को तो देख सकता है लेकिन उन पेड़ों को मिस कर सकता है जो आग की लपटों में हैं।

सारांश

FinRule-Bench एक नया, कठिन परीक्षण है जो साबित करता है कि AI अभी तक मानव वित्तीय ऑडिटरों की जगह लेने के लिए तैयार नहीं है। यह दिखाता है कि भले ही AI स्मार्ट है, लेकिन इसमें जटिल वित्तीय नियमों में एक साथ कई त्रुटियों को खोजने और ठीक करने के लिए आवश्यक सावधानीपूर्वक, चरण-दर-चरण जासूसी कौशल की कमी है। हमें अपने पैसे के साथ भरोसा करने से पहले AI को एक बेहतर जासूस बनाने के लिए सिखाना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →