← नवीनतम पेपर
💻 computer science

Audit Detection Risk Reduction Using Machine Learning: Evidence from 3.3 million Transactions

यह अध्ययन एक चार-स्तरीय मशीन लर्निंग ढांचे को प्रस्तुत और मान्य करता है जो मंगोलियाई ऊर्जा उपयोगिता के 3.3 मिलियन वास्तविक लेनदेन पर अनसुपरवाइज्ड और सुपरवाइज्ड मॉडलों का लाभ उठाकर पारंपरिक तरीकों की तुलना में ऑडिट डिटेक्शन रिस्क और प्रोसेसिंग समय को काफी कम कर देता है, जबकि बेनफोर्ड के नियम (Benford's Law) की विसंगतियों में एक नवीन "एग्रीगेशन मास्किंग इफेक्ट" को भी उजागर करता है।

मूल लेखक: Tsetsegjargal Ulambayar, Oyunbileg Pagjii, Oyuntsetseg Luvsandash, Gantulga Garamdorj, Uyanga Sambuu

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tsetsegjargal Ulambayar, Oyunbileg Pagjii, Oyuntsetseg Luvsandash, Gantulga Garamdorj, Uyanga Sambuu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक विशाल पुस्तकालय में छिपे कुछ चालाक चोरों को खोजने की कोशिश कर रहे हैं जिसमें 33 लाख से अधिक पुस्तकें (लेनदेन) हैं। पुराने दिनों में, ऑडिटर्स "चोर को पहचानने" का एक खेल खेलते थे जिसे मोनेटरी यूनिट सैंपलिंग (MUS) कहा जाता था। इसे ऐसे समझें कि जासूस केवल अलमारियों में रखी सबसे बड़ी, भारी किताबों की जांच करता है क्योंकि उसे लगता है कि बड़ी किताबों में गलत चीज़ें छिपने की संभावना अधिक होती है। वे निरीक्षण के लिए लगभग 20% किताबें चुनते थे।

समस्या यह थी कि इस पुराने तरीके ने एक बहुत बड़ा अंतर छोड़ दिया। अध्ययन से पता चला कि केवल "भारी" किताबों की जांच करके, पुराने तरीके ने 38% से 52% बार चोरों को पकड़ने में चूक की। यह ऐसा था जैसे उन्होंने आधी लाइब्रेरी को बिना तलाशे छोड़ दिया, इस उम्मीद में कि चोर हल्की या छोटी किताबों में नहीं छिपे होंगे।

नया सुपर-स्कैनर

शोधकर्ताओं ने एक नया, चार-परत वाला "सुपर-स्कैनर" बनाया है जो न केवल भारी किताबों को, बल्कि पुस्तकालय की हर एक किताब की जांच करने के लिए मशीन लर्निंग का उपयोग करता है। उनके पास प्रशिक्षित करने के लिए ज्ञात चोरों की कोई सूची नहीं थी (जो आमतौर पर AI के लिए एक समस्या होती है), इसलिए उन्होंने स्कैनर को तीन अलग-अलग डिटेक्शन टूल्स की एक टीम के माध्यम से अपने आप "अजीबोगरीब व्यवहार" (weirdness) को पहचानने के लिए सिखाया:

  1. आइसोलेशन फॉरेस्ट (Isolation Forest): एक ऐसा टूल जो उन चीजों को ढूंढता है जो भीड़ में अलग ही दिखाई देती हैं।
  2. Z-स्कोर (Z-score): एक पैमाना जो यह मापता है कि कोई संख्या औसत से कितनी दूर भटक गई है।
  3. डेबिट-क्रेडिट रेश्यो (Debit-Credit Ratio): एक तराजू जो यह जांचता है कि आने वाला पैसा और जाने वाला पैसा मेल खाता है या नहीं।

यदि इन टूल्स ने सहमति जताई कि कोई अकाउंट संदिग्ध लग रहा है, तो सिस्टम ने उसे फ्लैग (चिह्नित) कर दिया। फिर, एक "शिक्षक" (सुपरवाइज्ड मॉडल जैसे रैंडम फॉरेस्ट) ने इन फ्लैग्स से सीखा ताकि वह गड़बड़ी पकड़ने में और भी बेहतर हो सके।

परिणाम: एक बड़ी छलांग

जब उन्होंने इस नए स्कैनर का एक मंगोलियाई ऊर्जा कंपनी के 3,329,189 लेनदेन पर पुराने "20% चेक" वाले तरीके के मुकाबले परीक्षण किया, तो परिणाम चौंकाने वाले थे:

  • गति: पुराने तरीके में इंसानों को यह काम करने में 310 से 357 घंटे लगे। नए स्कैनर ने इसे मात्र 4.5 घंटों में कर दिया। यह 98.7% समय की कमी है!
  • सटीकता: पुराने तरीके में "डिटेक्शन रिस्क" (चोर को चूक जाने की संभावना) 38.05% से 52.7% थी। नए रैंडम फॉरेस्ट मॉडल ने उस जोखिम को घटाकर केवल 2.01% कर दिया।
  • "मिस" रेश्यो: मैकनेमर के टेस्ट (McNemar's test) नामक एक सांख्यिकीय परीक्षण में, पुराने तरीके द्वारा पकड़े गए प्रत्येक खाते के बदले जिसे नया मॉडल छोड़ देता, नए मॉडल ने 107 ऐसे खाते पकड़े जिन्हें पुराना तरीका पूरी तरह से अनदेखा कर गया था।

मॉडल इतना अच्छा था कि जब उन्होंने इसे एक नए वर्ष के डेटा (FY2025) पर टेस्ट किया जिसे इसने पहले कभी नहीं देखा था, तब भी इसने 0.955 का सटीकता स्कोर (F1) प्राप्त किया। यह अन्य क्षेत्रों पर भी ठीक-ठाक काम करता था, हालांकि इसने उस डेटा पर सबसे अच्छा प्रदर्शन किया जिस पर इसे प्रशिक्षित किया गया था।

"एग्रीगेशन मास्किंग इफेक्ट" का जादू

शोधकर्ताओं ने एक ऐसी खोज की है जिसे वे "एग्रीगेशन मास्किंग इफेक्ट" कहते हैं।

कल्पना कीजिए कि आपके पास कंचों (marbles) का एक थैला है। यदि आप प्रत्येक कंचे को व्यक्तिगत रूप से देखते हैं, तो आप देख सकते हैं कि उन पर पेंट किए गए नंबर एक अजीब, संदिग्ध पैटर्न (बेनफोर्ड के नियम का उल्लंघन) का पालन करते हैं। लेकिन, यदि आप उन सभी कंचों को एक साथ मिलाकर मिट्टी की एक बड़ी, चिकनी गेंद बना देते हैं (अकाउंट टोटल्स में एग्रीगेट करना), तो वह अजीब पैटर्न गायब हो जाता है! नंबर बिल्कुल सामान्य दिखने लगते हैं।

अध्ययन में पाया गया कि जब उन्होंने 33 लाख व्यक्तिगत लेनदेन को देखा, तो नंबर संदिग्ध रूप से अजीब थे (p < 0.05)। लेकिन जब उन्होंने 9,909 अकाउंट सारांशों (मिट्टी की गेंद) को देखा, तो वह अजीबोगरीब व्यवहार गायब हो गया, और नंबर बिल्कुल ठीक दिखे (MAD < 0.006)।

इसका मतलब है कि मानक ऑडिट सॉफ्टवेयर, जो आमतौर पर केवल "मिट्टी की गेंद" (अकाउंट टोटल्स) की जांच करता है, व्यक्तिगत कंचों में छिपे धोखाधड़ी को मिस कर रहा है। पेपर सुझाव देता है कि सब कुछ पकड़ने के लिए ऑडिटर्स को दोनों स्तरों की जांच करने की आवश्यकता है।

ऑडिटर्स इसे वास्तवतः क्यों पसंद करते हैं

आमतौर पर, AI एक 'ब्लैक बॉक्स' की तरह होता है जो कहता है, "मुझे एक समस्या मिली है, मुझ पर भरोसा करो।" लेकिन इस सिस्टम में एक विशेष परत शामिल है जो इसके निष्कर्षों को उस भाषा में अनुवादित करती है जिसे ऑडिटर्स पहले से ही उपयोग करते हैं (इंटरनेशनल स्टैंडर्ड्स ऑन ऑडिटिंग, या ISA)। यह कहने के बजाय कि "फीचर X उच्च है," यह कहता है, "इस अकाउंट को फ्लैग किया गया क्योंकि साल-दर-साल बैलेंस 847% बढ़ गया, जो ISA 520 के नियमों का उल्लंघन करता है।"

जब नेशनल ऑडिट ऑफिस के वास्तविक ऑडिटर्स ने इन स्पष्टीकरणों की समीक्षा की, तो 94% ने कहा कि वे बिना किसी बदलाव के अपनी आधिकारिक रिपोर्टों में उपयोग करने के लिए तैयार हैं।

यह क्या नहीं है

पेपर सावधानी से कहता है कि यह अभी भी हर स्थिति के लिए एक जादुई छड़ी नहीं है।

  • इसका परीक्षण केवल एक विशिष्ट मंगोलियाई ऊर्जा कंपनी पर किया गया था। हालांकि यह परीक्षणों में अन्य क्षेत्रों में भी अच्छा काम करता था, लेखकों का कहना है कि हमें इसे कई अन्य प्रकार के संगठनों पर काम करते हुए देखने की आवश्यकता है।
  • यह केवल स्ट्रक्चर्ड नंबर्स (जैसे स्प्रेडशीट्स) को देखता है। यह अभी हाथ से लिखे नोट्स, पीडीएफ कॉन्ट्रैक्ट या कहानियों को नहीं पढ़ सकता।
  • "ग्राउंड ट्रुथ" (यह जानना कि चोर वास्तव में कौन थे) FY2023 और FY2024 की आधिकारिक ऑडिट रिपोर्टों से आया था। मॉडल को इनके विरुद्ध मान्य किया गया था, लेकिन लेखक नोट करते हैं कि विभिन्न देशों और अकाउंटिंग शैलियों में अधिक परीक्षण की आवश्यकता है।

निचोड़

शोधकर्ताओं ने Audit AI v10.0 नामक एक मुफ्त, ओपन-सोर्स टूल बनाया है जो मिनटों में लाखों लेनदेन को स्कैन कर सकता है, और उन धोखाधड़ी के जोखिमों को ढूंढ सकता है जिन्हें पुराना "बड़ी किताबों की जांच करने" वाला तरीका 19 गुना अधिक बार मिस कर देता है। यह साबित करता है कि केवल सैंपल लेने के बजाय सब कुछ की जांच करके, और बड़े सारांशों में दबने से पहले सूक्ष्म विवरणों को देखकर, हम बहुत तेज़ी से और बहुत अधिक विश्वास के साथ बुरे लोगों को पकड़ सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →