← नवीनतम पेपर
💻 computer science

Machine learning reduces audit detection risk in 3.3 million public sector general ledger transactions

यह अध्ययन प्रदर्शित करता है कि एक नवीन चार-स्तरीय मशीन लर्निंग फ्रेमवर्क, जिसे 3.3 मिलियन वास्तविक सार्वजनिक क्षेत्र के लेनदेन और आधिकारिक ऑडिट रिपोर्टों के विरुद्ध सत्यापित किया गया है, ऑडिट डिटेक्शन रिस्क को 38% से अधिक से घटाकर 2.01% करते हुए और प्रोसेसिंग समय को 98.7% कम करते हुए पारंपरिक 'मोनेटरी यूनिट सैंपलिंग' की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Tsetsegjargal Ulambayar, Oyunbileg Pagjii, Oyuntsetseg Luvsandash, Gantulga Garamdorj, Chimedtsogzol Sangajav

प्रकाशित 2026-08-13
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tsetsegjargal Ulambayar, Oyunbileg Pagjii, Oyuntsetseg Luvsandash, Gantulga Garamdorj, Chimedtsogzol Sangajav

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो 33 लाख असली सिक्कों के विशाल बैग में छिपे एक अकेले नकली सिक्के को खोजने की कोशिश कर रहे हैं। वित्तीय ऑडिटिंग की दुनिया में, यह एक दैनिक चुनौती है: धन के विशाल रिकॉर्ड्स में गलतियों या धोखाधड़ी को खोजना। पारंपरिक रूप से, ऑडिटर्स ने "मोनेटरी यूनिट सैंपलिंग" (MUS) नामक पद्धति का उपयोग किया है। इसे ऐसे समझें जैसे कोई खजाना खोजने वाला केवल मिट्टी के सबसे बड़े, सबसे स्पष्ट ढेरों में खुदाई करता है क्योंकि वे मानते हैं कि सोना वहीं होगा। वे रेत की छोटी, शांत जेबों को अनदेखा कर देते हैं, यह मानकर कि वे सुरक्षित हैं। लेकिन क्या होगा अगर नकली सिक्का उन छोटी, अनदेखी जेबों में छिपा हो? यही जोखिम है: बड़ी चीजों को देखने के चक्कर में बुरी चीजों को मिस कर देना।

इसे हल करने के लिए, वैज्ञानिक "मशीन लर्निंग" की ओर मुड़ रहे हैं, जो एक जासूस को एक सुपर-स्मार्ट, अथक रोबोट सहायक देने जैसा है। यह सहायक बैग के हर एक रिकॉर्ड को पढ़ सकता है, न कि केवल बड़े रिकॉर्ड्स को। यह उन पैटर्न्स को देखता है जिन्हें मानवीय आँखें मिस कर सकती हैं, जैसे कि नंबरों में एक अजीब लय या एक ऐसा लेनदेन जो "अजीब" महसूस होता है। लक्ष्य "डिटेक्शन रिस्क" (पकड़ने के जोखिम) को कम करना है, जो सरल शब्दों में अपराध को मिस करने की संभावना है। यदि रोबोट उस छोटी जेब में नकली सिक्के को ढूंढ सकता है, तो ऑडिट बहुत अधिक सुरक्षित और तेज़ हो जाता है। यह शोध एक बड़ा सवाल पूछता है: क्या यह रोबोट सहायक वास्तव में पुराने "बड़े ढेरों को खोदने" वाले तरीके की तुलना में सरकारी धन के वास्तविक रिकॉर्ड में गलतियों को बेहतर ढंग से ढूंढ सकता है, और क्या यह समझा सकता है कि उसने उन्हें क्यों पाया ताकि मानव ऑडिटर्स उस पर भरोसा कर सकें?


द सुपर-स्कैनर: कैसे AI ने घास के ढेर में सुई को खोज निकाला

इस अध्ययन में, मंगोलिया के शोधकर्ताओं की एक टीम ने एक सार्वजनिक ऊर्जा उपयोगिता (energy utility) के वित्तीय रिकॉर्ड की जांच करने के लिए एक चार-स्तरीय "सुपर-स्कैनर" बनाया। उन्होंने इसे केवल काल्पनिक नंबरों पर टेस्ट नहीं किया; उन्होंने इसे एक विशाल, वास्तविक दुनिया के डेटासेट पर चलाया जिसमें तीन वर्षों (2023, 2024, और 2025) के 3,329,189 व्यक्तिगत लेनदेन शामिल थे। यह डेटा का एक पहाड़ था जिसका कुल मूल्य MNT 16.34 ट्रिलियन (बहुत सारे तुगरिक्स!) था।

पुराना तरीका बनाम नया तरीका
शोधकर्ताओं ने अपने नए मशीन लर्निंग सिस्टम की तुलना पुराने मानक से की, जो ऊपर बताए गए "बड़े ढेरों को खोदने" वाले तरीके जैसा है। पुराने तरीके में, ऑडिटर्स चेक करने के लिए खातों का एक रैंडम 20% सैंपल चुनते थे। अध्ययन में पाया गया कि इस पुराने तरीके में एक बड़ी कमी थी: इसमें "डिटेक्शन रिस्क" (गलती मिस करने की संभावना) 38.05% और 52.7% के बीच थी। सरल भाषा में, इसका मतलब है कि लगभग आधे मामलों में, पुराना तरीका धोखाधड़ी या त्रुटियों को पूरी तरह से मिस कर सकता था।

हालाँकि, नया मशीन लर्निंग सिस्टम एक जाल की तरह काम करता है जिसने सब कुछ पकड़ लिया। इसने पूरे 3.3 मिलियन लेनदेन को मात्र 4.5 घंटों में प्रोसेस कर दिया। इसे समझने के लिए, पुराना तरीका करने में मानव ऑडिटर्स को 310 से 357 घंटे लगते। यह समय में 98.7% की कमी है!

रोबोट ने कैसे सीखा (बिना किसी शिक्षक के)
आमतौर पर, धोखाधड़ी को पहचानने के लिए रोबोट को सिखाने के लिए पहले उसे "अच्छे" और "बुरे" रिकॉर्ड्स के हजारों उदाहरण दिखाने पड़ते हैं। लेकिन असल जिंदगी में, ऑडिटर्स को यह नहीं पता होता कि कौन से रिकॉर्ड खराब हैं जब तक कि वे ऑडिट पूरा नहीं कर लेते। यह एक पेच है।

लेखकों ने इस समस्या को एक चतुर ट्रिक से हल किया जिसे "सेल्फ-लेबलिंग" सिस्टम कहा जाता है। कल्पना कीजिए कि तीन अलग-अलग जासूसों (आइसोलेशन फॉरेस्ट, Z-स्कोर, और टर्न-रेशियो एनालिसिस) का एक समूह स्वतंत्र रूप से डेटा को देख रहा है। यदि उनमें से कम से कम दो इस बात पर सहमत होते हैं कि एक रिकॉर्ड संदिग्ध लग रहा है, तो सिस्टम उसे "एनोमैलस" (असामान्य) के रूप में चिह्नित करता है। यह बिना किसी पूर्व-लिखित उत्तर कुंजी के, मुख्य रोबोट (एक रैंडम फॉरेस्ट मॉडल) को बुरे तत्वों को पहचानने के लिए सीखने हेतु डेटा का एक सेट तैयार करता है।

परिणाम: 19 गुना सुधार
जब उन्होंने इस सिस्टम का परीक्षण किया, तो परिणाम चौंकाने वाले थे। रैंडम फॉरेस्ट मॉडल ने 0.966 का F1 स्कोर और 0.999 का AUC प्राप्त किया, जबकि "डिटेक्शन रिस्क" को घटाकर केवल 2.01% कर दिया। यह पुराने तरीके की तुलना में 19 गुना सुधार है। यह साबित करने के लिए कि यह केवल किस्मत नहीं थी, उन्होंने एक सांख्यिकीय परीक्षण (मैकनेमार टेस्ट) चलाया, जिससे पता चला कि पुराने तरीके द्वारा पकड़ी गई प्रत्येक गलती के लिए, नए मशीन लर्निंग मॉडल ने उन 107 गलतियों को पकड़ा जिन्हें पुराने तरीके ने छोड़ दिया था। गणित इतना स्पष्ट था कि इसके संयोग से होने की संभावना 0.001 से भी कम थी।

"एग्रीगेशन मास्किंग" का आश्चर्य
इस पेपर की सबसे दिलचस्प खोजों में से एक है जिसे लेखक "एग्रीगेशन मास्किंग इफेक्ट" कहते हैं। उन्होंने एक क्लासिक नियम का परीक्षण किया जिसे बेनफोर्ड का नियम (Benford's Law) कहा जाता है, जो भविष्यवाणी करता है कि वास्तविक जीवन में नंबर कैसे शुरू होने चाहिए (जैसे कि नंबरों की शुरुआत में कितने 1, 2, या 3 दिखने चाहिए)।

जब उन्होंने 3.3 मिलियन व्यक्तिगत लेनदेन को देखा, तो नंबर अजीब थे और बेनफोर्ड के नियम को तोड़ रहे थे (जो हेरफेर का संकेत है)। लेकिन, जब उन्होंने उन्हीं लेनदेन को खाता सारांश (account summaries) में समूहीकृत किया (जैसे कि एक बैंक खाते के सभी लेनदेन को जोड़ना), तो वह अजीबोगरीब व्यवहार गायब हो गया! नंबर पूरी तरह से सामान्य दिखने लगे।

यह वैसा ही है जैसे यदि आप लोगों की भीड़ को व्यक्तिगत रूप से देखें, तो आप देखेंगे कि कुछ लाल टोपी पहने हैं और कुछ नीली। लेकिन यदि आप दूर से पूरी भीड़ की फोटो लेते हैं, तो रंग मिलकर एक उबाऊ ग्रे रंग बन जाते हैं। अध्ययन में पाया गया कि यदि ऑडिटर्स केवल "ग्रे फोटो" (खाता सारांश) को देखते हैं, तो वे "लाल टोपियों" (लेनदेन-स्तर की धोखाधड़ी) को मिस कर देते हैं। यह सुझाव देता है कि धोखाधड़ी को वास्तव में पकड़ने के लिए, ऑडिटर्स को केवल बड़े सारांशों को नहीं, बल्कि व्यक्तिगत लेनदेन को देखने की आवश्यकता है।

क्या रोबोट खुद को समझा सकता है?
AI के बारे में एक बड़ी चिंता यह है कि यह एक "ब्लैक बॉक्स" है—यह एक उत्तर देता है लेकिन यह नहीं बताता कि क्यों। शोधकर्ताओं ने इस स्तर को जोड़कर इसे ठीक किया जो रोबोट की गणित को "ऑडिटर की भाषा" में अनुवादित करता है। "फीचर X का वेट बहुत अधिक है" कहने के बजाय, सिस्टम कहता है, "इस खाते को इसलिए फ्लैग किया गया क्योंकि एक वर्ष में बैलेंस 847% बढ़ गया, जो ISA 520 के नियमों का उल्लंघन करता है।"

जब नेशनल ऑडिट ऑफिस के वास्तविक ऑडिटर्स ने इन स्पष्टीकरणों की समीक्षा की, तो 94% ने कहा कि वे एकदम सही थे और बिना किसी बदलाव के आधिकारिक रिपोर्टों में उपयोग किए जा सकते हैं। यह साबित करता है कि रोबोट केवल अनुमान नहीं लगा रहा है; वह इस तरह से तर्क दे रहा है जिसे मानव पेशेवर समझते हैं।

क्या यह अन्य डेटा पर काम करता है?
टीम ने यह भी परीक्षण किया कि क्या उनका रोबोट बिना दोबारा प्रशिक्षित हुए अन्य क्षेत्रों (जैसे विभिन्न सरकारी विभागों) के डेटा को संभाल सकता है। हालांकि यह उस ऊर्जा उपयोगिता पर सबसे अच्छा काम करता है जिस पर इसे प्रशिक्षित किया गया था, फिर भी इसने अन्य क्षेत्रों में पुराने "20% सैंपल" विधि की तुलना में काफी बेहतर प्रदर्शन किया, और बिना किसी विशिष्ट प्रशिक्षण के भी अधिकांश त्रुटियों को पकड़ा।

निष्कर्ष
यह पेपर दिखाता है कि मशीन लर्निंग केवल एक भविष्यवादी विचार नहीं है; यह एक व्यावहारिक उपकरण है जो 3.3 मिलियन लेनदेन को 4.5 घंटों में स्कैन कर सकता है, लगभग पूर्ण अलगाव (AUC=0.999) और उच्च सटीकता (F1=0.966) के साथ गलतियों को ढूंढ सकता है, और अपने निष्कर्षों को सरल अंग्रेजी में समझा सकता है। यह हमें यह भी चेतावनी देता है कि बड़े सारांशों को देखना पर्याप्त नहीं है—धोखाधड़ी को पकड़ने के लिए हमें सूक्ष्म विवरणों पर ध्यान केंद्रित करने की आवश्यकता है। लेखकों ने इस सिस्टम को फ्री, ओपन-सोर्स सॉफ्टवेयर के रूप में भी जारी किया है, ताकि अन्य ऑडिटर्स भी इस "सुपर-स्कैनर" का उपयोग करके सार्वजनिक धन को अधिक सुरक्षित बना सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →