← नवीनतम पेपर
💻 computer science

AI foundation model choice and false positive variation in Anti Money Laundering transaction screening

यह अध्ययन प्रदर्शित करता है कि मनी लॉन्ड्रिंग विरोधी लेनदेन की स्क्रीनिंग के लिए विभिन्न लार्ज लैंग्वेज मॉडल्स का चयन करने से फॉल्स पॉजिटिव दरों और परिचालन कार्यभार में भारी भिन्नता आती है, जो मॉडल चयन को एक महत्वपूर्ण परिचालन जोखिम पैरामीटर के रूप में स्थापित करता है जिसके लिए स्पष्ट शासन और निगरानी की आवश्यकता है।

मूल लेखक: Samir Chincholikar, Robin Chawla

प्रकाशित 2026-09-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Samir Chincholikar, Robin Chawla

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

हर साल, वैश्विक वित्तीय प्रणाली के माध्यम से भारी मात्रा में धन प्रवाहित होता है, जिसका कुछ हिस्सा अवैध लाभ के उद्गम को छिपाने के लिए होता है। इसे रोकने के लिए, बैंकों और अन्य वित्तीय संस्थानों को अपने ग्राहकों के लेनदेन पर बारीकी से नज़र रखने की आवश्यकता होती है, ताकि उन पैटर्नों की पहचान की जा सके जो मनी लॉन्ड्रिंग का संकेत देते हैं। दशकों से, वे इस प्रारंभिक निगरानी के लिए कंप्यूटर प्रणालियों पर भरोसा करते आए हैं। ये प्रणालियाँ एक छलनी की तरह काम करती हैं, जो संदिग्ध दिखने वाली किसी भी चीज़ को पकड़ लेती हैं और उसे मानव अन्वेषक द्वारा समीक्षा के लिए चिह्नित कर देती हैं। समस्या यह है कि ये छलनियाँ अक्सर बहुत मोटी होती हैं। वे वास्तविक खतरों के साथ बड़ी मात्रा में निर्दोष गतिविधियों को भी पकड़ लेती हैं, जिससे गलत अलार्म का एक पहाड़ खड़ा हो जाता है। यह विश्लेषकों को निर्दोष लोगों की जांच करने में घंटों बर्बाद करने, संसाधनों को नष्ट करने और ग्राहकों को अनावश्यक तनाव देने के लिए मजबूर करता है।

हाल ही में, एक नए प्रकार की कंप्यूटर बुद्धिमत्ता ने चर्चा में प्रवेश किया है। ये 'लार्ज लैंग्वेज मॉडल्स' (LLMs) हैं, जो विशाल मात्रा में टेक्स्ट पर प्रशिक्षित शक्तिशाली उपकरण हैं जो विशिष्ट नियमों को हर परिदृश्य के लिए सिखाए बिना जटिल स्थितियों को समझ और तर्क दे सकते हैं। क्योंकि वे लेनदेन के इतिहास को पढ़ सकते हैं और संख्याओं के पीछे की कहानी को समझ सकते हैं, इसलिए कई विशेषज्ञों को उम्मीद थी कि वे गलत अलार्म की समस्या को हल कर सकते हैं। विचार यह था कि ये मॉडल पुराने नियम-आधारित सिस्टम की तुलना में अधिक स्मार्ट हो सकते हैं, और एक वैध व्यावसायिक भुगतान तथा एक संदिग्ध हस्तांतरण के बीच अधिक सटीकता से अंतर कर सकते हैं। हालांकि, एक महत्वपूर्ण प्रश्न अनुत्तरित रह गया था: यदि एक बैंक इन नए मॉडलों में से एक को दूसरे के ऊपर चुनता है, तो क्या वास्तव में इससे कोई फर्क पड़ता है? या क्या वे सभी एक ही उपकरण के विभिन्न संस्करण हैं, जो आपस में बदले जा सकते हैं और अनुमानित हैं?

स्वतंत्र शोधकर्ताओं की एक टीम ने इस उत्तर को खोजने के लिए हाथ मिलाया, जिसमें उन्होंने मॉडल के चयन को केवल एक साधारण सॉफ्टवेयर निर्णय के रूप में नहीं, बल्कि बैंक के संचालन के लिए एक मौलिक जोखिम के रूप में देखा। उन्होंने दो प्रमुख प्रौद्योगिकी प्रदाताओं के पांच अलग-अलग, व्यावसायिक रूप से उपलब्ध लार्ज लैंग्वेज मॉडल्स को एकत्र किया। उन्होंने इन मॉडलों को बैंक डेटा पर प्रशिक्षित नहीं किया और न ही उनकी सेटिंग्स में बदलाव किया; इसके बजाय, उन्होंने प्रत्येक को एक 'फ्रेश, ज़ीरो-शॉट स्क्रीनर' के रूप में कार्य करने के लिए कहा, जिसका अर्थ है कि उन्हें केवल अपने मौजूदा ज्ञान के आधार पर निर्णय लेना था। एक निष्पक्ष परीक्षण सुनिश्चित करने के लिए, शोधकर्ताओं ने छह सौ सिंथेटिक लेनदेन मामलों का एक नियंत्रित सेट बनाया। इनमें से तीन सौ मामले ज्ञात मनी लॉन्ड्रिंग योजनाओं जैसे दिखने के लिए डिज़ाइन किए गए थे, जबकि अन्य तीन सौ पूरी तरह से वैध लेनदेन थे जिन्हें इतना संदिग्ध बनाया गया था कि वे कम सावधान सिस्टम को भी भ्रमित कर सकें। ये "हार्ड नेगेटिव्स" थे, यानी वे निर्दोष लेनदेन जो अक्सर गलती से चिह्नित हो जाते हैं।

शोधकर्ताओं ने फिर इन छह सौ मामलों में से प्रत्येक को सभी पांच मॉडलों को भेजा, और प्रत्येक से यह तय करने को कहा कि लेनदेन संदिग्ध है या नहीं। परिणाम चौंकाने वाले थे। जब मॉडलों ने उन तीन सौ वैध लेनदेनों को देखा, तो उनका व्यवहार बहुत भिन्न रहा। एक मॉडल ने उनमें से केवल एक बहुत छोटे हिस्से को संदिग्ध के रूप में चिह्नित किया, जबकि दूसरे ने अधिकांश को संदिग्ध बताया। वास्तव में, सबसे अच्छे और सबसे खराब प्रदर्शन करने वाले मॉडलों के बीच गलत अलार्म उठाने की आवृत्ति में भारी अंतर था। समान निर्दोष लेनदेन के लिए, एक मॉडल ने सौ में से एक बार से भी कम बार गलती की, जबकि दूसरे ने दस में से आठ बार से अधिक बार गलती की। मॉडल केवल कुछ कठिन मामलों में असहमत नहीं थे; वे लगभग नब्बे प्रतिशत वैध लेनदेनों पर असहमत थे। यह कि किसी विशिष्ट निर्दोष ग्राहक को जांच के लिए चिह्नित किया जाएगा या नहीं, यह लगभग पूरी तरह से इस बात पर निर्भर करता था कि स्क्रीनिंग करने वाला विशिष्ट कंप्यूटर मॉडल कौन सा है।

अध्ययन ने प्रत्येक कंपनी द्वारा प्रदान किए गए मॉडलों के परिवारों के भीतर एक स्पष्ट पैटर्न भी प्रकट किया। दोनों ही मामलों में, छोटे और कम महंगे मॉडल कहीं अधिक आक्रामक थे, जो शक्तिशाली और महंगे समकक्षों की तुलना में निर्दोष गतिविधि को बहुत उच्च दर पर चिह्नित करते थे। शोधकर्ताओं ने पाया कि ये मॉडल केवल एक ही कार्य में बेहतर या बदतर नहीं थे; बल्कि, वे सावधानी के स्पेक्ट्रम पर पूरी तरह से अलग बिंदुओं पर काम कर रहे थे। एक मॉडल लगभग सभी पर आरोप लगाने के लिए इतना उत्सुक था, जबकि दूसरा निर्दोष लोगों को परेशान करने से बचने के लिए कुछ संदिग्ध गतिविधियों को जाने देने के लिए इतना सतर्क था। इस ट्रेड-ऑफ का अर्थ था कि मॉडल चुनना केवल एक तकनीकी विकल्प नहीं था; यह इस बारे में एक चुनाव था कि बैंक के कर्मचारियों को प्रतिदिन कितने गलत अलार्म का सामना करना पड़ेगा।

एक वास्तविक दुनिया के बैंक के लिए इसका क्या अर्थ है, इसे समझने के लिए, शोधकर्ताओं ने एक ऐसी स्थिति की कल्पना की जहाँ एक संस्थान प्रतिदिन दस लाख लेनदेन संसाधित करता है, जिसमें संदिग्ध लेनदेन का प्रतिशत बहुत कम है। इन परिस्थितियों में, मॉडल के चयन का अंतर कार्यभार में भारी अंतर में बदल जाता है। सबसे सतर्क मॉडल जांचकर्ताओं की समीक्षा के लिए प्रबंधनीय संख्या में अलर्ट उत्पन्न करेगा। हालाँकि, सबसे आक्रामक मॉडल अलर्ट की एक ऐसी कतार उत्पन्न करेगा जो लगभग दो सौ गुना बड़ी होगी। इस परिदृश्य में, सबसे आक्रामक मॉडल गलत अलार्म की बाढ़ ला देगा, जहाँ लगभग हर एक अलर्ट एक गलती साबित होगी, जो वास्तविक खतरों को दबा देगी। इसने दिखाया कि मॉडल का चुनाव बैंक के अनुपालन दल (compliance team) की दैनिक वास्तविकता को मौलिक रूप से बदल सकता है, जिससे वे केंद्रित जांच की स्थिति से हटकर अत्यधिक शोर (noise) की स्थिति में पहुँच सकते हैं।

शोधकर्ताओं ने यह भी जाँच की कि क्या ये मॉडल एक ही तरह से विफल होंगे, जिसे 'एल्गोरिद्मिक मोनोकल्चर' (algorithmic monoculture) की चिंता कहा जाता है, जहाँ हर कोई एक ही उपकरण पर निर्भर होता है और इस प्रकार एक ही तरह की गलतियाँ करता है। उन्होंने पाया कि ऐसा नहीं था। मॉडलों ने एक ही संदिग्ध लेनदेन को मिस नहीं किया; बल्कि, उन्होंने अलग-अलग लेनदेन को मिस किया। असली खतरा यह नहीं था कि वे सभी किसी अपराधी को फिसलने देंगे, बल्कि यह था कि वे इस बात पर असहमत थे कि कौन निर्दोष है। इस विचलन का अर्थ था कि अलग-अलग मॉडल उपयोग करने वाले दो बैंकों के एक ही ग्राहक की गतिविधि के प्रति पूरी तरह से अलग दृष्टिकोण हो सकते हैं। एक बैंक एक सामान्य व्यावसायिक पैटर्न देख सकता है, जबकि दूसरा उसमें अपराध देख सकता है।

अध्ययन ने निष्कर्ष निकाला कि इन लार्ज लैंग्वेज मॉडल्स को बदले जाने योग्य घटकों के रूप में मानना एक खतरनाक गलती है। पारंपरिक सॉफ्टवेयर के विपरीत, जहाँ कोड उपयोगकर्ता द्वारा नियंत्रित और स्थिर होता है, ये वाणिज्यिक मॉडल प्रदाता द्वारा अपडेट किए जा सकते हैं, बदले जा सकते हैं, या बदले जा सकते हैं, और बैंक को इसकी सीधी जानकारी भी नहीं होगी। एक मॉडल जो आज अच्छा काम कर रहा है, उसे कल एक अलग संस्करण से बदला जा सकता है जो पूरी तरह से अलग व्यवहार करता है, जिससे बैंक के अपने सिस्टम में कोई बदलाव किए बिना उसका पूरा संचालन उच्च सटीकता से अराजकता की स्थिति में बदल सकता है। शोधकर्ताओं ने तर्क दिया कि बैंकों को मॉडल की विशिष्ट पहचान को अपने जोखिम प्रबंधन के एक महत्वपूर्ण हिस्से के रूप में मानना चाहिए। उन्हें यह जानने की आवश्यकता है कि वे किस संस्करण का उपयोग कर रहे हैं, नियमित आधार पर इसके व्यवहार की निगरानी करनी चाहिए, और यह समझना चाहिए कि मॉडल को बदलना एक बड़ी घटना है जो अपराध पकड़ने की उनकी क्षमता और ग्राहकों को परेशान करने के बीच के संतुलन को नाटकीय रूप से बदल सकती है। मॉडल का चयन केवल एक खरीद संबंधी विवरण नहीं है; यह वह सेटिंग है जो यह निर्धारित करती है कि सिस्टम दुनिया को कैसे देखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →