← नवीनतम पेपर
📄 health informatics

Improving Medicare Fraud Detection Accuracy in Deep Learning by Exploring Feature Selection and Data Sampling Techniques.

यह अध्ययन प्रदर्शित करता है कि डेटासेट असंतुलन और अप्रासंगिक विशेषताओं को प्रभावी ढंग से संबोधित करके, डीप लर्निंग को ची-स्क्वायर फीचर सिलेक्शन और सिंथेटिक मिनोरिटी ओवर-सैंपलिंग (SMOTE) तकनीकों के साथ संयोजित करने से मेडिकेयर धोखाधड़ी का पता लगाने की सटीकता को 95.4% तक महत्वपूर्ण रूप से सुधारा जा सकता है।

मूल लेखक: Ahammed, F.

प्रकाशित 2026-03-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ahammed, F.

मूल पेपर CC0 1.0 (https://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि मेडिकेयर प्रणाली एक विशाल, हलचल भरे सुपरमार्केट की तरह है जहाँ लाखों लोग हर दिन किराने का सामान (चिकित्सा सेवाएँ) खरीदते हैं। स्टोर मैनेजर (बीमा कंपनियाँ) बिलों का भुगतान करते हैं। लेकिन, एक समस्या है: दुकानदारों के एक समूह (धोखाधड़ी करने वालों) ने चतुराई से चोरी करने के तरीके खोज लिए हैं, वे सामान चुराते हैं और फिर स्टोर से उनके लिए भुगतान करने की कोशिश करते हैं। कभी-कभी वे उन चीजों को खरीदने का नाटक करते हैं जिन्हें उन्होंने छुआ तक नहीं, या वे रसीद में कुछ अतिरिक्त चीजें चुपके से जोड़ देते हैं।

लंबे समय तक, स्टोर मैनेजरों ने इन चोरों को पकड़ने के लिए सरल चेकलिस्ट और बुनियादी नियमों का उपयोग करने की कोशिश की। लेकिन चोर अधिक चालाक हो गए, और सूचियाँ बहुत लंबी और भ्रमित करने वाली हो गईं। मैनेजर कागजी कार्रवाई में डूब रहे थे, जो एक विशाल बैरल में से कुछ खराब सेबों को खोजने की कोशिश कर रहे थे।

यह पेपर एक नए, हाई-टेक सुरक्षा तंत्र की तरह है जिसे उन चोरों को बहुत बेहतर तरीके से पकड़ने के लिए डिज़ाइन किया गया है। यहाँ बताया गया है कि लेखकों ने इसे कैसे बनाया, इसे सरल रूप में समझाया गया है:

1. समस्या: बहुत अधिक शोर, बहुत कम संकेत

मैनेजरों के पास जो डेटा है वह रसीदों के एक विशाल, अस्त-व्यस्त ढेर जैसा है।

  • असंतुलन (The Imbalance): रसीदें बहुत सारी हैं (ईमानदार रसीदों का "Not Fraud" ढेर बहुत बड़ा है), लेकिन नकली रसीदें ( "Fraud" वाला ढेर) बहुत छोटी हैं। यदि आप एक सुरक्षा गार्ड को चोरों को खोजने के लिए प्रशिक्षित करते हैं, लेकिन आप उसे केवल 99% समय ईमानदार रसीदें दिखाते हैं, तो गार्ड यह मान लेगा कि सब कुछ ईमानदार है और वह चोरों को मिस कर देगा।
  • शोर (The Clutter): रसीदों में सूचना के 56 अलग-अलग कॉलम (तारीखें, डॉक्टर के नाम, राशि आदि) हैं। इनमें से कई कॉलम केवल "शोर" हैं—जैसे रसीद पर स्याही का रंग। वे चोर को खोजने में मदद नहीं करते; वे केवल कंप्यूटर को भ्रमित करते हैं।

2. समाधान: तीन-चरणीय सफाई प्रक्रिया

लेखकों ने एक स्मार्ट कंप्यूटर दिमाग (एक Deep Learning मॉडल) बनाने का निर्णय लिया और इसे गंदगी साफ करने के लिए तीन विशेष उपकरण दिए।

टूल A: "फीचर सिलेक्शन" (जासूस का आवर्धक लेंस)

कल्पना कीजिए कि आप भीड़ में किसी विशिष्ट व्यक्ति को देख रहे हैं। आपको उसके जूते का आकार, उसका पसंदीदा आइसक्रीम फ्लेवर या उसका जन्मदिन जानने की आवश्यकता नहीं है। आपको बस उसकी ऊंचाई, बालों का रंग और वह क्या पहने हुए है, यह जानने की आवश्यकता है।

  • उन्होंने क्या किया: कंप्यूटर ने डेटा के सभी 56 कॉलमों को देखा और पूछा, "कौन से कॉलम वास्तव में हमें झूठ पकड़ने में मदद करते हैं?"
  • परिणाम: उन्होंने सबसे महत्वपूर्ण 25 सुरागों को चुनने और बाकी को हटाने के लिए Chi-Square नामक एक गणितीय ट्रिक का उपयोग किया। यह सुरक्षा गार्ड को यह बताने जैसा है कि, "जूते का आकार छोड़ो; बस बटुए पर नज़र रखो।" इससे कंप्यूटर तेज़ और अधिक सटीक हो गया।

टूल B: "डेटा सैंपलिंग" (एक संतुलित आहार)

याद है वह समस्या जहाँ "ईमानदार" ढेर बहुत बड़ा था और "धोखाधड़ी" वाला ढेर बहुत छोटा था? यदि आप कंप्यूटर को ज्यादातर ईमानदार रसीदें खिलाते हैं, तो वह आलसी हो जाता है और धोखाधड़ी देखना बंद कर देता है।

  • समाधान: उन्हें आहार को संतुलित करने की आवश्यकता थी।
    • रैंडम अंडर-सैंपलिंग (Random Under-Sampling): उन्होंने कुछ ईमानदार रसीदें फेंक दीं ताकि ढेर बराबर हो सकें। (जैसे कि स्टेक के लिए जगह बनाने के लिए सलाद कम खाना)।
    • रैंडम ओवर-सैंपलिंग (Random Over-Sampling): उन्होंने धोखाधड़ी की रसीदों की फोटोकॉपी बनाई ताकि उनकी संख्या बढ़ सके। (जैसे कि "वांटेड" पोस्टर की अधिक प्रतियां बनाना)।
    • SMOTE (गुप्त नुस्खा): यह सबसे चतुर उपकरण है। धोखाधड़ी की रसीद की केवल फोटोकॉपी करने के बजाय, SMOTE बिल्कुल नई, नकली धोखाधड़ी की रसीदें बनाता है जो लगभग असली दिखती हैं। यह दो वास्तविक धोखाधड़ी की रसीदों के फीचर्स को आपस में मिलाता है और एक "हाइब्रिड" उदाहरण बनाता है। यह कंप्यूटर को केवल एक ही धोखाधड़ी को बार-बार कॉपी-पेस्ट करने के बजाय, धोखाधड़ी के पैटर्न को पहचानना सिखाता है।

टूल C: डीप लर्निंग मॉडल (सुपर-ब्रेन)

एक बार जब डेटा साफ हो गया (सुराग चुने गए) और संतुलित हो गया (ढेर बराबर हो गए), तो उन्होंने इसे एक Deep Learning मॉडल में फीड किया। इसे एक सुपर-स्मार्ट AI के रूप में सोचें जो जटिल पैटर्न सीख सकता है जिन्हें इंसान नहीं देख सकते। यह एक सुरक्षा कैमरे की तरह है जो न केवल चेहरे को देखता है, बल्कि यह भी विश्लेषण करता है कि व्यक्ति कैसे चलता है, वह अपना बैग कैसे पकड़ता है, और वह कैशियर के साथ कैसे व्यवहार करता है।

3. परिणाम: चोरों को पकड़ना

जब उन्होंने इस नए सिस्टम का परीक्षण किया, तो परिणाम प्रभावशाली थे:

  • पुराना तरीका: एक बुनियादी कंप्यूटर मॉडल ने लगभग 92% धोखाधड़ी पकड़ी।
  • नया तरीका: "आवर्धक लेंस" (फीचर सिलेक्शन) और "संतुलित आहार" (SMOTE) का उपयोग करके, नए सिस्टम ने 95.4% धोखाधड़ी पकड़ी।

इससे भी बेहतर, सिस्टम भ्रमित नहीं हुआ या "जरूरत से ज्यादा नहीं सोचा" (जिसे ओवरफिटिंग कहा जाता है)। यह सुसंगत रहा, जिससे साबित हुआ कि इसने वास्तव में धोखाधड़ी के नियमों को सीखा है, न कि केवल रसीदों को याद किया है।

मुख्य तस्वीर (The Big Picture)

मुख्य निष्कर्ष सरल है: आप केवल एक स्मार्ट कंप्यूटर को एक अव्यवस्थित समस्या पर नहीं फेंक सकते और उम्मीद नहीं कर सकते कि यह काम करेगा। आपको पहले डेटा को साफ करना होगा।

  • फीचर सिलेक्शन चश्मा साफ करने जैसा है ताकि आप स्पष्ट रूप से देख सकें।
  • डेटा सैंपलिंग यह सुनिश्चित करने जैसा है कि आप केवल आसान उदाहरणों के बजाय आसान और कठिन दोनों उदाहरणों के साथ अभ्यास करें।
  • डीप लर्निंग उस एथलीट की तरह है जो ट्रैक साफ होने के बाद दौड़ता है।

इन तीनों को मिलाकर, लेखकों ने एक ऐसा सिस्टम बनाया जो पैसा बचाता है, ईमानदार मरीजों की रक्षा करता है, और स्वास्थ्य प्रणाली को सुचारू रूप से चलाने में मदद करता है। उन्होंने यहाँ तक सुझाव दिया है कि भविष्य में, वे ब्लॉकचेन (एक डिजिटल, अपरिवर्तनीय लेजर) का उपयोग कर सकते हैं ताकि यह सुनिश्चित किया जा सके कि रसीदें कंप्यूटर तक पहुँचने से पहले कभी बदली न जा सकें।

संक्षेप में: उन्होंने चिकित्सा बिलों के एक बिखरे हुए, भ्रमित करने वाले ढेर को लिया, उसे साफ किया, उसे संतुलित किया, और एक सुपर-कंप्यूटर को झूठ बोलने वालों को पहचानने के लिए प्रशिक्षित किया, जिसके परिणामस्वरूप एक ऐसा सिस्टम बना जो सिस्टम को धोखा देने की कोशिश करने वाले लगभग सभी लोगों को पकड़ लेता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →