← नवीनतम पेपर
💻 computer science

Explainable Machine Learning for Detecting Fraudulent Online Job Postings in Ghana: A SHAP-Based Approach

यह अध्ययन घाना में धोखाधड़ी वाली ऑनलाइन जॉब पोस्टिंग का प्रभावी ढंग से पता लगाने के लिए मशीन लर्निंग और SHAP-आधारित व्याख्यात्मकता (explainability) का लाभ उठाता है, जिसमें मल्टीनोमियल नैव बेयस (Multinomial Naive Bayes) और लॉजिस्टिक रिग्रेशन (Logistic Regression) को शीर्ष प्रदर्शन करने वाले मॉडलों के रूप में पहचाना गया है और शैक्षिक आवश्यकताओं, आवेदन की समय सीमा और नौकरी के वर्गीकरण को प्रमुख धोखाधड़ी संकेतकों के रूप में रेखांकित किया गया है।

मूल लेखक: Agyapong Ansong Afia Korantemaa

प्रकाशित 2026-06-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Agyapong Ansong Afia Korantemaa

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप घाना के एक हलचल भरे डिजिटल बाज़ार में नौकरी की तलाश में घूम रहे हैं। यह एक आशाजनक जगह है, लेकिन यह धोखेबाजों से भी भरी हुई है। कुछ लोग केवल आपका पैसा या आपकी व्यक्तिगत जानकारी चुराने के लिए फर्जी नौकरी के विज्ञापन पोस्ट कर रहे हैं। यही वह समस्या है जिसे यह शोध पत्र संबोधित करता है: कैसे किसी को नुकसान पहुँचाने से पहले इन फर्जी विज्ञापनों की पहचान की जाए।

लेखिका, अयापोंग अनसोंग अफ़िया कोरांटेमा (Agyapong Ansong Afia Korantemaa) ने मशीन लर्निंग (Machine Learning) का उपयोग करके एक "डिजिटल जासूस" बनाने का निर्णय लिया। लेकिन यहाँ एक मोड़ है: आमतौर पर, ये स्मार्ट कंप्यूटर प्रोग्राम "ब्लैक बॉक्स" की तरह होते हैं। आप डेटा डालते हैं, और परिणाम बाहर आता है, लेकिन कोई नहीं जानता कि कंप्यूटर ने वह निर्णय क्यों लिया। लेखिका ने SHAP (जो Shapley Additive Explanations को दर्शाता है) नामक एक विशेष टूल का उपयोग करके इसे ठीक करना चाहा, ताकि यह जासूस अपने तर्क को सरल अंग्रेजी (साधारण भाषा) में समझा सके।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे सरल रूप में विभाजित किया गया है:

1. प्रशिक्षण का मैदान (डेटा)

शोधकर्ताओं ने Jobweb Ghana का रुख किया, जो देश की सबसे बड़ी जॉब साइटों में से एक है। उन्होंने 499 जॉब पोस्टिंग का एक संग्रह इकट्ठा किया।

  • अच्छे लोग: इनमें से 360 वैध और वास्तविक नौकरियाँ थीं।
  • बुरे लोग: 139 विज्ञापनों को स्कैम (धोखाधड़ी) के रूप में पुष्टि की गई थी।

इस डेटासेट को 499 जॉब फ्लायर्स के एक ढेर के रूप में समझें। शोधकर्ताओं ने इन फ्लायर्स को एक कंप्यूटर में डाला ताकि उसे सिखाया जा सके कि एक स्कैम कैसा दिखता है।

2. प्रतियोगी (मॉडल)

लेखिका ने केवल एक जासूस का उपयोग नहीं किया; उन्होंने यह देखने के लिए एक पाँच-तरफा दौड़ आयोजित की कि कौन सा कंप्यूटर एल्गोरिदम फर्जी विज्ञापनों को पकड़ने में सबसे अच्छा है। उन्होंने इनका परीक्षण किया:

  1. Multinomial Naive Bayes: एक सांख्यिकीय जासूस जो देखता है कि कुछ शब्द या तथ्य कितनी बार एक साथ आते हैं।
  2. Logistic Regression: एक गणित-केंद्रित जासूस जो "असली" और "नकली" को अलग करने के लिए एक रेखा खींचता है।
  3. Random Forest: निर्णय लेने वालों की एक टीम (जैसे निर्णयों का एक समूह या पेड़ों की एक समिति) जो उत्तर पर वोट देती है।
  4. K-Nearest Neighbors: एक जासूस जो किसी जॉब पोस्ट के "पड़ोसियों" (समान पोस्ट) को देखता है ताकि यह पता चल सके कि वे स्कैमर हैं या नहीं।
  5. Decision Tree: एक जासूस जो निष्कर्ष तक पहुँचने के लिए 'हाँ/नहीं' के प्रश्नों की एक श्रृंखला पूछता है।

3. दौड़ का परिणाम

परीक्षण चलाने के बाद, Multinomial Naive Bayes और Logistic Regression मॉडल स्पष्ट विजेता बनकर उभरे।

  • वे लगभग 92% सटीक थे।
  • वे स्कैमरों को पकड़ने में बहुत अच्छे थे (उच्च "Recall") और बिना ज़रूरत के गलत चेतावनी दिए बिना (अच्छा "Precision") काम करते थे।
  • Decision Tree (सरल प्रश्न पूछने वाला) सबसे अधिक संघर्ष करता रहा, क्योंकि वह दूसरों की तुलना में अधिक भ्रमित हो जाता था।

4. "क्यों" (SHAP स्पष्टीकरण)

यह इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा है। आमतौर पर, एक कंप्यूटर कह सकता है, "यह नौकरी एक स्कैम है," और वहीं रुक सकता है। लेकिन लेखिका ने यह पूछने के लिए SHAP का उपयोग किया, "क्यों?"

कल्पना कीजिए कि कंप्यूटर एक न्यायाधीश है जो फैसला सुना रहा है। SHAP उस वकील की तरह है जो न्यायाधीश के बगल में खड़ा है, सबूतों की ओर इशारा कर रहा है और कह रहा है, "हम इस जॉब विज्ञापन को दोषी ठहरा रहे हैं क्योंकि..."

SHAP विश्लेषण ने तीन मुख्य "महत्वपूर्ण सुरागों" (smoking guns) का खुलासा किया, जिन्होंने कंप्यूटर को संदिग्ध बनाया:

  • डिग्री की आवश्यकता: यदि किसी नौकरी में कहा गया था कि आपको "लो" (Low) या "स्टैंडर्ड" (Standard) डिग्री की आवश्यकता है (लेकिन उच्च स्तर की नहीं), तो यह एक बड़ा रेड फ्लैग (चेतावनी) था। कंप्यूटर ने सोचा, "असली उच्च वेतन वाली नौकरियों में आमतौर पर अधिक विशिष्ट, उच्च योग्यताओं की मांग होती है।"
  • डेडलाइन (समय सीमा): यदि विज्ञापन में यह नहीं बताया गया था कि आवेदन कब तक जमा करना है, या यदि डेडलाइन अजीब थी, तो कंप्यूटर संदिग्ध हो गया। स्कैमर्स अक्सर डेडलाइन की परवाह नहीं करते क्योंकि वे बस अभी आपकी जानकारी हासिल करना चाहते हैं।
  • श्रेणियाँ (Categories): यदि नौकरी को कई, भ्रमित करने वाली श्रेणियों में सूचीबद्ध किया गया था, तो कंप्यूटर ने उसे चिह्नित कर दिया। वैध कंपनियाँ आमतौर पर जानती हैं कि उनकी नौकरी कहाँ फिट बैठती है।

किस बात से फर्क नहीं पड़ा?
आश्चर्यजनक रूप से, कंप्यूटर को कंपनी लोगो या कंपनी के नाम जैसी शानदार चीजों से ज्यादा फर्क नहीं पड़ा। स्कैमर्स आसानी से लोगो की नकल कर सकते हैं, इसलिए कंप्यूटर ने कंपनी के "चेहरे" को अनदेखा करना और उसके "शरीर" (अर्थात आवश्यकताओं और नियमों) पर ध्यान केंद्रित करना सीख लिया।

5. अंतिम निर्णय

यह शोध पत्र निष्कर्ष निकालता है कि हम एक ऐसा सिस्टम बना सकते हैं जो स्मार्ट (स्कैमरों को पकड़ने वाला) और ईमानदार (यह समझाने वाला कि उसने उन्हें क्यों पकड़ा) दोनों हो।

  • अच्छी खबर: हमें हजारों विज्ञापनों को मैन्युअल रूप से पढ़ने के लिए मनुष्यों पर निर्भर रहने की आवश्यकता नहीं है। एक कंप्यूटर यह काम इंसान से अधिक तेज़ी से और अधिक सटीकता से कर सकता है।
  • विश्वास का कारक: क्योंकि कंप्यूटर अपने तर्क को समझा सकता है (जैसे, "मैंने इसे इसलिए चिह्नित किया क्योंकि इसमें कोई डेडलाइन नहीं है और यह कम डिग्री की मांग करता है"), व्यवस्था के प्रभारी लोग इस प्रणाली पर भरोसा कर सकते हैं और गलती करने के डर के बिना इस पर कार्रवाई कर सकते हैं।

संक्षेप में, लेखिका ने घाना के जॉब मार्केट के लिए एक स्मार्ट, बातूनी सुरक्षा गार्ड बनाया है। यह गार्ड संदिग्ध विज्ञापनों को देखकर केवल "रुको!" चिल्लाता नहीं है; बल्कि यह उस विशिष्ट नियम की ओर इशारा करता है जिसे विज्ञापन ने तोड़ा है, जिससे नौकरी चाहने वालों को सुरक्षित रखना बहुत आसान हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →