← नवीनतम पेपर
🤖 AI

A Robust and Explainable Transformer-Based Framework for Phishing Email Detection

यह शोध पत्र एक सुदृढ़ और व्याख्या योग्य फ़िशिंग ईमेल डिटेक्शन फ्रेमवर्क का प्रस्ताव करता है जो सटीक, लचीले और पारदर्शी, साक्ष्य-आधारित स्पष्टीकरण उत्पन्न करने के लिए एक Flan-T5 जनरेटर के साथ एकीकृत XAI विधियों और एक DistilBERT मॉडल पर एडवरसेरियल ट्रेनिंग को जोड़ता है।

मूल लेखक: Sajad U P

प्रकाशित 2026-06-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sajad U P

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका ईमेल इनबॉक्स एक व्यस्त हवाईअड्डा है, और हर संदेश एक यात्री है जो उड़ान भरने की कोशिश कर रहा है। अधिकांश यात्री मिलनसार स्थानीय लोग (वैध ईमेल) हैं, लेकिन कुछ ढोंगी भी हैं जिन्होंने वेश बदलकर घुसपैठ करने की कोशिश की है, ताकि वे आपका सामान चुरा सकें (फिशिंग ईमेल)।

वर्षों से, इस हवाईअड्डे के सुरक्षा गार्ड (पारंपरिक स्पैम फिल्टर) एक सरल चेकलिस्ट का उपयोग करते थे: "यदि यात्री 'मुफ्त पैसा' कहता है, तो उसे रोक दो।" लेकिन ढोंगी चालाक हो गए। उन्होंने अपने कपड़े बदलना, अपने नामों में अक्षर बदलना (जैसे "Google" के बजाय "G00gle" लिखना), या इस तरह से झूठ बोलना शुरू कर दिया जो सामान्य लगता था। पुराने गार्ड अंतर नहीं पहचान सके।

यह शोध पत्र एक नए, अत्यंत स्मार्ट सुरक्षा तंत्र का परिचय देता है जो तीन मुख्य विचारों पर आधारित है: एक स्मार्ट गार्ड, एक कठोर प्रशिक्षण शिविर, और एक मैत्रीपूर्ण मार्गदर्शक जो निर्णय को समझाने के लिए है।

1. स्मार्ट गार्ड: DistilBERT

यह शोध पत्र DistilBERT नामक एक मॉडल का उपयोग करता है। इसे एक अत्यधिक शिक्षित सुरक्षा गार्ड के रूप में समझें जिसने लाखों किताबें पढ़ी हैं और जो केवल शब्दों को ही नहीं, बल्कि वाक्य के संदर्भ (context) को भी समझता है।

  • समस्या: हालांकि यह गार्ड बहुत स्मार्ट है, लेकिन यह थोड़ा "ब्लैक बॉक्स" जैसा है। आप इससे यह नहीं पूछ सकते कि इसने किसी को क्यों रोका; यह बस कहता है, "नहीं।" साथ ही, यदि कोई ढोंगी अपने नाम में केवल एक अक्षर बदल देता है, तो गार्ड भ्रमित हो सकता है और उसे अंदर जाने दे सकता है।
  • समाधान: शोधकर्ताओं ने इस स्मार्ट गार्ड को बरकरार रखा लेकिन इसे और अधिक मजबूत और पारदर्शी बनाने के लिए एक विशेष प्रशिक्षण व्यवस्था दी।

2. कठोर प्रशिक्षण शिविर: एडवरसेरियल ट्रेनिंग (Adversarial Training)

गार्ड को अडिग बनाने के लिए, शोधकर्ताओं ने इसे एक ऐसे "बूट कैंप" में डाला जो इसे तोड़ने के लिए बनाया गया था, ताकि यह जीवित रहना सीख सके।

  • "FGM" ड्रिल (एम्बेडिंग स्तर): कल्पना कीजिए कि गार्ड एक चेहरा पहचानने का प्रशिक्षण ले रहा है। प्रशिक्षक गार्ड की चेहरे की मानसिक छवि को लेते हैं और उसे थोड़ा धुंधला या विकृत (गणितीय रूप से) कर देते हैं ताकि यह देखा जा सके कि क्या गार्ड अभी भी उस व्यक्ति को पहचानता है। इसे FGM कहा जाता है। यह गार्ड को व्यक्ति के सार (essence) पर ध्यान केंद्रित करना सिखाता है, न कि केवल आदर्श रोशनी पर।
  • "कैरेक्टर नॉइज़" ड्रिल (सतह स्तर): फिर, वे वास्तव में ईमेल के टेक्स्ट के साथ छेड़छाड़ करते हैं और उसमें बदलाव करते हैं। वे "o" को "0" से बदलते हैं, एक अक्षर हटा देते हैं, या एक यादृच्छिक (random) वर्ण जोड़ देते हैं। यह स्कैमर्स द्वारा उपयोग की जाने वाली वास्तविक दुनिया की तरकीबों का अनुकरण करता है।
  • परिणाम: इन "टूटे हुए" और "विकृत" ईमेलों पर प्रशिक्षण देकर, गार्ड शोर (noise) को अनदेखी करना सीख जाता है। भले ही स्कैमर "Account" के बजाय "Acc0unt" लिखे, गार्ड जानता है कि यह अभी भी एक संदिग्ध अकाउंट है। शोध पत्र दिखाता है कि जबकि एक सामान्य गार्ड की सटीकता इन ट्रिक्स के सामने 98% से गिरकर 54% हो जाती है, यह प्रशिक्षित गार्ड 93% पर मजबूत बना रहता है।

3. मैत्रीपूर्ण मार्गदर्शक: व्याख्यात्मक एआई (Explainable AI - XAI)

भले ही गार्ड पूर्ण हो, फिर भी आपको जानने की आवश्यकता है कि उन्होंने किसी को क्यों रोका। यदि एक गार्ड बिना किसी कारण के केवल "रुको!" चिल्लाता है, तो आप क्रोधित या भ्रमित हो सकते हैं।

  • समस्या: आमतौर पर, AI मॉडल केवल "हाँ/नहीं" का उत्तर देते हैं।
  • समाधान: शोधकर्ताओं ने एक "मैत्रीपूर्ण मार्गदर्शक" जोड़ा (एक उपकरण का उपयोग करके जिसे Flan-T5 कहा जाता है)।
    • पहले, सिस्टम तीन अलग-अलग "जासूसी उपकरणों" (जिन्हें LIME, SHAP, और IG कहा जाता है) का उपयोग करके उन विशिष्ट शब्दों को उजागर करता है जिन्होंने गार्ड को संदिग्ध बनाया। क्या ईमेल में "Urgent" (तत्काल) शब्द था? क्या इसने आपसे आपका पासवर्ड मांगा?
    • फिर, मैत्रीपूर्ण मार्गदर्शक उन हाइलाइट किए गए शब्दों को लेता है और आपके लिए एक सरल, स्पष्ट अंग्रेजी वाक्य लिखता है।
    • उदाहरण: एक भ्रमित करने वाले कोड के बजाय, सिस्टम आपको बताता है: "इस ईमेल को इसलिए संदिग्ध माना गया क्योंकि इसमें 'immediate action' जैसे तत्काल भाषा का उपयोग किया गया है और यह आपसे अपना पासवर्ड रीसेट करने के लिए एक लिंक पर क्लिक करने को कहता है।"

यह सब मिलकर कैसे काम करता है

शोध पत्र एक पाइपलाइन का वर्णन करता है जो इस प्रकार दिखता है:

  1. इनपुट: एक ईमेल आता है।
  2. गार्ड: DistilBERT मॉडल इसे पढ़ता है। अपने विशेष प्रशिक्षण के कारण, यह टाइपो या अजीब प्रतीकों से धोखा नहीं खाता है।
  3. जासूस: यदि गार्ड को संदेह होता है, तो जासूसी उपकरण (LIME, SHAH, IG) उन विशिष्ट शब्दों की ओर इशारा करते हैं जिन्होंने अलार्म बजाया।
  4. मार्गदर्शक: मैत्रीपूर्ण मार्गदर्शक उन तकनीकी बिंदुओं को एक छोटी, मानव-पठनीय कहानी में अनुवादित करता है जो जोखिम को समझाती है।

शोध पत्र ने क्या पाया

  • यह अधिक मजबूत है: नया सिस्टम न केवल घोटालों को पकड़ने में बेहतर हुआ; यह उन चालाकी भरे घोटालों को पकड़ने में बहुत बेहतर हुआ जो अक्षरों को बदलकर छिपने की कोशिश करते हैं।
  • यह अधिक स्पष्ट है: जब सिस्टम गलती करता है (जैसे किसी वास्तविक तत्काल ईमेल को घोटाले के रूप में चिह्नित करना), तो स्पष्टीकरण आपको समझने में मदद करता है कि ऐसा क्यों हुआ (जैसे, "इसने 'urgent' शब्द को एक घोटाले की रणनीति समझा")। यह उपयोगकर्ताओं को सिस्टम पर अधिक भरोसा करने में मदद करता है।
  • यह तेज़ है: क्योंकि उन्होंने "DistilBERT" (बड़े AI मॉडलों का एक हल्का, तेज़ संस्करण) का उपयोग किया है, यह सिस्टम बिना किसी सुपरकंप्यूटर की आवश्यकता के तेज़ी से चल सकता है।

निष्कर्ष

यह शोध पत्र एक ऐसा सुरक्षा तंत्र प्रस्तुत करता है जो ट्रिक्स के खिलाफ मजबूत, चलाने में तेज़ और अपने तर्क के बारे में ईमानदार है। यह एक शक्तिशाली कंप्यूटर मस्तिष्क और एक मानव उपयोगकर्ता के बीच के अंतर को पाटता है जो केवल यह जानना चाहता है, "क्या यह ईमेल सुरक्षित है?" बिना कंप्यूटर विज्ञान की डिग्री के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →