← नवीनतम पेपर
💻 computer science

User-Centric Phishing Detection: A RAG and LLM-Based Approach

यह शोध पत्र एक उपयोगकर्ता-केंद्रित फिशिंग डिटेक्शन फ्रेमवर्क का प्रस्ताव करता है जो व्यक्तिगत ऐतिहासिक ईमेल संदर्भों और वास्तविक समय की थ्रेट इंटेलिजेंस का लाभ उठाने के लिए लार्ज लैंग्वेज मॉडल्स के साथ रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) को एकीकृत करता है, जिससे फाल्स पॉजिटिव्स को प्रभावी ढंग से कम किया जा सके और कई ओपन-सोर्स मॉडल्स में उच्च सटीकता प्राप्त की जा सके।

मूल लेखक: Abrar Hamed Al Barwani, Abdelaziz Amara Korba, Raja Waseem Anwar

प्रकाशित 2026-01-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abrar Hamed Al Barwani, Abdelaziz Amara Korba, Raja Waseem Anwar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बड़ी ऑफिस बिल्डिंग में एक बहुत ही बुद्धिमान, उच्च शिक्षित सुरक्षा गार्ड हैं। इस गार्ड ने अपराध के बारे में लाखों किताबें पढ़ी हैं और वह जानता है कि एक "बुरे आदमी" का स्वरूप टेक्स्टबुक के अनुसार कैसा होता है। लेकिन इस गार्ड के साथ एक समस्या है: वह बहुत अधिक सख्त है। वह अक्सर एक अजीब दिखने वाले पैकेज को ले जा रहे एक नियमित कर्मचारी को अपराधी समझ लेता है, जिससे अनावश्यक अलार्म और परेशानी पैदा होती है।

यह पेपर इस सुरक्षा गार्ड को प्रशिक्षित करने का एक नया तरीका पेश करता है ताकि वह कम गलतियाँ करे। यहाँ इसका सरल विवरण दिया गया है कि यह कैसे काम करता है:

समस्या: "एक ही आकार के सभी के लिए" वाला गार्ड (The "One-Size-Fits-All" Guard)

पारंपरिक ईमेल फिल्टर उसी सख्त गार्ड की तरह होते हैं। वे ईमेल को देखते हैं और पूछते हैं, "क्या यह स्कैम जैसा लग रहा है?" यदि उत्तर केवल थोड़ा सा भी "शायद" है, तो वे इसे ब्लॉक कर देते हैं।

  • समस्या: कभी-कभी आपके बॉस का एक वैध ईमेल थोड़ा अजीब लग सकता है (शायद वे किसी नए स्लैंग शब्द या किसी अजीब लिंक का उपयोग कर रहे हैं)। पुराना गार्ड इसे ब्लॉक कर देता है क्योंकि यह एक सामान्य ईमेल के "मानक" पैटर्न से मेल नहीं खाता है। इसे फॉल्स पॉजिटिव (False Positive) कहा जाता है। यह उस गार्ड की तरह है जो एक असली कर्मचारी को इसलिए रोकता है क्योंकि उसने ऐसी टोपी पहनी थी जो संदिग्ध लग रही थी।

समाधान: "व्यक्तिगत जासूस" (The "Personalized Detective")

लेखकों ने एक ऐसा सिस्टम बनाया है जो निर्णय लेने से पहले सुरक्षा गार्ड को एक व्यक्तिगत स्मृति पुस्तिका (Personal Memory Book) और एक लाइव न्यूज़ फीड (Live News Feed) देता है। वे इसे RAG (Retrieval-Augmented Generation) सिस्टम कहते हैं।

यहाँ यह नया सिस्टम तीन चरणों में कैसे काम करता है:

1. स्मृति पुस्तिका (उपयोगकर्ता संदर्भ - User Context)
नए ईमेल को देखने से पहले, सिस्टम उपयोगकर्ता के पिछले वैध ईमेलों को जल्दी से पलटता है।

  • उपमा: कल्पना करें कि गार्ड पूछता है, "हे, क्या यह व्यक्ति आमतौर पर इस तरह के ईमेल भेजता है?" यदि ईमेल अजीब दिखता है लेकिन उस शैली से मेल खाता है जो उपयोगकर्ता वास्तव में अपने बॉस से प्राप्त करता है, तो गार्ड कहता है, "आह, यह इस व्यक्ति के लिए सामान्य है," और उसे जाने देता है।
  • यह कैसे काम करता है: सिस्टम गार्ड को संदर्भ के रूप में दिखाने के लिए उपयोगकर्ता के इतिहास से सबसे मिलते-जले शीर्ष 5 ईमेल खोजने के लिए AI का उपयोग करता है।

2. लाइव न्यूज़ फीड (खतरा इंटेलिजेंस - Threat Intelligence)
सिस्टम यह भी जाँचता है कि ईमेल में दिए गए लिंक या वेबसाइटें ज्ञात रूप से खतरनाक हैं या नहीं, इसके लिए एक लाइव डेटाबेस (जैसे कि डिजिटल पुलिस ब्लॉटर) का उपयोग करता है।

  • उपमा: भले ही ईमेल किसी मित्र की ओर से लग रहा हो, यदि इसके अंदर का लिंक किसी ज्ञात "बुरे इलाके" (दुर्भावनापूर्ण वेबसाइट) की ओर ले जाता है, तो गार्ड को लाइव फीड से अलर्ट मिलता है।

3. स्मार्ट निर्णय (LLM)
गार्ड वास्तव में एक लार्ज लैंग्वेज मॉडल (LLM) है—एक सुपर-स्मार्ट AI जो भाषा को बहुत अच्छी तरह समझता है। ईमेल को अलग-थलग देखने के बजाय, AI इन चीजों को देखता है:

  • नया ईमेल।
  • "स्मृति पुस्तिका" (पिछले मिलते-जुलते ईमेल)।
  • "लाइव न्यूज़ फीड" (खतरे का डेटा)।

इसके बाद यह अंतिम निर्णय लेता है: "क्या यह एक स्कैम है, या यह सिर्फ एक अजीब लेकिन वास्तविक ईमेल है?"

परिणाम: कम गलतियाँ

शोधकर्ताओं ने इस नए सिस्टम का परीक्षण चार अलग-अलग प्रकार के AI "गार्ड्स" (जिन्हें Llama4, DeepSeek, Mistral और Gemma कहा जाता है) का उपयोग करके किया। उन्होंने तुलना की कि ये गार्ड स्मृति पुस्तिका के बिना बनाम साथ कितनी अच्छी तरह काम करते हैं।

  • बड़ी जीत: जब गार्डों ने स्मृति पुस्तिका (RAG) का उपयोग किया, तो उन्होंने काफी कम गलतियाँ कीं।
  • स्टार परफॉर्मर: Llama4-Scout मॉडल सबसे अच्छा था।
    • स्मृति पुस्तिका के बिना, इसने गलती से 12% अच्छे ईमेल ब्लॉक कर दिए (फॉल्स पॉजिटिव)।
    • स्मृति पुस्तिका के साथ, इसने केवल 4% अच्छे ईमेल ब्लॉक किए।
    • इसने वास्तविक स्कैमर्स को पकड़ने में भी बेहतर प्रदर्शन किया (0.97 में से 0.97 का स्कोर)।

मुख्य निष्कर्ष (The Bottom Line)

यह पेपर यह सिद्ध करता है कि आपको फिशिंग रोकने के लिए केवल एक स्मार्ट AI की ही नहीं जरूरत है, बल्कि एक ऐसे AI की जरूरत है जो उपयोगकर्ता को जानता हो। AI को यह देखने के लिए कि उपयोगकर्ता आमतौर पर क्या प्राप्त करता है, एक त्वरित नज़र देने से, सिस्टम सामान्य, अजीब दिखने वाले ईमेल को स्कैम के रूप में चिह्नित करना बंद कर देता है। यह सुरक्षा प्रणाली को बहुत अधिक सटीक और कम कष्टदायक बनाता है।

संक्षेप में: यह एक सामान्य, अत्यधिक सख्त सुरक्षा गार्ड को एक व्यक्तिगत जासूस में बदल देता है जो आपकी आदतों को जानता है, जिसके परिणामस्वरूप कम गलत अलार्म और बेहतर सुरक्षा मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →