← नवीनतम पेपर
💻 computer science

MemoPhishAgent: Memory-Augmented Multi-Modal LLM Agent for Phishing URL Detection

MemoPhishAgent एक मेमोरी-ऑगमेंटेड मल्टी-मोडल LLM एजेंट है जो एपिसोडिक मेमोरीज और डायनेमिक टूल ऑर्केस्ट्रेशन का लाभ उठाकर नए और आवर्ती दोनों प्रकार के फिशिंग URL का पता लगाने में अत्याधुनिक बेसलाइन्स से काफी बेहतर प्रदर्शन करता है, जिससे वास्तविक दुनिया के डिप्लॉयमेंट में उच्च रिकॉल प्राप्त होता है।

मूल लेखक: Xuan Chen, Hao Liu, Tao Yuan, Mehran Kafai, Piotr Habas, Xiangyu Zhang

प्रकाशित 2026-04-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xuan Chen, Hao Liu, Tao Yuan, Mehran Kafai, Piotr Habas, Xiangyu Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हलचल भरे शहर (इंटरनेट) के गेट पर तैनात एक सुरक्षा गार्ड हैं। आपका काम उन ढोंगी लोगों (फिशिंग वेबसाइटों) को रोकना है जो लोगों को उनके ताले की चाबियाँ (पासवर्ड और क्रेडिट कार्ड नंबर) देने के लिए छलने की कोशिश कर रहे हैं।

लंबे समय तक, सुरक्षा गार्डों ने दो मुख्य तरीकों का उपयोग किया:

  1. "वांटेड पोस्टर" की सूची: उनके पास ज्ञात अपराधियों की एक सूची होती थी। यदि कोई व्यक्ति उस सूची के किसी नाम जैसा दिखता था, तो उसे रोका जाता था।
  2. "नियम पुस्तिका": उनके पास एक सख्त चेकलिस्ट होती थी। "यदि साइन 'PayPa1' कहता है न कि 'PayPal', तो उन्हें रोक दो।"

समस्या: अपराधी चतुर हैं। वे हर दिन अपने नाम बदलते हैं, नए मुखौटे पहनते हैं और नई तरकीबें निकालते हैं। "वांटेड पोस्टर" की सूची तुरंत पुरानी हो जाती है, और "नियम पुस्तिका" चतुर वेशभूषा को पकड़ने के लिए बहुत कठोर है।

हाल ही में, लोगों ने एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) का उपयोग करने की कोशिश की। लेकिन ये AI "रूकी गार्ड्स" (नौसिखिया गार्डों) की तरह थे जिन्हें केवल एक बार संदिग्ध को देखने का मौका मिलता है। वे विवरण पढ़ते हैं, एक त्वरित निर्णय लेते हैं, और बस। यदि वे कोई सुराग चूक जाते हैं, तो वे वापस जाकर और सवाल नहीं पूछ सकते।

पेश है: MemoPhishAgent (द "सुपर डिटेक्टिव")

यह शोध पत्र MemoPhishAgent (MPA) को पेश करता है, जो एक नौसिखिया गार्ड के बजाय एक अनुभवी, याददाश्त रखने वाले जासूस को काम पर रखने जैसा है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. जासूस के पास एक टूलकिट है (सिर्फ एक आँख नहीं)

केवल एक URL (वेब एड्रेस) को देखने के बजाय, MPA एक एजेंट है जो सक्रिय रूप से चीजें कर सकता है। इसे एक ऐसे जासूस के रूप में सोचें जो केवल संदिग्ध को घूरता नहीं है; उसके पास तरकीबों का एक थैला है:

  • द स्नूप (जासूसी करना): यह वेबसाइट पर जाता है और छिपे हुए सुराग खोजने के लिए उसके उलझे हुए कोड (HTML) को पढ़ता है।
  • द फोटोग्राफर (फोटोग्राफर): यह पेज का स्क्रीनशॉट लेता है ताकि देख सके कि लोगो नकली तो नहीं लग रहा या लेआउट अजीब तो नहीं है।
  • द ज़ूमर (ज़ूम करने वाला): यदि पूरा पेज ठीक दिखता है, तो यह नकली चीज़ों की जांच करने के लिए विशिष्ट चित्रों या बटनों पर ज़ूम करता है।
  • द रिसर्चर (शोधकर्ता): यह एक सर्च इंजन का उपयोग करता है और पूछता है, "क्या यह कंपनी वास्तव में असली है?" या "क्या किसी ने इस साइट की रिपोर्ट की है?"
  • द ट्रैकर (ट्रैकर): यह "ब्रेडक्रंब्स" (रास्ते के निशान) का पीछा करता है। यदि साइट आपको किसी दूसरे पेज पर भेजती है, तो जासूस उस रास्ते का पीछा करता है ताकि पता चल सके कि वह वास्तव में कहाँ ले जा रही है।

जादू: पुराने सिस्टमों के विपरीत जो एक कठोर स्क्रिप्ट का पालन करते हैं (A देखें, फिर B, फिर C), यह जासूस तय करता है कि उसे आगे क्या करना है। यदि स्क्रीनशॉट संदिग्ध लगता है, तो यह ज़ूम करता है। यदि टेक्स्ट अजीब दिखता है, तो यह वेब पर खोज करता है। यह वास्तविक समय में अनुकूलित होता है।

2. "केस फाइल" मेमोरी (असली सीक्रेट सॉस)

अधिकांश AI सिस्टमों में भूलने की बीमारी (एमनेसिया) होती है; वे काम पूरा होते ही सब कुछ भूल जाते हैं।

MemoPhishAgent के पास एक विशाल, व्यवस्थित फाइलिंग कैबिनेट (एपिसोडिक मेमोरी) है।

  • यह कैसे काम करता है: हर बार जब जासूस एक केस सुलझाता है (या सिर्फ एक संदिग्ध साइट की जांच करता है), तो वह लिख देता है कि उसने उसे कैसे सुलझाया। "मैंने एक नकली लोगो देखा, इसलिए मैंने ब्रांड नाम को खोजा, और इस बात ने पुष्टि की कि यह एक घोटाला था।"
  • लाभ: यदि कोई नया स्कैमर एक ऐसे भेष में आता है जो पिछले हफ्ते पकड़े गए स्कैमर के लगभग बिल्कुल समान दिखता है, तो जासूस शून्य से शुरुआत नहीं करता है। वह केस फाइल खोलता है, कहता है, "आह, मैंने यह पहले भी देखा है! मुझे पता है कि मुझे कौन से कदम उठाने हैं," और इसे तुरंत सुलझा लेता है।
  • परिणाम: यह बिना किसी मानव द्वारा रिट्रेन किए हुए हर दिन स्मार्ट और तेज़ होता जाता है।

3. टीमवर्क (रीज़निंग लूप)

जासूस केवल अनुमान नहीं लगाता। यह एक ReAct लूप (रीज़न + एक्ट) का उपयोग करता है।

  1. ऑब्ज़र्व (अवलोकन): "यह साइट Apple जैसी दिखती है, लेकिन URL अजीब है।"
  2. रीज़न (तर्क): "मुझे यह देखने के लिए स्क्रीनशॉट की जांच करनी चाहिए कि क्या लोगो पिक्सेलेटेड है।"
  3. एक्ट (कार्य): (स्क्रीनशॉट लेता है)।
  4. ऑब्ज़र्व (अवलोकन): "लोगो धुंधला है।"
  5. रीज़न (तर्क): "यह एक रेड फ्लैग है। मुझे असली Apple डोमेन खोजने के लिए सर्च करना चाहिए ताकि तुलना की जा सके।"
  6. एक्ट (कार्य): (खोज करता है)।
  7. वर्टिक्ट (फैसला): "यह एक घोटाला है। इसे गिरफ्तार करो!"

यह क्यों मायने रखता है (परिणाम)

शोधकर्ताओं ने इस "सुपर डिटेक्टिव" का परीक्षण पुराने "नियम पुस्तिका" वाले गार्डों और "वन-शॉट" AI नौसखेयों के विरुद्ध किया।

  • मानक परीक्षणों पर: इसने मौजूदा सर्वोत्तम सिस्टमों की तुलना में 13.6% अधिक फिशिंग साइटों को पकड़ा।
  • वास्तविक दुनिया के परीक्षणों पर: उन्होंने सोशल मीडिया पर पाए गए वास्तविक संदिग्ध लिंक पर इसका परीक्षण किया (जहाँ घोटाले सबसे खतरनाक होते हैं)। इसने प्रतिस्पर्धा की तुलना में 20% अधिक घोटाले पकड़े।
  • वास्तविक दुनिया में: इस सिस्टम का उपयोग पहले से ही Amazon द्वारा किया जा रहा है! यह हर हफ्ते लगभग 60,000 उच्च-जोखिम वाले लिंक को प्रोसेस करता है, जिससे लाखों ग्राहकों की सुरक्षा होती है। इसने 91% खराब लिंक्स को पकड़ा, जो पुराने तरीकों की तुलना में एक बड़ा सुधार है।

बड़ी तस्वीर का रूपक (एनालॉजी)

  • पुराने सिस्टम: एक बाउंसर की तरह जो केवल प्रिंट की गई सूची के साथ आईडी चेक करता है। यदि अपराधी अपना नाम बदल लेता है, तो वह अंदर आ जाता है।
  • वर्तमान AI: एक बाउंसर की तरह जो आईडी पढ़ता है, अंदाज़ा लगाता है कि वह नकली है या नहीं, और अपने अंतर्ज्ञान के आधार पर व्यक्ति को अंदर आने या बाहर जाने देता है।
  • MemoPhishAgent: एक शरलॉक होम्स की तरह जो आईडी चेक करता है, जूतों को देखता है, व्यक्ति से सवाल पूछता है, उसके फोन की जांच करता है, और फिर अपने पिछले अपराधियों की नोटबुक देखता है कि क्या यह व्यक्ति उस पैटर्न से मेल खाता है जिसे उसने पहले देखा था।

सक्रिय जांच (टूल्स) के साथ अतीत से सीखने (मेमोरी) को जोड़कर, यह एजेंट केवल खतरों पर प्रतिक्रिया नहीं देता है; यह उनका पूर्वानुमान लगाता है, जिससे इंटरनेट हम सभी के लिए बहुत सुरक्षित स्थान बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →