← नवीनतम पेपर
💻 computer science

MAGE: Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory

यह शोध पत्र MAGE को प्रस्तुत करता है, जो एक नवीन रक्षात्मक ढांचा (defensive framework) है जो सुरक्षा-महत्वपूर्ण संदर्भ (safety-critical context) को सक्रिय रूप से संकुचित करने और LLM एजेंटों में दीर्घकालिक खतरों (long-horizon threats) का पता लगाने के लिए एक समर्पित "शैडो मेमोरी" (shadow memory) का लाभ उठाता है, जिससे नगण्य ओवरहेड के साथ उच्च पहचान सटीकता प्राप्त होती है।

मूल लेखक: Yuhui Wang, Tanqiu Jiang, Jiacheng Liang, Charles Fleming, Ting Wang

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhui Wang, Tanqiu Jiang, Jiacheng Liang, Charles Fleming, Ting Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "MAGE: Shadow Memory के माध्यम से LLM एजेंट्स को लॉन्ग-होरिज़न खतरों से सुरक्षित करना" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "स्लो पॉइजन" (धीमा जहर) हमला

कल्पना कीजिए कि आपने अपने दैनिक कार्यों, जैसे ईमेल चेक करने, फाइलें मैनेज करने या संदेश भेजने के लिए एक बहुत ही स्मार्ट, मददगार रोबोट सहायक (एक LLM एजेंट) को काम पर रखा है।

आमतौर पर, हमें इस बात की चिंता होती है कि कोई रोबोट को एक ही बार में कोई बुरा कमांड दे दे (जैसे "सब कुछ डिलीट कर दो!")। लेकिन यह पेपर एक अधिक चालाक और खतरनाक समस्या के बारे में बात करता है जिसे लॉन्ग-होरिज़न थ्रेट्स (Long-Horizon Threats) कहा जाता है।

इसे "स्लो पॉइजन" (धीमे जहर) की तरह समझें।

  • चरण 1: हमलावर रोबोट से एक विशिष्ट फ़ाइल खोजने के लिए कहता है। (पूरी तरह से सामान्य)।
  • चरण 2: हमलावर रोबोट से किसी दोस्त का ईमेल पता ढूँढने के लिए कहता है। (पूरी तरह से सामान्य)।
  • चरण 3: हमलावर रोबोट से उस फ़ाइल को उस दोस्त को ईमेल करने के लिए कहता है। (पूरी तरह से सामान्य)।

व्यक्तिगत रूप से, हर चरण निर्दोष दिखता है। लेकिन जब आप उन्हें एक साथ रखते हैं, तो रोबोट अनजाने में आपकी गुप्त कंपनी रणनीति किसी प्रतिस्पर्धी को लीक कर देता है। रोबोट इसलिए भ्रमित हो जाता है क्योंकि जब वह चरण 3 तक पहुँचता है, तो वह चरण 1 के संदर्भ (context) को भूल चुका होता है। यह एक ऐसी फिल्म की तरह है जहाँ विलेन हीरो को छोटी, हानिरहित चीज़ें करने के लिए बहकाता है जो अंततः एक आपदा की ओर ले जाती हैं, लेकिन हीरो केवल वर्तमान दृश्य को याद रखता है, पूरी कहानी को नहीं।

समाधान: MAGE और "शैडो मेमोरी" (Shadow Memory)

लेखकों ने MAGE नामक एक रक्षा प्रणाली बनाई है। यह कैसे काम करती है, इसे समझने के लिए, एक उच्च-सुरक्षा वाले बैंक वॉल्ट की कल्पना करें।

सामान्यतः, बैंक टेलर (एजेंट) ग्राहक के अनुरोध को देखता है और तय करता है कि वह ठीक है या नहीं। लेकिन यदि ग्राहक पिछले एक घंटे से टेलर के कान में चालाकी भरी बातें फुसफुसा रहा है, तो टेलर भ्रमित हो सकता है।

MAGE एक "शैडो मेमोरी" पेश करता है।
इसे एक ग्लास बूथ में टेलर के बगल में बैठे सुरक्षा गार्ड के रूप में सोचें।

  • टेलर (एजेंट) काम करता है।
  • सुरक्षा गार्ड (MAGE) काम नहीं करता, लेकिन वह सब कुछ देखता है जो हो रहा है।
  • महत्वपूर्ण रूप से, गार्ड एक विशेष, संक्षिप्त नोटबुक (Shadow Memory) रखता है।

हर बार जब टेलर कुछ करता है, तो गार्ड अपनी नोटबुक में एक छोटा, बुलेट-पॉइंट सारांश लिखता है। वे उबाऊ विवरण नहीं लिखते (जैसे "मौसम अच्छा था"); वे केवल सुरक्षा-महत्वपूर्ण सुराग लिखते हैं (जैसे "उपयोगकर्ता एक गोपनीय फ़ाइल मांग रहा है" या "प्राप्तकर्ता एक बाहरी व्यक्ति है")।

इससे पहले कि टेलर वास्तव में कोई ईमेल भेजे या कोई फ़ाइल डिलीट करे, उसे गार्ड से पूछना होगा: "हे, आज जो कुछ भी हुआ उसके आधार पर, क्या यह सुरक्षित है?"

यदि गार्ड देखता है कि चरण 1 था "गुप्त फ़ाइल खोजें" और चरण 2 था "अजनबी को ईमेल भेजें", तो वह ब्रेक लगा देगा और कहेगा, "नहीं! यह एक जाल है!" भले ही वर्तमान अनुरोध (चरण 3) अपने आप में हानिरहित दिखे।

MAGE कैसे अलग है

पिछले अधिकांश सुरक्षा सिस्टम एक कीवर्ड फ़िल्टर की तरह हैं। वे केवल वर्तमान वाक्य को देखते हैं। यदि वाक्य कहता है "ईमेल भेजें," तो वे उसे जाने देते हैं। वे बड़ी तस्वीर (big picture) को नहीं देख पाते।

MAGE अलग है क्योंकि:

  1. यह पूरी कहानी याद रखता है: यह पहले चरण और अंतिम चरण के बीच के संबंध को जोड़ता है।
  2. यह कुशल है: पूरी बातचीत का पूरा इतिहास पढ़ने के बजाय (जो बहुत बड़ा और धीमा होता है), गार्ड केवल अपनी छोटी, संक्षिप्त नोटबुक पढ़ता है। यह इसे तेज़ और सस्ता बनाता है।
  3. यह सीखता है: इस सिस्टम को "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning) नामक पद्धति का उपयोग करके प्रशिक्षित किया गया था। इसे एक वीडियो गेम की तरह समझें जहाँ गार्ड को बुरे लोगों को पकड़ने के लिए अंक मिलते हैं और यदि वह गलती से किसी अच्छे व्यक्ति को रोक देता है, तो उसके अंक कट जाते हैं। समय के साथ, गार्ड बिना ज़रूरत से ज़्यादा संदिग्ध हुए, "स्लो पॉइजन" हमलों को पहचानने में बहुत कुशल हो जाता है।

परिणाम: परीक्षणों में क्या हुआ?

शोधकर्ताओं ने MAGE का परीक्षण दो प्रकार के "बुरे लोगों" के खिलाफ किया:

  1. उपयोगकर्ता (The User): कोई व्यक्ति जो रोबोट को ऐसी श्रृंखला में निर्दोष प्रश्न पूछकर बहकाने की कोशिश कर रहा है जो एक बुरे परिणाम की ओर ले जाते हैं।
  2. पर्यावरण (The Environment): कोई व्यक्ति जो उस डेटा के अंदर बुरे निर्देश छिपा रहा है जिसे रोबोट पढ़ रहा है (जैसे कि कोई वेबसाइट जिसे रोबोट देख रहा है)।

निष्कर्ष प्रभावशाली थे:

  • बुरे लोगों को पकड़ा: MAGE ने इन लगभग सभी "स्लो पॉइजन" हमलों को रोक दिया। एक परीक्षण में, इसने हमलों की सफलता दर को 100% से घटाकर 10% से भी कम कर दिया।
  • अच्छे लोगों को नहीं रोका: इसने सामान्य काम में बाधा नहीं डाली। रोबोट अभी भी अपने कार्यों को लगभग उतना ही अच्छी तरह से पूरा कर सका जितना वह सुरक्षा गार्ड के बिना कर सकता था।
  • जल्दी पकड़ा: MAGE ने आमतौर पर हमले की शुरुआत में ही खतरे को पहचान लिया, जिससे मानव ऑपरेटर को कोई नुकसान होने से पहले हस्तक्षेप करने का समय मिल गया।
  • कम लागत: इसने रोबोट की गति को बहुत कम नहीं किया और न ही बहुत अधिक कंप्यूटर पावर खर्च की।

निष्कर्ष (The Bottom Line)

यह पेपर तर्क देता है कि जैसे-जैसे AI एजेंट अधिक स्मार्ट और अधिक लंबे, जटिल कार्य करने वाले बनते जा रहे हैं, वे समय के साथ होने वाले हमलों के प्रति संवेदनशील होते जा रहे हैं। MAGE इसे एजेंट को एक "दूसरा मस्तिष्क" (Shadow Memory) देकर हल करता है जो विशेष रूप से किसी कार्य की पूरी समयरेखा (timeline) में सुरक्षा जोखिमों पर नज़र रखता है, यह सुनिश्चित करता है कि छोटे, निर्दोष चरणों की एक श्रृंखला अनजाने में आपदा में न बदल जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →