← नवीनतम पेपर
💬 NLP

MCPShield: A Security Cognition Layer for Adaptive Trust Calibration in Model Context Protocol Agents

यह शोध पत्र MCPShield को प्रस्तुत करता है, जो एक प्लग-इन सुरक्षा संज्ञान परत (security cognition layer) है जो मेटाडेटा-निर्देशित जांच (metadata-guided probing) और आह्वान-पश्चात प्रतिबिंब (post-invocation reflection) का उपयोग करके विभिन्न LLMs में कम ओवरहेड और उच्च सामान्यीकरण बनाए रखते हुए विविध हमलों के विरुद्ध मजबूती से बचाव करने और मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) एजेंटों में विश्वास मिसअलाइनमेंट (trust misalignment) को कम करने का कार्य करता है।

मूल लेखक: Zhenhong Zhou, Yuanhe Zhang, Hongwei Cai, Moayad Aloqaily, Ouns Bouachir, Linsey Pang, Prakhar Mehrotra, Kun Wang, Qingsong Wen

प्रकाशित 2026-02-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenhong Zhou, Yuanhe Zhang, Hongwei Cai, Moayad Aloqaily, Ouns Bouachir, Linsey Pang, Prakhar Mehrotra, Kun Wang, Qingsong Wen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, मददगार रोबोट सहायक (एक AI Agent) है जो आपके लिए काम कर सकता है, जैसे मौसम की जांच करना, फ्लाइट बुक करना, या आपके बैंक खाते का प्रबंधन करना। ऐसा करने के लिए, रोबोट को बाहरी सेवाओं (जैसे मौसम ऐप या किसी बैंक की वेबसाइट) से बात करने की आवश्यकता होती है।

पहले, ये बाहरी सेवाएँ भरोसेमंद दोस्तों की तरह थीं। लेकिन एक नए मानक जिसे MCP कहा जाता है, के साथ अब आपका रोबोट किसी के भी सेवा से जुड़ सकता है, यहाँ तक कि इंटरनेट पर मौजूद अजनबियों से भी। यह आपके घर का दरवाजा खोलकर हजारों अलग-अलग डिलीवरी ड्राइवरों को अंदर आने देने जैसा है। हालांकि यह बहुत सुविधाजनक है, लेकिन यह खतरनाक भी है: एक अजनबी दरवाजे पर दस्तक दे सकता है, कह सकता है कि वह पिज्जा डिलीवरी वाला है, लेकिन वास्तव में वह आपका गहना चुराने की कोशिश करने वाला चोर हो सकता है।

यही वह समस्या है जिसे पेपर MCPShield हल करता है।

मुख्य समस्या: "बहुत अधिक भरोसा करने वाला" रोबट

वर्तमान में, यदि कोई अजनबी (सर्वर) रोबोट को कहता है, "मैं पिज्जा डिलीवरी वाला हूँ," तो रोबोट तुरंत उन पर विश्वास कर लेता है। वह यह जांच नहीं करता कि क्या उस व्यक्ति के पास वास्तव में पिज्जा है या उसके हाथ में कोई लोहे की छड़ (crowbar) है।

  • जोखिम: एक दुर्भावनापूर्ण सर्वर मददगार होने का नाटक कर सकता है लेकिन गुप्त रूप से आपका डेटा चुरा सकता है, आपकी फाइलें डिलीट कर सकता है, या गलत जगह पैसा भेज सकता है।
  • कमी: मौजूदा सुरक्षा उपकरण उस सुरक्षा गार्ड की तरह हैं जो घर के बाहर खड़ा होता है। वे गेट पर ड्राइवर का आईडी चेक कर सकते हैं, लेकिन एक बार जब ड्राइवर आपकी रसोई के अंदर आ जाता है, तो गार्ड यह नहीं देख सकता कि वह अंदर क्या कर रहा है।

समाधान: MCPShield (एक "स्मार्ट बॉडीगार्ड")

लेखक MCPShield का प्रस्ताव देते हैं, जो केवल दरवाजे पर खड़ा गार्ड नहीं है। यह एक सुरक्षा मस्तिष्क (security brain) है जो रोबोट के दिमाग के अंदर रहता है। यह हर बातचीत को एक सीखने के अनुभव के रूप में लेता है, ठीक वैसे ही जैसे एक इंसान समय के साथ लोगों पर भरोसा करना (या अविश्वास करना) सीखता है।

यह तीन सरल चरणों में कैसे काम करता है, यहाँ दिया गया है:

1. "नकली ऑर्डर" टेस्ट (Pre-Invocation)

  • उपमा (Analogy): किसी नए डिलीवरी ड्राइवर को अपने घर में प्रवेश देने से पहले, आप उनसे हॉल में रखी एक नकली मेज पर पिज्जा डिलीवर करने का "दिखावा" करने को कहते हैं। आप उन्हें करीब से देखते हैं। क्या उनके पास वास्तव में पिज्जा है? क्या वे "डिलीवरी" करते समय आपकी तिजोरी खोलने की कोशिश करते हैं?
  • MCPShield इसे कैसे करता है: इससे पहले कि रोबोट वास्तव में आपके असली डेटा के साथ किसी टूल का उपयोग करे, MCPShield सर्वर को एक "नकली" अनुरोध भेजता है। यह जांचता है: "क्या सर्वर बिल्कुल वैसा ही व्यवहार कर रहा है जैसा उसने वादा किया था?" यदि सर्वर इस टेस्ट के दौरान कुछ अजीब करने की कोशिश करता है, तो रोबोट कहता है, "नहीं, तुम बैन हो," इससे पहले कि वास्तविक नुकसान हो सके।

2. "ग्लास बॉक्स" (Execution)

  • उपमा (Analogy): कल्पना कीजिए कि डिलीवरी ड्राइवर को आपकी रसोई में जाने की अनुमति है, लेकिन वे कांच के कवच (suit of armor) पहने हुए हैं। वे घूम सकते हैं, लेकिन वे एक छोटी, अदृश्य बुलबुले में फंसे हुए हैं। यदि वे आपके गहनों को छूने या आपके फ्रिज को खोलने की कोशिश करते हैं, तो बुलबुला तुरंत उन्हें रोक देता है और अलार्म बजा देता है।
  • MCPShield इसे कैसे करता है: जब रोबोट वास्तव में टूल का उपयोग करता है, तो MCPShield सर्वर को एक "सैंडबॉक्स" (एक सुरक्षित, अलग कमरे) में रखता है। यह सर्वर द्वारा किए गए हर कदम को देखता है। यदि सर्वर उस फाइल तक पहुँचने की कोशिश करता है जिसे उसे नहीं छूना चाहिए था, तो MCPShield उसे तुरंत ब्लॉक कर देता है। यह एक रेफरी की तरह है जो खिलाड़ी द्वारा नियम तोड़ने पर तुरंत सीटी बजाता है।

3. "लॉन्ग-टर्म मेमोरी" (Post-Invocation)

  • उपमा (Analogy): कभी-कभी बुरे लोग बहुत अच्छे से नाटक करने में माहिर होते हैं। वे पहली पांच मुलाकातों में अच्छे दिख सकते हैं, लेकिन छठी मुलाकात में, वे कुछ चुराने की कोशिश कर सकते हैं। एक साधारण गार्ड दरवाजे पर इन्हें नहीं पकड़ पाएगा। लेकिन एक समझदार पड़ोसी याद रखता है, "हे, यह आदमी पिछले हफ्ते तो ठीक था, लेकिन आज यह अजीब व्यवहार कर रहा है।"
  • MCPShield इसे कैसे करता है: MCPShield हर बातचीत का एक डायरी रखता है। यह समय के साथ पैटर्न को देखता है। यदि एक सर्वर जो पहले सुरक्षित था, अचानक संदिग्ध व्यवहार करने लगता है (एक "ड्रिफ्ट"), तो रोबोट अपनी याददाश्त अपडेट करता है: "यह व्यक्ति अब भरोसेमंद नहीं है।" यह इस "बुरे व्यक्ति" की सूची अन्य रोबोटों के साथ भी साझा कर सकता है ताकि वे भी धोखा न खाएं।

यह एक बड़ी बात क्यों है

पेपर ने इस सिस्टम का परीक्षण छह अलग-अलग प्रकार के हैकर्स और छह अलग-अलग रोबोट दिमागों के खिलाफ किया।

  • MCPShield के बिना: रोबोट को लगभग 90% बार धोखा दिया गया।
  • MCPShield के साथ: रोबोट ने 95% बार बुरे लोगों को पकड़ लिया।

महत्वपूर्ण बात यह है कि इसने केवल सबको "ना" नहीं कहा। इसने अभी भी ईमानदार सर्वरों को पूरी तरह से काम करने दिया, इसलिए रोबोट ने अपना काम करने की क्षमता नहीं खोई।

निचोड़ (The Bottom Line)

MCPShield रोबोट को एक नादान व्यक्ति से बदलकर एक बुद्धिमान, अनुभवी व्यक्ति बना देता है जो:

  1. विश्वास करने से पहले नए लोगों का परीक्षण (Test) करता है।
  2. काम करते समय उन्हें करीब से देखता (Watch) है।
  3. धीरे-धीरे आने वाले खतरों को पकड़ने के लिए समय के साथ उनके व्यवहार को याद (Remember) रखता है।

यह एक "सुरक्षा मस्तिष्क" है जो हमारे AI सहायकों को हमारे डिजिटल घरों में सुरक्षित रूप से प्रवेश करने के योग्य बनाता है, भले ही दुनिया अजनबियों से भरी हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →