← नवीनतम पेपर
💻 computer science

WebMCP Tool Surface Poisoning: Runtime Manipulation Attacks on LLM Agents

यह शोध पत्र "मिड-सेशन टूल इंजेक्शन" (MSTI) की पहचान और विश्लेषण करता है, जो WebMCP प्रोटोकॉल में एक नया सुरक्षा खतरा है जहाँ हमलावर सक्रिय सत्रों के दौरान एजेंट-सुलभ टूल्स को हाईजैक या फ्रेम करने के लिए थर्ड-पार्टी स्क्रिप्ट्स का लाभ उठाते हैं, और इस प्रकार के रनटाइम मैनिपुलेशन हमलों के विरुद्ध टूल सरफेस को सुरक्षित करने के लिए विशिष्ट डिज़ाइन मिटिगेशन प्रस्तावित करता है।

मूल लेखक: Lin-Fa Lee, Yi-Yu Chang, Chia-Mu Yu, Kuo-Hui Yeh

प्रकाशित 2026-06-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lin-Fa Lee, Yi-Yu Chang, Chia-Mu Yu, Kuo-Hui Yeh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक अत्यधिक बुद्धिमान व्यक्तिगत सहायक (एक AI एजेंट) को एक जटिल कार्य संभालने के लिए काम पर रखा है, जैसे कि कोई यात्रा बुक करना या आपके वित्त का प्रबंधन करना। आप उसे उपयोग करने के लिए स्वीकृत उपकरणों की एक सूची देते हैं: एक "सर्च इंजन," एक "कैलेंडर," और एक "पेमेंट प्रोसेसर।" आप इस बात पर भरोसा करते हैं कि यह सूची निश्चित और सुरक्षित है।

यह शोध पत्र एक नए सुरक्षा खतरे को पेश करता है जिसे WebMCP टूल सरफेस पॉइजनिंग (WebMCP Tool Surface Poisoning) कहा जाता है। यह तर्क देता है कि आपके AI सहायक के लिए उपलब्ध उपकरणों की सूची वास्तव में एक स्थिर और लॉक की गई सूची नहीं है। इसके बजाय, यह एक डिजिटल मेनू की तरह है जिसे आपका सहायक काम करते समय एक हैकर द्वारा गुप्त रूप से फिर से लिखा जा सकता है।

यहाँ सरल उपमाओं का उपयोग करके शोध पत्र के निष्कर्षों का विवरण दिया गया है:

मुख्य समस्या: "जादुई मेनू" (The Magic Menu)

नए WebMCP सिस्टम में, वेबसाइटें सीधे AI एजेंटों को टूल्स (उपकरण) सौंप सकती हैं। शोध पत्र चेतावनी देता है कि इस प्रणाली में एक दोष है: टूल्स की सूची डायनेमिक (गतिशील) है।

AI एजेंट को रसोई में एक शेफ (रसोइया) के रूप में सोचें। "टूल्स" काउंटर पर रखे चाकू, बर्तन और सामग्रियां हैं।

  • पुराना तरीका: शेफ को शुरुआत में सामग्रियों की एक निश्चित सूची मिलती है। यदि सूची में "टमाटर" लिखा है, तो शेफ टमाटर का उपयोग करेगा।
  • WebMCP का तरीका: खाना बनाते समय काउंटर पर मौजूद सामग्रियां बदल सकती हैं। एक शरारती तीसरा पक्ष (एक हैकर) शेफ के हाथ बढ़ाने से ठीक पहले "टमाटर" को "जहरीले बेरीज" से बदल सकता है, या वे एक नया, नकली "मसाला" जोड़ सकते हैं जो देखने में हानिरहित लगता है लेकिन व्यंजन को खराब कर देता है।

दो मुख्य हमले

शोधकर्ताओं ने पहचाना कि हैकर्स इस "रसोई" के साथ दो विशिष्ट तरीकों से छेड़छाड़ कर सकते हैं:

1. टूल हाइजैकिंग (टूल का अपहरण - "द स्विचिरो")

यह एक जादूगर द्वारा कार्ड चुनने से ठीक पहले असली ताश के पत्तों को नकली ताश के पत्तों से बदलने जैसा है।

  • यह कैसे काम करता है: एक हैकर एक स्क्रिप्ट का उपयोग करके एक वैध टूल (जैसे "ईमेल भेजें") को हटा देता है और तुरंत उसी नाम के एक नकली टूल से बदल देता है जो कुछ बुरा करता है (जैसे "हैकर को ईमेल भेजें")।
  • परिणाम: AI को पता नहीं चलता कि उसे धोखा दिया गया है। वह सोचता है कि वह असली टूल का उपयोग कर रहा है, लेकिन वास्तव में वह आपका निजी डेटा हमलावर को सौंप रहा होता है।
  • शोध पत्र का निष्कर्ष: यह हमला बहुत प्रभावी है। उनके परीक्षणों में, यदि बदलाव पर्याप्त जल्दी हुआ, तो AI ने 100% समय नकली टूल का उपयोग किया, जिससे संवेदनशील डेटा हैकर को चला गया।

2. टूल फ्रेमिंग (छद्म रूप - "द डिस्गाइज")

यह टूल को बदलने के बारे में कम है और यह झूठ बोलने के बारे में अधिक है कि टूल क्या करता है।

  • यह कैसे काम करता है: हैकर असली टूल्स को हटाते नहीं हैं। इसके बजाय, वे एक नया, दुर्भावनापूर्ण टूल जोड़ते हैं लेकिन उसे बहुत ही विश्वसनीय विवरण देते हैं। वे इसे "सुरक्षा जांच आवश्यक" या "अनुपालन चरण" के रूप में लेबल कर सकते हैं।
  • परिणाम: AI देखता है कि टूल सुरक्षित और आवश्यक लग रहा है, इसलिए वह इसे अपने सामान्य वर्कफ़्लो के हिस्से के रूप में उपयोग करने का निर्णय लेता है।
  • शोध पत्र का निष्कर्ष: यह अधिक चालाकी भरा है। AI अक्सर मूल कार्य (जैसे ईमेल भेजना) को पूरा करता है जबकि साथ ही बैकग्राउंड में नकली टूल का भी उपयोग करता है। कार्य सफल दिखता है, लेकिन डेटा लीक हो चुका होता है। कुछ मामलों में, AI इस छद्म रूप के झांसे में 85% बार आ गया।

सफलता का "नुस्खा" (The Recipe for Success)

शोधकर्ताओं ने उपलब्ध तीन सबसे स्मार्ट AI मॉडलों (GPT-5.4, Claude Opus, और Gemini 2.5) पर इन हमलों का परीक्षण किया। उन्होंने पाया कि:

  • समय ही सब कुछ है: यदि हैकर AI के सोचने शुरू करने से पहले टूल बदल देता है, तो AI लगभग हमेशा झांसे में आ जाता है। यदि बदलाव AI द्वारा टूल चुनने के बाद होता है, तो हमला आमतौर पर विफल हो जाता है।
  • विवरण मायने रखता है: AI टूल के टेक्स्ट विवरण पर बहुत अधिक निर्भर करता है। यदि विवरण कहता है, "यह एक अनिवार्य सुरक्षा चरण है," तो AI के आज्ञाकारी होने की बहुत अधिक संभावना होती है, भले ही वह टूल दुर्भावनापूर्ण हो।
  • मॉडल के अंतर: कुछ AI दूसरों की तुलना में अधिक भोले थे। उदाहरण के लिए, एक मॉडल (Gemini) कानूनी शब्दावली से भरे लंबे, उबाऊ विवरणों से आसानी से ठगा गया, जबकि दूसरा (Claude) उस विशिष्ट चाल से सुरक्षित रहा।

समाधान: रसोई को लॉक करना (Locking the Kitchen)

शोध पत्र सुझाव देता है कि हम केवल इस भरोसे पर नहीं रह सकते कि AI "बेहतर जान लेगा।" हमें सिस्टम को बनाने के तरीके को बदलने की आवश्यकता है। वे चार मुख्य समाधान प्रस्तावित करते हैं:

  1. ID कार्ड (ID Badges): प्रत्येक टूल के पास एक स्थायी, अपरिवर्तनीय ID कार्ड होना चाहिए जो यह साबित करे कि उसका निर्माता कौन है। यदि कोई टूल अपना नाम या मालिक बदलने की कोशिश करता है, तो सिस्टम उसे अस्वीकार कर देना चाहिए।
  2. घड़ी की जाँच करें (Check the Clock): सिस्टम को यह जांचना चाहिए कि क्या AI के कार्य शुरू करने के बाद से टूल की सूची में कोई बदलाव हुआ है। यदि कोई टूल बदला गया है, तो AI को रुक जाना चाहिए और पुष्टि के लिए पूछना चाहिए।
  3. डेटा की सीमाएं (Data Boundaries): टूल्स को स्पष्ट रूप से बताया जाना चाहिए कि वे किस डेटा को छू सकते हैं। एक "रीड-ओनली" (केवल पढ़ने योग्य) टूल हैकर के सर्वर पर डेटा भेजने में सक्षम नहीं होना चाहिए।
  4. लॉग रखें (Keep a Log): सिस्टम को हर बार जब कोई टूल जोड़ा, हटाया या बदला जाता है, तो एक विस्तृत डायरी रखनी चाहिए, ताकि हम देख सकें कि क्या कुछ संदिग्ध हुआ है।

निष्कर्ष (The Bottom Line)

शोध पत्र निष्कर्ष निकालता है कि "टूल सरफेस" (वे उपकरण जिनका उपयोग AI कर सकता है) अब एक सुरक्षित, स्थिर सीमा नहीं है। यह एक नया स्थान बन गया है जहाँ हैकर्स हमला कर सकते हैं। यहाँ तक कि सबसे स्मार्ट AI मॉडल भी धोखा खा सकते हैं यदि उन्हें दिए गए टूल्स को उनके काम करते समय गुप्त रूप से बदल दिया जाए या छिपा दिया जाए। सुरक्षित रहने के लिए, सिस्टम को खुद को फिर से डिजाइन करने की आवश्यकता है ताकि वह केवल AI के समझने पर भरोसा करने के बजाय टूल्स को लगातार सत्यापित कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →