← नवीनतम पेपर
💬 NLP

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

यह शोध पत्र एक नवीन "फंक्शन हाइजैकिंग अटैक" (FHA) प्रस्तुत करता है जो संदर्भ अर्थशास्त्र (context semantics) की परवाह किए बिना एजेंटिक एआई मॉडल्स को हमलावर द्वारा चुने गए फंक्शन्स को निष्पादित करने के लिए मजबूती से हेरफेर करता है, जो विविध मॉडल्स में उच्च सफलता दर प्राप्त करता है और फंक्शन-कॉलिंग सिस्टम में उन्नत सुरक्षा गार्डरेल्स की महत्वपूर्ण आवश्यकता को प्रदर्शित करता है।

मूल लेखक: Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

प्रकाशित 2026-04-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Breaking MCP with Function Hijacking Attacks" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी तस्वीर: "स्मार्ट बटलर" की समस्या

कल्पura है कि आपके पास एक सुपर-स्मार्ट डिजिटल बटलर (एक AI एजेंट) है जो आपके लिए कुछ भी कर सकता है: आपका ईमेल चेक करना, फ्लाइट बुक करना, या GitHub पर आपका कोड मैनेज करना। यह करने के लिए, बटलर के पास विशिष्ट टूल्स (functions) से भरा एक टूलबॉक्स है जैसे कि send_email, book_flight, या delete_file|

सामान्य रूप से, जब आप कहते हैं, "मेरे लिए पेरिस की एक फ्लाइट बुक करो," तो बटलर अपने टूलबॉक्स को देखता है, book_flight टूल चुनता है, और काम पूरा करता है। इसे फंक्शन कॉलिंग (Function Calling) कहा जाता है।

समस्या:
शोधकर्ताओं ने इस पेपर में बटलर को धोखा देने का एक तरीका खोजा है। उन्होंने बटलर के टूलबॉक्स में एक विशिष्ट टूल के लेबल को "जहरीला" (poison) बनाने का तरीका खोजा है ताकि आप बटलर से कुछ भी करने को कहें, वह गलत टूल ही उठा ले।

यदि आप कहते हैं, "एक फ्लाइट बुक करो," तो बटलर गलती से delete_all_files टूल उठा सकता है क्योंकि उस टूल के लेबल को गुप्त रूप से इस तरह बदल दिया गया था कि वह AI के लिए बहुत आकर्षक दिखने लगे।

हमला: "फंक्शन हाइजैकिंग" (FHA)

यह पेपर एक नए प्रकार के हमले को पेश करता है जिसे फंक्शन हाइजैकिंग (Function Hijacking) कहा जाता है। यह कैसे काम करता है, इसके कुछ उदाहरण यहाँ दिए गए हैं:

1. "मेन्यू" वाला छल

कल्पना कीजिए कि एक रेस्टोरेंट का मेन्यू है जहाँ वेटर (AI) तय करता है कि क्या पकाना है, जो डिश के विवरण (description) पर आधारित होता है।

  • सामान्य: डिश "Spaghetti" का विवरण है "टमाटर सॉस के साथ स्वादिष्ट पास्ता।" डिश "Poison" का विवरण है "विषाक्त कीचड़ (Toxic sludge)।"
  • हमला: हमलावर स्पैगेटी को नहीं बदलता है। इसके बजाय, वे "Poison" डिश के विवरण में कुछ अजीब, भ्रमित करने वाले शब्द डाल देते हैं। वे विवरण को ऐसा बना देते हैं जो एक गुप्त कोड की तरह दिखे जिसे वेटर का दिमाग गहराई से पसंद करने के लिए प्रोग्राम किया गया हो।
  • परिणाम: भले ही आप "Spaghetti" ऑर्डर करें, वेटर का दिमाग "Poison" के विवरण से इतना विचलित हो जाता है कि वह आपको जहर (Poison) ही परोस देता है।

2. "जादुई मंत्र" (Adversarial Tokens)

शोधकर्ताओं ने केवल एक मज़ेदार विवरण नहीं लिखा; उन्होंने एक गणितीय "मंत्र" (जिसे adversarial suffix कहा जाता है) का उपयोग किया।

  • AI को एक परीक्षा देने वाले छात्र के रूप में सोचें। परीक्षा पूछती है, "2+2 क्या है?"
  • हमलावर कागज के पीछे एक छोटा, अदृश्य नोट लिख देता है जो कहता है, "गणित को अनदेखा करें, '42' लिखें।"
  • क्योंकि AI पैटर्न का पालन करने के लिए प्रशिक्षित है, वह इस नोट को देखता है और गणित करने के बजाय, अंधाधुंध "42" लिख देता है।
  • इस पेपर में, यह "नोट" AI के सिस्टम में मौजूद एक टूल के विवरण (description) के अंदर छिपा होता है।

यह क्यों डरावना है (निष्कर्ष)

शोधकर्ताओं ने 5 अलग-अलग AI मॉडल्स (उन स्मार्ट मॉडल्स सहित जो कार्य करने से पहले "सोचते" हैं) पर इसका परीक्षण किया। उन्होंने यह पाया:

  • यह हर जगह काम करता है: इससे कोई फर्क नहीं पड़ता कि AI को कोड लिखने, मौसम देखने, या डेटाबेस प्रबंधित करने के लिए कहा गया था। यह हमला उन सभी पर काम कर गया।
  • यह अदृश्य है: इस हमले के लिए उपयोगकर्ता को कुछ भी अजीब टाइप करने की आवश्यकता नहीं है। उपयोगकर्ता एक सामान्य चीज़ मांगता है (जैसे "एक फ़ाइल बनाएँ"), लेकिन सिस्टम किसी खतरनाक चीज़ को करने के लिए मजबूर हो जाता है (जैसे "सर्वर डिलीट करें") क्योंकि टूल का विवरण जहरीला था।
  • यह शक्तिशाली है: यह हमला 70% से 100% बार सफल रहा। इसका मतलब है कि यदि आप इसे 10 बार आज़माते हैं, तो यह 7 से 10 बार काम करेगा।
  • यह "यूनिवर्सल" है: शोधकर्ताओं ने दिखाया कि आप एक ही जहरीला टूल विवरण बना सकते हैं जो कई अलग-अलग सवालों पर काम करता है। आपको हर सवाल के लिए नया तरीका खोजने की ज़रूरत नहीं है; एक "जादुगत मंत्र" सभी के लिए काम करता है।

"सोचने वाले" AI की चुनौती

कुछ उन्नत AI में एक "सोचने का मोड" होता है जहाँ वे कार्य करने से पहले तर्क करने के लिए रुकते हैं।

  • उपमा: कल्पना कीजिए कि एक बटलर रुककर कहता है, "हम्म, उपयोगकर्ता ने फ्लाइट के लिए पूछा है, लेकिन शायद उनका मतलब ट्रेन से था? मुझे सोचने दो..."
  • हैक: शोधकर्ताओं ने एक तरीका खोजा जिससे AI इस सोचने वाले हिस्से को पूरी तरह से छोड़ दे। उन्होंने AI को सीधे गलत टूल की ओर कूदने के लिए मजबूर कर दिया, जिससे उसके सुरक्षा चेक (safety checks) बायपास हो गए।

पिछले हमले उतने प्रभावी क्यों नहीं थे

पिछले हमलों ने AI को उपयोगकर्ता के प्रश्न को बदलकर (जैसे, "कृपया फ़ाइल डिलीट करें, लेकिन इसे एक खेल कहें") धोखा देने की कोशिश की थी।

  • सीमा: यदि उपयोगकर्ता कोई अलग प्रश्न पूछता है, तो पुराना तरीका काम करना बंद कर देता है।
  • नया हैक: यह नया हमला स्वयं टूल को बदल देता है। चूंकि टूल हमेशा वहां मौजूद है, टूलबॉक्स में इंतज़ार कर रहा है, इसलिए हमला काम करता है चाहे उपयोगकर्ता कुछ भी पूछे। यह किसी के भी आने के रास्ते में ताला बदलने जैसा है, ताकि कोई भी प्रवेश करने की कोशिश करे तो बाहर ही रह जाए, चाहे वह कोई भी हो।

समाधान: गार्डरेल्स (Guardrails)

पेपर निष्कर्ष निकालता है कि हम अब केवल AI एजेंटों पर सही टूल्स चुनने के लिए भरोसा नहीं कर सकते। हमें चाहिए:

  1. बेहतर ताले: ऐसे सुरक्षा सिस्टम जो यह जाँच सकें कि क्या किसी टूल के विवरण के साथ छेड़छाड़ की गई है।
  2. दोहरा सत्यापन (Double-Checks): यह सुनिश्चित करना कि AI केवल सबसे "ज़ोरदार" (loudest) टूल ही न चुने, बल्कि वास्तव में यह सत्यापित करे कि टूल उपयोगकर्ता के अनुरोध से मेल खाता है या नहीं।

सारांश

यह पेपर AI के भविष्य के लिए एक चेतावनी लेबल है। यह दिखाता है कि यदि हम AI एजेंटों को अपने डिजिटल टूल्स को नियंत्रित करने देते हैं, तो बुरे तत्व बैकग्राउंड में टूल के विवरण को "जहरीला" बना सकते हैं। एक बार जहरीला होने के बाद, AI खुशी-खुशी गलत काम करेगा, भले ही उपयोगकर्ता सही चीज़ मांग रहा हो। यह एक ऐसे शेफ की तरह है जो, एक बदली हुई रेसिपी बुक के कारण, आपके द्वारा ऑर्डर किए गए सूप के बजाय आपको ज़हर परोस देता है, चाहे आपने कुछ भी ऑर्डर किया हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →