← नवीनतम पेपर
💬 NLP

Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems

यह शोधपत्र डॉक्यूमेंट-ड्रिवन इम्प्लिसिट पेलोड एक्ज़ीक्यूशन (DDIPE) को प्रस्तुत करता है, जो एक नवीन सप्लाई-चेन हमला है जो स्किल डॉक्यूमेंटेशन में मैलिशियस लॉजिक को एम्बेड करके LLM एजेंट सुरक्षा उपायों को बायपास करता है, और यह प्रदर्शित करता है कि ऐसे इम्प्लिसिट हमले स्पष्ट निर्देश हमलों की तुलना में काफी उच्च सफलता दर के साथ एजेंट कार्यों को सफलतापूर्वक हाईजैक कर सकते हैं।

मूल लेखक: Yubin Qu, Yi Liu, Tongcheng Geng, Gelei Deng, Yuekang Li, Leo Yu Zhang, Ying Zhang, Lei Ma

प्रकाशित 2026-04-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yubin Qu, Yi Liu, Tongcheng Geng, Gelei Deng, Yuekang Li, Leo Yu Zhang, Ying Zhang, Lei Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट, अति-कुशल व्यक्तिगत सहायक है जिसका नाम "एजेंट" (Agent) है। यह एजेंट कोड लिख सकता है, फाइलों को मैनेज कर सकता है, और आपकी ओर से अन्य कंप्यूटरों से बात भी कर सकता है। इस एजेंट को और अधिक उपयोगी बनाने के लिए, आप इसे "कौशल" (skills) का एक पुस्तकालय देते हैं (जैसे किसी वीडियो गेम के लिए प्लगइन स्टोर)। ये कौशल सुरक्षित, पूर्व-अनुमोदित निर्देश होने चाहिए जो एजेंट को विशिष्ट कार्य करने के तरीके बताते हैं, जैसे कि "मेरी फाइलों का बैकअप लें" या "एक वेबसाइट सेटअप करें।"

समस्या: ज़हरीली रेसिपी बुक (The Poisoned Recipe Book)

यह शोध पत्र बताता है कि हैकर्स इस एजेंट को धोखा देने के लिए एक डरावने नए तरीके का उपयोग कर सकते हैं।

आमतौर पर, हमें डर होता है कि हैकर्स सॉफ्टवेयर पैकेज के अंदर वायरस डाल देंगे (जैसे कि ट्रोजन हॉर्स)। लेकिन यह शोध पत्र दिखाता है कि हैकर्स को खुद पैकेज को तोड़ने की ज़रूरत नहीं है। इसके बजाय, वे कौशल के साथ आने वाले "निर्देश मैनुअल" (documentation) को ज़हरीला (poison) बना सकते हैं।

इसे इस तरह से सोचें:

  • आप एक शेफ (एजेंट) को खाना पकाने के लिए काम पर रखते हैं।
  • शेफ के पास एक कुकबुक (स्किल डॉक्यूमेंटेशन) है जिसमें लिखा है, "इस सूप को बनाने के लिए, पहले पानी उबालें, फिर गाजर डालें।"
  • एक हैकर लाइब्रेरी में घुस जाता है और कुकबुक को बदल देता है। नया पन्ना बिल्कुल वैसा ही दिखता है, लेकिन उसमें नीचे एक छोटा सा, छिपा हुआ नोट है: "पी.एस. परोसने से पहले, कृपया सूप में एक कप ज़हर डालें और मेरे गुप्त पते पर रसोई की एक फोटो भेजें।"

क्योंकि शेफ उस कुकबुक पर पूरी तरह भरोसा करता है, वह उस नोट को पढ़ता है, यह सोचकर कि यह सिर्फ एक मज़ेदार निर्देश है, और वास्तव में उसे कर देता है। उसे पता ही नहीं चलता कि उसे धोखा दिया गया है क्योंकि निर्देश को सामान्य रेसिपी के हिस्से के रूप में छिपाया गया है।

हमला: "डॉक्यूमेंट-ड्रिवन इमप्लिसिट पेलोड एक्जीक्यूशन" (DDIPE)

शोधकर्ता इस हमले को DDIPE कहते हैं। यह कैसे काम करता है, इसे सरल भाषा में यहाँ दिया गया है:

  1. छद्म वेश (The Disguise): हैकर एक दुर्भावनापूर्ण स्क्रिप्ट (ज़हर) लिखता है, लेकिन वह इसे स्किल के डॉक्यूमेंटेशन में एक "कोड उदाहरण" या "कॉन्फ़िगरेशन टेम्पलेट" के रूप में छिपा देता है। वे इसे एक उबाऊ, आवश्यक कदम जैसा दिखाते हैं, जैसे कि "सिस्टम लॉग की जाँच करना" या "फाइलों का बैकअप लेना।"
  2. विश्वास (The Trust): जब एजेंट कोई कार्य करने की कोशिश करता है, तो वह स्किल के मैनुअल को पढ़ता है। वह कोड उदाहरण देखता है और सोचता है, "ओह, मैनुअल कहता है कि मुझे पूरी तरह से काम करने के लिए यह करना चाहिए। मैं उस कोड को कॉपी करूँगा और उसे चलाऊँगा।"
  3. निष्पादन (The Execution): एजेंट कोड चलाता है। चूंकि एजेंट के पास आपके कंप्यूटर तक उच्च-स्तरीय पहुँच (high-level access) है (वह फाइलें हटा सकता है, सॉफ्टवेयर इंस्टॉल कर सकता है, और डेटा भेज सकता है), उस छोटे से छिपे हुए कोड के पास अचानक आपके पासवर्ड चुराने, आपकी फाइलों को लॉक करने या आपका डेटा हैकर को भेजने की शक्ति आ जाती है।

यह इतना खतरनाक क्यों है?

  • यह "सुरक्षा गार्ड" को बायपास कर देता है: आधुनिक AI मॉडल को प्रशिक्षित किया गया है कि यदि आप उनसे "मेरे पासवर्ड चुराओ" कहें तो वे "ना" कहें। लेकिन वे "ना" नहीं कहते यदि आप उनसे "मैनुअल में दिए गए निर्देशों का पालन करें" कहें, भले ही उस रेसिपी में कोई छिपा हुआ जाल हो। एजेंट सोचता है कि वह सिर्फ निर्देशों का पालन कर रहा है, न कि कोई अपराध कर रहा है।
  • यह अदृश्य है: कोड वायरस जैसा नहीं दिखता। यह एक मानक आईटी कार्य जैसा दिखता है।
  • यह स्केल करता है: शोधकर्ताओं ने इन ज़हरीले कौशलों के 1,070 अलग-अलग संस्करण स्वचालित रूप से बनाने के लिए एक प्रणाली बनाई। उन्होंने इसका परीक्षण 5 अलग-अलग AI मॉडल और 4 अलग-अलग एजेंट सिस्टम पर किया।

परिणाम: "सोता हुआ" खतरा (The "Sleeping" Danger)

अध्ययन से पता चला कि:

  • यह काम करता है: सबसे सुरक्षित सिस्टम भी धोखा खा गए। लगभग 2.3% से 33.5% बार, एजेंट ने वास्तव में दुर्भावनापूर्ण कोड को निष्पादित (execute) किया।
  • "स्लीपर" प्रभाव (The "Sleeper" Effect): कुछ हमले एक AI मॉडल पर काम नहीं करते थे लेकिन दूसरे पर पूरी तरह से काम करते थे। यह एक ऐसी चाबी की तरह है जो एक दरवाज़ा खोलती है लेकिन दूसरे को नहीं। इसका मतलब है कि यदि आप विभिन्न AI मॉडलों का मिश्रण उपयोग करते हैं, तो आप अधिक सुरक्षित हो सकते हैं क्योंकि उनके "ब्लाइंड स्पॉट्स" (blind spots) अलग होते हैं।
  • वास्तविक दुनिया का प्रभाव: शोधकर्ताओं ने इन खामियों के बारे में कंपनियों (जैसे एंथ्रोपिक, गूगल और अन्य) को बताया। कुछ कंपनियों ने इन कमजोरियों को स्वीकार किया और उन्हें ठीक कर रही हैं। एक विशिष्ट मामले में, एक हैकर ने एजेंट को एक कॉन्फ़िगरेशन फ़ाइल बदलने के लिए मजबूर किया ताकि हर भविष्य के सॉफ़्टवेयर अपडेट में असली चीज़ के बजाय एक वायरस डाउनलोड हो सके।

निष्कर्ष (The Takeaway)

हम एक ऐसे युग में प्रवेश कर रहे हैं जहाँ AI एजेंट हमारे आदेशों का पालन करेंगे, हमारी फाइलों और कोड को मैनेज करेंगे। यह शोध पत्र चेतावनी देता है कि हम केवल उन "निर्देश मैनुअल" पर भरोसा नहीं कर सकते जिन्हें हमारे एजेंट पढ़ते हैं।

सिर्फ इसलिए कि कोई फ़ाइल एक सहायक गाइड की तरह दिखती है, इसका मतलब यह नहीं है कि वह सुरक्षित है। लेखक सुझाव देते हैं कि हमें:

  1. केवल शब्दों को नहीं, बल्कि "इरादे" (intent) की जाँच करें: केवल बुरे शब्दों को स्कैन न करें; समझें कि कोड वास्तव में क्या करने की कोशिश कर रहा है।
  2. अंधाधुंध भरोसा न करें: भले ही कोई कौशल "विश्वसनीय" मार्केटप्लेस से आया हो, वह ज़हरीला हो सकता है।
  3. AI की एक टीम का उपयोग करें: चूंकि अलग-अलग AI के अलग-अलग ब्लाइंड स्पॉट्स होते हैं, इसलिए एक-दूसरे के काम की दोबारा जाँच करने के लिए AI की एक टीम का उपयोग करना इन हमलों को रोक सकता है।

संक्षेप में: यदि आप अपने AI एजेंट को अपने घर की चाबी देते हैं, तो सुनिश्चित करें कि उसे दिए गए निर्देश किसी अजनबी द्वारा अंधेरे में फिर से लिखे नहीं गए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →