← नवीनतम पेपर
🤖 machine learning

When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems

यह शोध पत्र प्रदर्शित करता है कि मल्टी-एजेंट LLM सिस्टम में स्थानीय रनटाइम मॉनिटर उन वितरित बैकडोर्स (distributed backdoors) का पता लगाने में विफल रहते हैं जब हानिकारक पेलोड को व्यक्तिगत रूप से निर्दोष अंशों में विभाजित किया जाता है, जो एक अवलोकन सीमा (observability boundary) स्थापित करता है जहाँ सुरक्षा केवल तभी सुनिश्चित की जा सकती है जब असेंबल की गई वस्तु का पता लगाया जाए या उस अंतर्निहित प्रतिनिधित्व तक पहुँचा जाए जहाँ क्षति उजागर होती है।

मूल लेखक: Yibo Hu, Ren Wang

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yibo Hu, Ren Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हाई-टेक फैक्ट्री के सुरक्षा गार्ड हैं। आपका काम बुरे लोगों को खतरनाक सामान (contraband) अंदर घुसने से रोकना है। आमतौर पर, आप कन्वेयर बेल्ट पर आने वाले हर एक पैकेज की जांच करते हैं। अगर कोई बॉक्स संदिग्ध लगता है, तो आप उसे रोक देते हैं। अगर वह सामान्य दिखता है, तो आप उसे जाने देते हैं।

AI की दुनिया में, ये "पैकेज" अलग-अलग AI एजेंटों के बीच भेजे जाने वाले संदेश हैं जो मिलकर काम कर रहे हैं। मानक सुरक्षा नियम यह है: हर संदेश की व्यक्तिगत रूप से जांच करें। यदि हर संदेश सुरक्षित दिखता है, तो पूरा सिस्टम सुरक्षित है।

लेकिन, यह शोध पत्र, जिसे यिबो हू और रेन वांग ने लिखा है, इस नियम में एक भयानक खामी का खुलासा करता है। उन्होंने पाया कि बुरे लोग एक खतरनाक "बम" को छोटे, हानिरहित दिखने वाले टुकड़ों में विभाजित कर सकते हैं, उन्हें अलग-अलग पैकेजों में छिपा सकते हैं, और आपके सुरक्षा गार्ड को धोखा दे सकते हैं।

"फ्रेंकेंस्टीन" बम

यहाँ चाल यह है: हमलावर एक बड़ा बुरा संदेश नहीं भेजते। इसके बजाय, वे तीन अलग-अलग रिपोर्ट भेजते हैं।

  • रिपोर्ट 1: "डेटा रिट्रीवल पूर्ण; 247 प्रविष्टियाँ दर्ज की गईं।" (बिल्कुल सामान्य दिखता है।)
  • रिपोर्ट 2: "विश्लेषण समाप्त; कोई विसंगति नहीं पाई गई।" (यह भी ठीक दिखता है।)
  • रिपोर्ट 3: "सारांश तैयार; सभी कार्य पूर्ण।" (पूरी तरह से निर्दोष।)

आपका सुरक्षा गार्ड रिपोर्ट 1 की जांच करता है। पास। रिपोर्ट 2 की जांच करता है। पास। रिपोर्ट 3 की जांच करता है। पास। गार्ड अपना काम बखूबी कर रहा है! हर एक जांच सही है।

लेकिन फिर, एक अंतिम AI एजेंट उन तीनों रिपोर्टों को लेता है और उन्हें आपस में जोड़ देता है। अचानक, वे टुकड़े अपनी जगह पर फिट हो जाते हैं और एक गुप्त, निष्पादित (executable) कंप्यूटर प्रोग्राम बन जाते हैं जो पासवर्ड चुराता है और उन्हें हैकर को भेज देता है। "बम" केवल तभी अस्तित्व में आता है जब टुकड़ों को जोड़ा जाता है। खतरा किसी एक पैकेज में नहीं था; खतरा उसके संयोजन (assembly) में था।

लेखक इसे "ऑब्जर्वेबिलिटी बाउंड्री" (Observability Boundary) कहते हैं। यह एक रेखा है। एक बार जब बुरे टुकड़ों को इतनी अच्छी तरह से तोड़ दिया जाता है कि वे साधारण, उबाऊ ट्रैफिक की तरह दिखने लगते हैं, तो आपका सुरक्षा गार्ड अंधा हो जाता है। गार्ड चाहे कितना भी स्मार्ट क्यों न हो, यदि वह केवल एक समय में एक ही टुकड़े को देखता है, तो वह खतरे को नहीं देख सकता।

गार्ड क्या गलत करता है

यह पत्र स्पष्ट रूप से उन चीजों के खिलाफ तर्क देता है जिनकी लोग उम्मीद कर सकते हैं:

  • विभाजन (Splitting) समस्या नहीं है: आप सोच सकते हैं, "ओह, अगर हम बस उन्हें संदेश को विभाजित करने से रोक दें, तो हम सुरक्षित रहेंगे।" लेखक कहते हैं नहीं। भले ही संदेश को विभाजित किया गया हो, यदि टुकड़ों में अभी भी "सुराग" (जैसे अजीब कोड शब्द या विचित्र डेटा पथ) मौजूद हैं, तो एक स्मार्ट गार्ड उन्हें पकड़ सकता है। समस्या केवल तब होती है जब टुकड़े स्थानीय रूप से निर्दोष (locally benign) होते हैं—यानी वे 100% सामान्य, उबाऊ टेक्स्ट की तरह दिखते हैं।
  • अधिक आँखें मदद नहीं करतीं: आप सोच सकते हैं, "क्या होगा अगर हमारे पास एक ऐसा गार्ड हो जो एक साथ सभी संदेश देख सके?" पेपर में इसकी जांच की गई। भले ही गार्ड तीनों रिपोर्टों को एक साथ देखता है, यदि वे अभी भी केवल कच्चे टेक्स्ट (raw text) को देख रहे हैं और उन्हें गुप्त भाषा को "डिकोड" करने का तरीका नहीं पता है, तो वे फिर भी हमले को मिस कर देंगे। अधिक देखना पर्याप्त नहीं है; आपको सही तरह की तस्वीर देखने की आवश्यकता है।
  • AI कोई जादुई डिकोडर नहीं है: लेखकों ने एक सुपर-स्मार्ट AI का उपयोग करके यह जानने की कोशिश की कि बिना बताए टुकड़ों को कैसे जोड़ा जाए। यह मुश्किल से काम कर पाया। इसने 50 में से केवल 6 हमलों को पकड़ा, जो लगभग अनुमान लगाने जैसा है।

जीतने का एकमात्र तरीका (अभी तक)

तो, आप इसे कैसे रोकते हैं? पेपर दिखाता है कि इस बम को पकड़ने का एकमात्र तरीका यह है कि आप क्या देख रहे हैं, उसे बदल दें।

यदि आपके पास एक "डिकोडर" है जो हमलावरों द्वारा उपयोग की जाने वाली गुप्त भाषा को जानता है, तो आप उन तीन निर्दोष रिपोर्टों को डिकोड कर सकते हैं, और अचानक छिपा हुआ कोड उजागर हो जाता है। अपने परीक्षणों में, जब उन्होंने एक ऐसा डिकोडर इस्तेमाल किया जो हमलावरों के विशिष्ट "कोड परिवार" को जानता था, तो उन्होंने 100% हमलों को रोका (50 में से 50)।

हालाँकि, एक पेच है। यह डिकोडर एक विशिष्ट ताले के लिए मास्टर चाबी रखने जैसा है। यदि हमलावर अपना ताला बदलते हैं (एक अलग कोड परिवार का उपयोग करते हैं), तो डिकोडर काम नहीं कर सकता है। पेपर सुझाव देता है कि हर एक ट्रिक (सिर्फ कोड ही नहीं, बल्कि योजनाएं और विश्वास भी) के लिए एक विशिष्ट डिकोडर की आवश्यकता के बिना, इन छिपे हुए पैटर्न को पहचानने का एक सार्वभौमिक तरीका खोजना भविष्य के शोधकर्ताओं के लिए एक बड़ा, अनसुलझा रहस्य है।

जादू के पीछे के अंक

लेखकों ने केवल अनुमान नहीं लगाया; उन्होंने एक नियंत्रित लैब में बहुत सारे परीक्षण किए।

  • जब हमलावरों ने टुकड़ों को पूरी तरह से सामान्य बनाया (locally benign), तो मानक सुरक्षा जांच संयोग के स्तर (chance level) पर गिर गई (1.0 के पैमाने पर जहाँ 1.0 पूर्ण है, लगभग 0.500)। वे मूल रूप से सिक्का उछाल रहे थे।
  • लेकिन, जब उन्होंने संयोजित वस्तु को देखा और एक विशेष "वन-क्लास" डिटेक्टर का उपयोग किया (जो केवल सामान्य चीजों पर प्रशिक्षित था ताकि विसंगतियों को पहचाना जा सके), तो उन्होंने सिग्नल को 0.874 के स्कोर के साथ रिकवर किया।
  • जब उन्होंने "डिकोडेड-व्यू गेट" (वह वाला जिसमें मास्टर की थी) का उपयोग किया, तो उन्होंने 0 में से 50 सफल हमलों को रोका। हमलावर सफल नहीं हो सके।

मुख्य निष्कर्ष

मुख्य निष्कर्ष थोड़ा डरावना लेकिन बहुत स्पष्ट है: स्थानीय सुरक्षा, वैश्विक सुरक्षा नहीं है। सिर्फ इसलिए कि मल्टी-एजेंट सिस्टम में प्रत्येक चरण सुरक्षित दिखता है, इसका मतलब यह नहीं है कि अंतिम परिणाम सुरक्षित है।

लेखकों ने साबित किया कि एक बार जब हानिकारक पेलोड को ऐसे टुकड़ों में विभाजित कर दिया जाता है जो पूरी तरह से हानिरहित दिखते हैं, तो कोई भी स्थानीय डिटेक्टर इसे नहीं पकड़ सकता। जीतने का एकमात्र तरीका उस रूप में "संयोजित वस्तु" को देखना है जहाँ खतरा उजागर हो जाता है। जब तक हम हर प्रकार की ट्रिक (सिर्फ कोड ही नहीं, बल्कि योजनाएं और विश्वास भी) के लिए ऐसा करने का तरीका नहीं खोज लेते, तब तक यह "ऑब्जर्वेबिलिटी बाउंड्री" हमारी AI सुरक्षा नेट में एक मौलिक छेद बनी रहेगी।

यह फ्रैंकेंस्टीन राक्षस को रोकने के लिए उसके शरीर के अलग-अलग अंगों की जांच करने जैसा है। एक हाथ सुरक्षित दिखता है। एक पैर सुरक्षित दिखता है। लेकिन उन्हें एक साथ रखें, और आपके पास एक राक्षस होता है। पेपर हमें बताता है कि हमें अंगों की जांच करना बंद करना होगा और यह सीखना शुरू करना होगा कि राक्षस के जागने से पहले उसे कैसे देखा जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →