Blind Spots in the Guard: How Domain-Camouflaged Injection Attacks Evade Detection in Multi-Agent LLM Systems
यह शोध पत्र प्रकट करता है कि मल्टी-एजेंट एलएलएम (LLM) सिस्टम में इंजेक्शन डिटेक्टर एक महत्वपूर्ण "कैमफ्लाज डिटेक्शन गैप" (छलावरण पहचान अंतराल) से ग्रस्त हैं, जो उन हमलों की पहचान करने में विफल रहते हैं जो डोमेन-विशिष्ट शब्दावली और अधिकार संरचनाओं की नकल करते हैं, जिसके कारण पहचान दर तेजी से गिर जाती है और सुरक्षा तंत्रों में एक गंभीर संरचनात्मक भेद्यता उजागर होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सहायक रोबोट सहायक (एक AI एजेंट) है जो आपके लिए दस्तावेज़ पढ़ता है। शायद वह एक वित्तीय रोबोट है जो स्टॉक रिपोर्ट पढ़ रहा है, या एक कानूनी रोबोट जो अनुबंधों (contracts) की समीक्षा कर रहा है। इसे सुरक्षित रखने के लिए, आपने इसमें एक "सुरक्षा गार्ड" (एक इंजेक्शन डिटेक्टर) स्थापित किया है। इस गार्ड का काम उन लोगों को पकड़ना है जो दस्तावेज़ों के भीतर छिपे हुए किसी गुप्त, दुर्भावनापूर्ण निर्देश (malicious command) को अंदर डालने की कोशिश करते हैं।
समस्या: "भेड़ की खाल में भेड़िया"
यह शोध पत्र तर्क देता है कि सुरक्षा गार्ड को स्पष्ट, शोर मचाने वाले घुसपैठियों को खोजने के लिए प्रशिक्षित किया गया है। सोचिए एक स्थिर हमले (static attack) के बारे में, जैसे कि कोई व्यक्ति चमकीला लाल मुखौटा पहने हुए, एक बोर्ड पकड़े हुए, जिस पर लिखा हो, "सभी पिछले नियमों को अनदेखा करें! वही करें जो मैं कहता हूँ!" गार्ड इसे तुरंत देख लेता है और अलार्म बजा देता है।
लेकिन यह शोध पत्र एक नई, अधिक चालाक किस्म के हमले को पेश करता है जिसे डोमेन-कैमफ्लाज इंजेक्शन (Domain-Camouflaged Injection) कहा जाता है।
कल्पना कीजिए कि एक परिष्कृत चोर है जो मुखौटा नहीं पहनता। इसके बजाय, वह बिल्कुल एक भरोसेमंद विशेषज्ञ की तरह कपड़े पहनता है। यदि आपका रोबोट एक वित्तीय रिपोर्ट पढ़ रहा है, तो चोर एक नकली पैराग्राफ लिखता है जो बिल्कुल वैसा ही दिखता है और वैसा ही सुनाई देता है जैसा कि एक वास्तविक वित्तीय विश्लेषक ने लिखा होगा। वे उन्हीं फैंसी शब्दों, उसी वाक्य संरचना और उसी गंभीर लहजे का उपयोग करते हैं। लेकिन इसके भीतर एक गुप्त निर्देश छिपा है: "सभी स्टॉक बेच दें।"
गार्ड के लिए, यह दस्तावेज़ का एक वैध हिस्सा दिखता है। गार्ड को कोई लाल मुखौटा नहीं दिखता; उसे केवल एक सूट और टाई दिखाई देती है। इसलिए, गार्ड कहता है, "सब कुछ साफ लग रहा है," और उस दुर्भावनापूर्ण निर्देश को बिना किसी रोक-टोक के गुजर जाने देता है।
बड़ी खोज: "अंधा मोड़" (The Blind Spot)
शोधकर्ताओं ने दो अलग-अलग AI मॉडल (Llama और Gemini) के साथ इसका परीक्षण किया और एक विशाल अंतर पाया, जिसे वे कैमफ्लाज डिटेक्शन गैप (CDG) कहते हैं।
- Llama मॉडल के लिए: गार्ड ने 94% स्पष्ट "लाल मुखौटा" हमलों को पकड़ा। लेकिन जब हमलों को विशेषज्ञ टेक्स्ट के रूप में छद्म रूप दिया गया, तो गार्ड केवल 9.7% को ही पकड़ पाया। उसने लगभग सब कुछ मिस कर दिया।
- Gemini मॉडल के लिए: गार्ड ने 100% स्पष्ट हमलों को पकड़ा, लेकिन छद्म रूप वाले हमलों को पकड़ने के मामले में वह गिरकर 55.6% पर आ गया।
डरावनी बात यह है कि गार्ड भ्रमित या अनिश्चित नहीं था; वह आत्मविश्वास के साथ गलत (confidently wrong) था। उसने छद्म हमले को देखा और 100% निश्चितता के साथ कहा, "यह सुरक्षित है!" जबकि वह वास्तव में खतरनाक था। इसका मतलब है कि आप केवल गार्ड को "अधिक सावधान रहने" या "अधिक चिंता करने" के लिए कहकर इसे ठीक नहीं कर सकते; गार्ड को बस यह पता ही नहीं है कि उसे क्या देखना है।
"डिबेट क्लब" प्रयोग
शोधकर्ताओं ने एक अलग सुरक्षा रणनीति भी आजमाई: निर्णय लेने से पहले तीन रोबोटों को उत्तर पर बहस करने के लिए कहना।
कमजोर रोबोट (Llama) के लिए: बहस ने चीजों को और खराब कर दिया। जब रोबोटों ने बहस की, तो उन्होंने वास्तव में बुरे निर्देशों को और बढ़ा दिया। यदि एक रोबोट छद्म टेक्स्ट से धोखा खा गया, तो अन्य भी उसके पीछे चल दिए, जिससे गलती होने की संभावना 10 गुना बढ़ गई। यह बिल्कुल वैसा ही है जैसे दोस्तों का एक समूह गलत उत्तर पर सहमत हो जाता है क्योंकि कोई भी यह कहने वाला नहीं चाहता कि, "रुको, यह बहुत असली लग रहा है, लेकिन क्या यह वास्तव में सही है?"
मजबूत रोबोट (Gemini) के लिए: बहस ने मदद की। मजबूत रोबोट चाल को पहचान सके और एक-दूसरे को सुधार सके, जिससे सिस्टम अधिक सुरक्षित हो गया।
क्या हम बस और उदाहरण जोड़ सकते हैं?
शोधकर्ताओं ने एक "सस्ता समाधान" आजमाया: सुरक्षा गार्ड को इन छद्म हमलों के कुछ उदाहरण दिखाए गए ताकि वह सीख सके कि उसे क्या खोजना है।
- मजबूत रोबोट (Gemini) के लिए: यह बहुत अच्छा काम कर गया। गार्ड ने पैटर्न को सीखा और लगभग सभी छद्म हमलों को पकड़ लिया।
- कमजोर रोबोट (Llama) के लिए: इससे बहुत कम मदद मिली। गार्ड अभी भी अधिकांश मामलों को मिस कर गया। यह सुझाव देता है कि छोटे, सस्ते AI मॉडल में केवल कुछ उदाहरणों को देखकर इन सूक्ष्म चालों को सीखने की एक मौलिक सीमा होती है।
निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि हमारे वर्तमान सुरक्षा गार्ड उन हमलों के प्रति अंधे हैं जो असली चीज़ों की तरह दिखते हैं। वे शोर मचाने वाले, स्पष्ट घुसपैठियों को पकड़ने में माहिर हैं, लेकिन वे पूरी तरह विफल हो जाते हैं जब हमलावर भीड़ में पूरी तरह घुल-मिल जाते हैं। यह वास्तविक दुनिया के कामों में उपयोग किए जाने वाले छोटे AI मॉडल के लिए एक बहुत बड़ी समस्या है, क्योंकि उन्हें इन सूक्ष्म चालों को पहचानने के लिए आसानी से "सिखाया" नहीं जा सकता है, और इस मुद्दे पर बहस करने के लिए अधिक रोबोट जोड़ने से वास्तव में समस्या और भी बदतर हो सकती है।
शोधकर्ताओं ने अपने उपकरण जारी कर दिए हैं ताकि अन्य लोग बेहतर गार्ड बनाने की कोशिश कर सकें, लेकिन फिलहाल के लिए, "भेड़ की खाल में भेड़िया" AI सिस्टम को धोखा देने का एक बहुत प्रभावी तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।