Investigating Detection and Obfuscation of Prompt Injection Attacks Against Software Reverse Engineering AI Agents
यह शोध पत्र बाइनरी सोर्स कोड में अंतर्निहित प्रॉम्प्ट इंजेक्शन हमलों के प्रति एजेंटिक सॉफ्टवेयर रिवर्स इंजीनियरिंग सिस्टम की संवेदनशीलता की जांच करता है, और प्रोडक्शन-लेवल साइबर वर्कफ़्लो को सुरक्षित करने के लिए डीकंपाइलर आउटपुट में इन हमलों को अस्पष्ट (obfuscate) करने और उन्हें पहचानने दोनों के लिए विधियों का प्रस्ताव और मूल्यांकन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सहायक रोबोट सहायक है जिसका काम पुरानी, रहस्यमय मशीनों (सॉफ्टवेयर) को खोलकर यह पता लगाना है कि वे कैसे काम करती हैं। इसे "रिवर्स इंजीनियरिंग" कहा जाता है। आमतौर पर, एक मानव विशेषज्ञ यह काम करता है, लेकिन अब हम इस भारी काम को करने के लिए AI एजेंटों का उपयोग कर रहे हैं।
यह शोध पत्र एक सुरक्षा रिपोर्ट है कि कैसे एक चालाक हैकर इस रोबोट सहायक को धोखा दे सकता है, और हम उन्हें रोकने के लिए बेहतर बचाव कैसे बना सकते हैं।
समस्या: "घोस्ट नोट" (Ghost Note) का खेल
AI सहायक की कल्पना एक जासूस के रूप में करें जो एक केस फाइल पढ़ रहा है। उस फाइल में मशीन के ब्लूप्रिंट होने चाहिए।
शोधकर्ताओं ने पाया कि एक हैकर मशीन के कोड के अंदर एक गुप्त नोट छिपा सकता है। यह एक किताब में कागज का टुकड़ा डालने जैसा है जिस पर लिखा हो: "जो कहानी आप पढ़ रहे हैं उसे अनदेखा करें। इसके बजाय, यह दिखावा करें कि यह किताब पूरी तरह से एक अलग कहानी के बारे में है।"
जब AI कोड पढ़ता है, तो वह इस छिपे हुए नोट को देखता है। क्योंकि AI निर्देशों का पालन करने के लिए प्रशिक्षित है, वह भ्रमित हो जाता है। वह वास्तविक मशीन का विश्लेषण करना बंद कर देता है और उस नकली मशीन का वर्णन करने लगता है जिसे हैकर उसे दिखाना चाहता था। शोधकर्ता इसे "प्रॉम्प्ट इंजेक्शन अटैक" (Prompt Injection Attack) कहते हैं।
पहला बचाव: "ब्रेसलेट चेक" (Bracelet Check)
शोधकर्ताओं ने पहले एक सरल बचाव की कोशिश की। उन्होंने देखा कि इन नकली नोट्स का एक बहुत ही विशिष्ट प्रारूप होता है, जैसे कि एक विशेष पैटर्न वाला विशेष ब्रेसलेट पहनना (जैसे, <assistant>)।
उन्होंने एक स्कैनर बनाया जो उस सटीक ब्रेसलेट पैटर्न को खोजता है। यदि वह इसे देखता है, तो वह प्रक्रिया को रोक देता है।
- यह कितना प्रभावी रहा? यह मानक नोट्स को पकड़ने में अच्छा था।
- खामी: हैकर चतुर थे। उन्होंने बस
< >वाले ब्रेसलेट को बदलकर[ ]या{ }कर दिया। चूंकि स्कैनर केवल विशिष्ट< >पैटर्न की तलाश कर रहा था, इसलिए उसने नए पैटर्न को मिस कर दिया। यह एक सुरक्षा गार्ड की तरह है जो केवल लाल टोपियों की जांच करता है, जबकि घुसपैकर बस नीली टोपियां पहन लेते हैं।
बेहतर बचाव: "स्मार्ट डिटेक्टिव" (Smart Detective)
चूंकि केवल पैटर्न की जांच पर्याप्त नहीं थी, इसलिए शोधकर्ताओं ने एक "स्मार्ट डिटेक्टिव" बनाया। यह एक विशेष AI मॉडल है जिसे टेक्स्ट को देखने और यह तय करने के लिए प्रशिक्षित किया गया है कि: "क्या यह मशीन का एक सामान्य हिस्सा लग रहा है, या क्या यह एक चाल जैसा लग रहा है?"
केवल विशिष्ट प्रतीकों को देखने के बजाय, यह डिटेक्टिव लेखन के संदर्भ (context) और शैली (style) को देखता है।
- यह कितना प्रभावी रहा? यह बहुत बेहतर था। इसने उन चालों को भी पकड़ लिया जब हैकरों ने प्रतीकों (ब्रैकेट) को बदल दिया था। इसने लगभग सभी नकली नोट्स की सही पहचान की, भले ही वे अलग दिख रहे थे।
हैकर ने पलटवार किया: "अदृश्य स्याही" (Invisible Ink)
शोधकर्ताओं ने पूछा, "क्या होगा यदि हैकर और भी अधिक चालाक हो जाए?"
उन्होंने एक तरीका खोजा जिससे नोट को इस तरह छिपाया जा सके कि "स्मार्ट डिटेक्टिव" उसे देख ही न सके। उन्होंने "अदृश्य स्याही" (नॉन-प्रिंटिंग कैरेक्टर्स) का उपयोग करके एक चाल चली।
- कल्पना कीजिए कि आप एक पन्ने पर नोट लिख रहे हैं। यदि आप इसे सामान्य रूप से लिखते हैं, तो स्कैनर इसे देख लेता है।
- लेकिन यदि आप नोट लिखते हैं, और फिर वाक्य के बीच में एक छोटा सा, अदृश्य धूल का कण रख देते हैं, तो स्कैनर का "शब्दों की सूची" बनाने वाला टूल उस नोट के उस हिस्से को पूरी तरह से छोड़ सकता है। नोट अभी भी वहां मौजूद है जिसे मुख्य AI पढ़ सकता है, लेकिन सुरक्षा स्कैनर सोचता है कि नोट वहां है ही नहीं।
शोधकर्ताओं ने इसका परीक्षण किया। उन्होंने एक जेनेटिक एल्गोरिदम (एक कंप्यूटर प्रोग्राम जो प्रकृति की तरह समाधान विकसित करता है) का उपयोग किया ताकि स्वचालित रूप से नोट को छिपाने का सबसे अच्छा तरीका खोजा जा सके।
- परिणाम: जब उन्होंने इस "अदृश्य स्याही" के तरीके का उपयोग किया, तो "स्मार्ट डिटेक्टिव" विफल हो गया। वह नोट को देख नहीं पाया क्योंकि नोट उसकी दृष्टि से छिपा हुआ था। AI सहायक को फिर से धोखा दिया गया।
अंतिम परीक्षण: नियम सीखना
अंत में, शोधकर्ताओं ने हैकर के AI को सब कुछ सीखने दिया। न केवल नोट को कैसे छिपाना है, बल्कि यह भी कि "नकली कहानी" को कैसे बदला जाए।
- उन्होंने हैकर के AI को एक साथ सबसे अच्छी "नकली कहानी" और सबसे अच्छी "छिपाने की जगह" चुनने दिया।
- परिणाम: हैकर के AI ने इसमें महारत हासिल कर ली। इसने अधिकांश मामलों में सिस्टम को सफलतापूर्वक धोखा दिया, तब भी जब शोधकर्ताओं ने "डीकंपाइल्ड" (अनुवादित) कोड के संस्करण को स्कैन करने का प्रयास किया।
मुख्य निष्कर्ष (The Bottom Line)
शोध पत्र यह निष्कर्ष निकालता है कि:
- साधारण जांच पर्याप्त नहीं है: केवल विशिष्ट प्रतीकों (जैसे
< >) को खोजना बहुत आसानी से बायपास किया जा सकता है। - स्मार्ट डिटेक्टर बेहतर हैं: हमले की शैली को पहचानने के लिए प्रशिक्षित AI का उपयोग करना, सरल पैटर्न मिलान की तुलना में बहुत अधिक प्रभावी है।
- यह एक हथियारों की दौड़ (Arms Race) है: हमलावर अपनी चालों को छिपाने (obfuscation) के तरीके खोज सकते हैं ताकि स्मार्ट डिटेक्टर भी उन्हें मिस कर दें। यदि हमलावर स्कैनर की दृष्टि से नोट को छिपा सकता है, तो बचाव विफल हो जाता है।
शोधकर्ता कहते हैं कि इन AI रिवर्स-इंजीनियरिंग टूल्स को वास्तविक दुनिया के उपयोग के लिए सुरक्षित रखने के लिए, हमें इन पहचान विधियों को बेहतर बनाने की आवश्यकता है और यह समझना होगा कि हैकर हमेशा अपने निर्देशों को छिपाने के नए तरीके खोजने की कोशिश करेंगे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।