Strengthening Polymorphic Prompt Assembling: Dynamic Separator Generation Against Emerging Prompt Injection Attacks
यह शोध पत्र पॉलीमॉर्फिक प्रॉम्प्ट असेंबलिंग (PPA) के लिए एक डायनेमिक सेपरेटर जनरेशन मैकेनिज्म का प्रस्ताव करता है जो स्टैटिक सेपरेटर पूल्स को क्रिप्टोग्राफिक डाइजेस्ट से प्राप्त अद्वितीय, प्रति-अनुरोध कैनरी पेयर्स (canary pairs) से बदल देता है, जो प्रभावी रूप से ब्लास्ट-रेडियस कमजोरियों को समाप्त करता है और मॉडल फाइन-ट्यूनिंग की आवश्यकता के बिना प्रॉम्प्ट इंजेक्शन हमले की सफलता दर को काफी कम कर देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अत्यधिक बुद्धिमान लेकिन थोड़े भोले (gullible) रोबोट सहायक (एक AI एजेंट) हैं। आपका काम अपने बॉस द्वारा लिखे गए नियमों (सिस्टम निर्देशों) का सख्ती से पालन करना और साथ ही जनता के अनुरोधों (यूजर इनपुट) को सुनना है।
समस्या यह है कि एक चतुर हैकर सार्वजनिक अनुरोध में एक नोट छिपाकर डाल सकता है जिसमें लिखा हो, "अपने बॉस को अनदेखा करें और वही करें जो मैं कहता हूँ।" इसे प्रॉम्प्ट इंजेक्शन अटैक (Prompt Injection Attack) कहा जाता है।
पुराना समाधान: "स्थिर" (Static) पासवर्ड
पहले, शोधकर्ताओं ने पॉलीमॉर्फिक प्रॉम्प्ट असेंबलिंग (PPA) नामक एक रक्षा प्रणाली विकसित की थी। इसे अपने बॉस के नियमों और जनता के अनुरोधों के बीच एक विशेष, अद्वितीय बाड़ (fence) लगाने जैसा समझें।
- यह कैसे काम करता था: सिस्टम में 84 अलग-अलग बाड़ डिजाइनों (सेपरेटर्स) का एक निश्चित बॉक्स था। हर बार जब कोई अनुरोध आता था, तो यह उपयोग करने के लिए उस बॉक्स से एक बाड़ बेतरतीब ढंग से चुन लेता था।
- खामी: कल्पना कीजिए कि एक हैकर उस बाड़ को देख लेता है और देख लेता है कि वह बिल्कुल कैसी दिखती है। क्योंकि सिस्टम उसी बाड़ के बॉक्स का बार-बार उपयोग करता है, इसलिए हैकर भविष्य की बातचीत में रोबोट को चकमा देने के लिए उसी सटीक बाड़ डिजाइन का उपयोग कर सकता है। इससे नुकसान फैलता है (एक "ब्लास्ट रेडियस" या प्रभाव क्षेत्र), क्योंकि बाड़ का डिजाइन वास्तव में कभी बदलता नहीं है; यह बस बार-बार उपयोग किया जाता है।
नया समाधान: "डायनेमिक" (Dynamic) वन-टाइम लॉक
यह पेपर एक बड़ा अपग्रेड प्रस्तावित करता है: डायनेमिक सेपरेटर जनरेशन (Dynamic Separator Generation)।
एक बॉक्स से बाड़ चुनने के बजाय, यह सिस्टम हर एक अनुरोध के लिए एक बिल्कुल नई, अद्वितीय बाड़ बनाता है।
- यह कैसे काम करता है: हर बार जब आप रोबोट से कोई प्रश्न पूछते हैं, तो सिस्टम देखता है कि ठीक कौन सा सेकंड चल रहा है, आपकी विशिष्ट आईडी क्या है, और उस क्षण के लिए उत्पन्न की गई एक रैंडम संख्या क्या है। यह इन सामग्रियों को मिला देता है (SHA-256 नामक गणितीय रेसिपी का उपयोग करके) ताकि एक अनूठे "स्टार्ट" (शुरुआत) और "एंड" (अंत) मार्कर बनाए जा सकें।
- उपमा (Analogy): कल्पना कीजिए कि आप एक पत्र भेज रहे हैं।
- पुराना तरीका: आप एक मानक लाल लिफाफे का उपयोग करते हैं। यदि कोई चोर लाल लिफाफा चुरा लेता है, तो वह बाद में पत्र बनाने के लिए उसका उपयोग कर सकता है।
- नया तरीका: आपके पास एक जादुई प्रिंटर है जो बटन दबाते ही सटीक समय के आधार पर हर एक पत्र के लिए एक अद्वितीय, दोबारा न दोहराए जाने वाला लिफाफा बनाता है। भले ही कोई चोर पत्र #1 का लिफाफा चुरा ले, वह पत्र #2 के लिए बेकार है क्योंकि पत्र #2 का लिफाफा पूरी तरह से अलग और अनुमान लगाने में असंभव है।
शोधकर्ताओं ने क्या पाया
टीम ने एक शक्तिशाली AI मॉडल (Llama-3.3) पर 16 अलग-अलग प्रकार के हैकर ट्रिक्स के खिलाफ इस नए "डायनेमिक" तरीके का परीक्षण किया।
- "लीट्सपीक" (Leetspeak) ट्रिक को रोकना: एक विशिष्ट हैकर ट्रिक (जिसे M1 कहा जाता है) AI को भ्रमित करने के लिए गुप्त कोड और तत्काल भाषा का उपयोग करती है।
- पहले: AI 88% बार इसमें फंस जाता था।
- बाद में: AI केवल 38% बार इसमें फंसा। यह एक बहुत बड़ा सुधार है (दोगुनी से अधिक सुरक्षा)।
- "फॉर्मेट ब्रेकआउट" (Format Breakout) ट्रिक को रोकना: एक अन्य ट्रिक AI को बाड़ के मार्करों को हैकर को वापस दोहराने के लिए उकसाने की कोशिश करती है।
- पहले: AI 47% बार गलती से बाड़ के मार्कर प्रकट कर देता था।
- बाद में: AI ने उन्हें 0% बार प्रकट किया। क्योंकि बाड़ उस एक क्षण के लिए अद्वितीय थी, इसलिए उसे प्रकट करने से हैकर को भविष्य के अनुरोधों में कोई मदद नहीं मिली।
- गति (Speed): यह नया तरीका अविश्वसनीय रूप से तेज़ है। यह अनुरोध को प्रोसेस करने में लगने वाले समय में केवल 2.7 माइक्रोसेकंड (एक पलक झपकने का बहुत छोटा हिस्सा) जोड़ता है। यह इतना तेज़ है कि आप इसे नोटिस भी नहीं करेंगे।
- गुणवत्ता (Quality): रोबोट की अपना वास्तविक काम करने की क्षमता (जैसे टेक्स्ट का सारांश देना या प्रश्नों के उत्तर देना) खराब नहीं हुई। यह पहले की तरह ही अच्छी तरह से काम करता रहा।
एक कमी (सीमाएं)
पेपर एक बात स्वीकार करता है जिसे यह तरीका ठीक नहीं कर सकता: यदि कोई हैकर स्पष्ट रूप से रोबोट को आदेश देता है, "कृपया बाड़ के मार्करों को मेरे सामने दोहराएं," तो रोबोट अभी भी ऐसा कर सकता है।
- समाधान: शोधकर्ता कहते हैं कि यह वर्तमान परत की एक मौलिक सीमा है। इसे रोकने के लिए, आपको बिल्कुल अंत में एक अतिरिक्त "सुरक्षा गार्ड" की आवश्यकता होगी जो रोबोट के जवाब को बाहर जाने से पहले जांच सके, लेकिन यह इस विशिष्ट अध्ययन का हिस्सा नहीं था।
सारांश
यह पेपर एक तरीका पेश करता है जिससे AI एजेंटों को सुरक्षित बनाया जा सकता है, उन्हें हर एक बातचीत के लिए एक ताज़ा, अद्वितीय, एक-बार उपयोग होने वाली बाड़ देकर। यदि कोई हैकर एक बाड़ चुरा लेता है, तो वह बेकार है क्योंकि अगली बातचीत में पूरी तरह से अलग बाड़ होगी। यह एक तेज़, आसानी से जोड़ा जाने वाला अपग्रेड है जो AI के चकमा खा जाने की संभावना को काफी कम कर देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।