BodhiPromptShield: Pre-Inference Prompt Mediation for Suppressing Privacy Propagation in LLM/VLM Agents
बोधिप्रॉम्प्टशील्ड (BodhiPromptShield) एक नीति-जागरूक ढांचा है जो रणनीतिक अमूर्तीकरण (abstraction) और विलंबित बहाली (delayed restoration) के माध्यम से रिट्रीवल, मेमोरी और टूल चरणों में संवेदनशील जानकारी को मध्यस्थ बनाकर LLM/VLM एजेंटों में गोपनीयता प्रसार (privacy propagation) को कम करता है, जिससे यह नियंत्रित मूल्यांकनों में मौजूदा वि-पहचान (de-identification) विधियों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ BodhiPromptShield पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।
बड़ी तस्वीर: "लीकी पाइप" (Leaky Pipe) की समस्या
कल्पना कीजिए कि आपने अपने वित्त (finances) को प्रबंधित करने में मदद करने के लिए एक बहुत ही बुद्धिमान, लेकिन थोड़ी जिज्ञासु सहायक (एक AI एजेंट) को काम पर रखा है। आप उन्हें रसीदों का एक ढेर देते हैं और कहते हैं, "कृपया John Doe के लिए 123 Maple Street पर मेरे Bank Account #999 का उपयोग करके बिल का भुगतान करें।"
पुराने तरीके में, सहायक आपके कच्चे नोट (raw note) को लेगा, उसे पढ़ेगा, और फिर:
- अपनी मेमोरी (याददाश्त) में अपने लिए एक नोट लिखेगा ("John Doe को भुगतान करें...")।
- उन नामों का उपयोग करके कंपनी की नीतियों के लिए एक लाइब्रेरी में खोज करेगा।
- भुगतान करने के लिए एक बैंक टूल को कॉल करेगा।
- उन्होंने जो कुछ भी किया उसका एक लॉगबुक (पंजीका) सहेज लेगा।
समस्या: भले ही सहायक नेक हो, लेकिन उनकी "मेमोरी", "लाइब्रेरी" और "लॉगबुक" को अन्य लोगों (जैसे कि एक हैकर, एक जिज्ञासु इंटर्न, या एक तीसरे पक्ष के सर्वर) द्वारा देखा जा सकता है। यदि आपके कच्चे नोट में "John Doe" लिखा है, तो वह नाम उन सभी जगहों पर कॉपी हो जाता है। यह एक बाल्टी पानी (आपका निजी डेटा) को पाइप सिस्टम में डालने जैसा है; भले ही आप अंत में प्लग लगा दें, पानी पहले ही बीच के पाइपों को भिगो चुका होता है।
समाधान: BodhiPromptShield
लेखकों ने BodhiPromptShield नामक एक सिस्टम बनाया है। इसे एक स्मार्ट सुरक्षा गार्ड के रूप में सोचें जो आपके नोट के आपके सहायक के कार्यालय में प्रवेश करने से पहले दरवाजे पर खड़ा होता है।
कच्चे नोट को अंदर जाने देने के बजाय, गार्ड उसे रोकता है, उसे संपादित (edit) करता है, और केवल एक "संक्रमित/साफ किया हुआ" (sanitized) संस्करण ही आगे जाने देता है।
गार्ड कैसे काम करता है (तीन उपकरण)
गार्ड केवल आपकी निजी जानकारी को हटाता नहीं है (क्योंकि इससे सहायक भ्रमित हो सकता है)। इसके बजाय, स्थिति के आधार पर यह तीन चतुर तरीकों का उपयोग करता है:
"प्लेसहोल्डर" (Placeholder) तकनीक (नाम का टैग):
- परिदृश्य: आपको एक बिल का भुगतान करना है, लेकिन भुगतान के प्रकार को प्रोसेस करने के लिए सहायक को सटीक नाम जानने की आवश्यकता नहीं है।
- कार्रवाई: गार्ड "John Doe" को
<PERSON_1>से बदल देता है। - परिणाम: सहायक जानता है, "ओह, मुझे एक व्यक्ति को भुगतान करना है," और वह अपना काम कर सकता है। लेकिन यदि कोई हैकर लॉग चुरा लेता है, तो उन्हें केवल
<PERSON_1>दिखाई देगा, असली नाम नहीं।
"एब्स्ट्रैक्शन" (Abstraction) तकनीक (सामान्य विवरण):
- परिदृश्य: आप कहते हैं, "मुझे 123 Maple Street, Auckland पर एक पैकेज भेजना है।"
- कार्रवाई: गार्ड इसे बदलकर "मुझे Auckland में एक आवासीय पते (residential address) पर एक पैकेज भेजना है" कर देता है।
- परिणाम: सहायक जानता है कि उसे कहाँ भेजना है (Auckland), बिना विशिष्ट घर का नंबर जाने। यह अर्थ को बनाए रखता है लेकिन रहस्य को हटा देता है।
"सीक्रेट वॉल्ट" (Secret Vault) तकनीक (कुंजीकृत टोकन):
- परिदृश्य: बैंक टूल को काम करने के लिए बिल्कुल सटीक अकाउंट नंबर की आवश्यकता होती है।
- कार्रवाई: गार्ड नंबर को एक रैंडम कोड जैसे
TOKEN_XYZसे बदल देता है। यह असली नंबर को एक लॉक्ड वॉल्ट (सुरक्षित मैपिंग टेबल) में रखता है जो केवल अंतिम सेकंड में खुलता है, ठीक उसी समय जब बैंक टूल को वास्तव में इसकी आवश्यकता होती है। - परिणाम: सहायक की मेमोरी और लॉग केवल कोड देखते हैं। असली नंबर अंतिम चरण तक वॉल्ट से बाहर नहीं निकलता।
यह अलग क्यों है ("प्रोपैगेशन" की अवधारणा)
अधिकांश पुराने गोपनीयता उपकरण इरेज़र (मिटाने वाले) की तरह होते हैं। वे आपके द्वारा भेजने से पहले दस्तावेज़ से संवेदनशील शब्दों को एक बार मिटा देते हैं।
लेकिन आधुनिक AI एजेंटों में, दस्तावेज़ को कई अलग-अलग जगहों पर कॉपी और पेस्ट किया जाता है (मेमोरी, सर्च क्वेरी, लॉग्स)। यदि आप इसे केवल एक बार मिटा देते हैं, तो डेटा का "भूत" (ghost) अभी भी उन अन्य स्थानों में तैर रहा हो सकता है।
BodhiPromptShield एक ऐसे फ़िल्टर की तरह है जो सक्रिय रहता है। यह सुनिश्चित करता है कि भले ही डेटा को सहायक की मेमोरी या सर्च हिस्ट्री में कॉपी किया जाए, वह अपने "सुरक्षित" रूप (जैसे <PERSON_1> या TOKEN_XYZ) में ही रहे, जब तक कि वह उस एक विशिष्ट स्थान तक न पहुँच जाए जहाँ इसे फिर से वास्तविक होने की अनुमति है।
परिणाम: क्या यह काम कर गया?
शोधकर्ताओं ने इसका परीक्षण एक "नियंत्रित प्रॉम्प्ट-प्राइवेसी बेंचमार्क" (यह देखने के लिए डिज़ाइन किया गया परीक्षण कि कितनी निजी जानकारी लीक होती है) पर किया।
- शील्ड के बिना: निजी जानकारी लगभग 10.7% बार सहायक की मेमोरी और टूल्स में लीक हुई।
- शील्ड के साथ: यह लीकेज घटकर 7.1% रह गया।
- ट्रेड-ऑफ (समझौता): सहायक ने 94% समय अपना काम सही ढंग से किया।
उपमा: कल्पना कीजिए कि आप एक ऐसे दोस्त से बात कर रहे हैं जो सब कुछ रिकॉर्ड कर रहा है और आप अपना रहस्य छिपाने की कोशिश कर रहे हैं।
- पुराना तरीका: आप रहस्य फुसफुसाते हैं, लेकिन रिकॉर्डर उसे पकड़ लेता है।
- जेनेरिक डी-आइडेंटिफिकेशन: आप असली नाम के बजाय "SECRET!" चिल्लाते हैं। आपका दोस्त समझ जाता है कि आप कुछ छिपा रहे हैं, लेकिन वह कार्य (जैसे बिल का भुगतान करना) नहीं कर पाता क्योंकि उसे नहीं पता कि क्या भुगतान करना है।
- BodhiPromptShield: आप एक कोड शब्द का उपयोग करते हैं। आपका दोस्त कार्य को पूरी तरह से समझता है, लेकिन रिकॉर्डिंग में केवल कोड सुनाई देता है। यदि बाद में कोई रिकॉर्डिंग चुराता है, तो उन्हें आपके वास्तविक जीवन के बारे में कुछ भी पता नहीं चलता।
कमी (सीमाएँ)
पेपर इस बारे में ईमानदार है कि यह अभी क्या नहीं कर सकता:
- यह जादू नहीं है: यदि AI को संदर्भ (context) के आधार पर आपका रहस्य अनुमान लगाने के लिए कहा जाता है (जैसे, "वह व्यक्ति कौन है जो Maple Street पर रहता है?"), तो यह अभी भी पता लगा सकता है।
- इसे एक अच्छे गार्ड की आवश्यकता है: सिस्टम इस बात पर निर्भर करता है कि "गार्ड" (डिटेक्शन सॉफ्टवेयर) रहस्यों को पहचानने में पर्याप्त स्मार्ट है। यदि रहस्य किसी अजीब फ़ॉन्ट या अलग भाषा में लिखा है, तो गार्ड इसे मिस कर सकता है।
- यह एक प्रोटोटाइप है: यह परीक्षणों में अच्छा काम करता है, लेकिन इसे किसी विशाल, वास्तविक दुनिया की कंपनी प्रणाली में लागू करने के लिए अधिक काम की आवश्यकता है।
सारांश
BodhiPromptShield AI सहायकों के लिए एक नया सुरक्षा स्तर है। यह एक प्राइवेसी फ़िल्टर की तरह काम करता है जो आपके और AI के बीच स्थित होता है। यह आपके संवेदनशील रहस्यों को सुरक्षित कोड या सामान्य विवरणों के साथ बदल देता है इससे पहले कि AI काम करना शुरू करे। यह सुनिश्चित करता है कि भले ही AI नोट्स लिखे, वेब पर खोज करे, या लॉग सहेजे, आपका निजी डेटा छिपा रहे, जबकि AI प्रभावी ढंग से अपना काम भी कर सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।