Sleeper Channels and Provenance Gates: Persistent Prompt Injection in Always-on Autonomous AI Agents
यह शोध पत्र "स्लीपर चैनल्स" (sleeper channels) का परिचय देता है, जो हमेशा सक्रिय रहने वाले स्वायत्त एआई एजेंटों में एक निरंतर प्रॉम्प्ट इंजेक्शन भेद्यता है जहाँ अविश्वसनीय इनपुट बने रहते हैं और बाद में विभिन्न इंटरफेस के माध्यम से निष्पादित होते हैं, और एक स्तरीय रक्षा प्रस्तावित करता है जो "प्रोवेनेंस गेट्स" (provenance gates) पर केंद्रित है जो ऐसे हमलों को रोकने के लिए कैनोनिकल एक्शन-इंस्टेंस डाइजेस्ट और ओनर अटेस्टेशन का उपयोग करते हैं, जिसे एक स्टैटिक ऑडिट टूल और रनटाइम एडॉप्टर द्वारा समर्थित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके लैपटॉप पर एक बहुत ही सहायक, हमेशा सक्रिय रहने वाला व्यक्तिगत सहायक रहता है। यह सहायक आपके ईमेल पढ़ सकता है, आपका कैलेंडर प्रबंधित कर सकता है, कोड लिख सकता है, और यहाँ तक कि आपके लिए नए टूल्स भी इंस्टॉल कर सकता है। यह एक सुपर-स्मार्ट इंटर्न की तरह है जो कभी सोता नहीं है।
"Sleeper Channels and Provenance Gates" नामक शोध पत्र हमें चेतावनी देता है कि इस सहायक को हैक करने का एक विशिष्ट, चालाकी भरा तरीका क्या है। यहाँ इसका सरल शब्दों में विवरण दिया गया है:
1. "Sleeper Channel" हमला: एक विलंबित बम (A Delayed Bomb)
आमतौर पर, जब हम AI को हैक करने के बारे में सोचते हैं, तो हम कल्पना करते हैं कि कोई अभी किसी अजीब कमांड के साथ उसे धोखा दे रहा है। यह शोध पत्र कुछ अलग बताता है: द स्लीपर चैनल (The Sleeper Channel)।
- सेटअप (The Setup): कल्पना कीजिए कि एक सार्वजनिक ग्रुप चैट में एक अजनबी (या कोई रैंडम ईमेल भेजने वाला) आपके सहायक से कहता है कि "बाद के लिए एक टिप सुरक्षित रख लो।" सहायक इसे मददगार समझकर सुरक्षित रख लेता है।
- नींद (The Sleep): वह अजनबी गायब हो जाता है। वह सहायक से दोबारा बात नहीं करता। वह "टिप" बस चुपचाप सहायक की मेमोरी में पड़ी रहती है, जो देखने में हानिरहित लगती है।
- जागना (The Wake-Up): तीन सप्ताह बाद, आप अपने सहायक से पूछते हैं, "हे, क्या तुम वह डेली हेल्थ चेक सेट कर सकते हो जिसके बारे में हमने बात की थी?" सहायक को अजनबी की वह "टिप" याद आती है, उसे लगता है कि यह एक अच्छा विचार है, और वह एक शेड्यूल्ड टास्क (scheduled task) सेट कर देता है।
- विस्फोट (The Explosion): वह टास्क अपने आप चलता है, और आपका निजी डेटा उस अजनबी के गुप्त सर्वर पर भेज देता है।
उपमा (The Analogy): इसे एक समय-विलंबित बिछौने (time-delayed booby trap) की तरह समझें। हमलावर आपके बगीचे में एक बीज बोता है। वह चला जाता है। बाद में, आप मासूमियत से अपने बगीचे को पानी देते हैं, और वह बीज एक ऐसे जाल के रूप में अंकुरित होता है जो आपको नुकसान पहुँचाता है। हमलावर जाल बिछाने के समय वहाँ नहीं होता; वह बस इसे पहले से सेट कर देता है।
2. वर्तमान सुरक्षा उपाय क्यों विफल होते हैं
शोध पत्र बताता है कि वर्तमान सुरक्षा उपाय उस बाउंसर की तरह हैं जो केवल दरवाजे पर आपका आईडी चेक करता है।
- यदि आप किसी अजनबी के साथ अंदर आते हैं, तो बाउंसर उस अजनबी की जाँच करता है।
- लेकिन यदि अजनबी आपके कान में कोई रहस्य फुसफुसा देता है, और आप बाद में अकेले वापस आकर कोई मदद मांगते हैं, तो बाउंसर को यह पता नहीं होता कि आप अपने साथ वह रहस्य लेकर आए हैं।
- AI आपके अनुरोध को देखता है ("हेल्थ चेक सेट करो") और सोचता है, "ओह, यह तो मेरे मालिक का अनुरोध है!" वह यह भूल जाता है कि उस हेल्थ चेक का विचार एक अजनबी से आया था।
शोध पत्र इसे "कन्फ्यूज्ड डिप्टी" (Confused Deputy) समस्या कहता है। AI वह डिप्टी है; वह वही कर रहा है जो आपने कहा है, लेकिन वह इस बात को लेकर भ्रमित है कि वास्तव में वह विचार किसका था।
3. समाधान: "प्रोवेनेंस गेट" (The Provenance Gate)
इसे ठीक करने के लिए, लेखक एक नया सुरक्षा सिस्टम प्रस्तावित करते हैं जिसे प्रोवेनेंस गेट्स (Provenance Gates) कहा जाता है।
उपमा: "रसीद" प्रणाली (The "Receipt" System)
कल्पना कीजिए कि AI द्वारा उपयोग की जाने वाली हर जानकारी के साथ एक डिजिटल रसीद जुड़ी हुई है।
- यदि AI किसी अजनबी से ईमेल पढ़ता है, तो उस ईमेल को एक रसीद मिलती है जिसमें लिखा होता है: "स्रोत: अजनबी (Source: Stranger)।"
- यदि AI उस ईमेल के आधार पर कोई नोट लिखता है, तो वह नोट उस रसीद को विरासत में प्राप्त करता है: "स्रोत: अजनबी (Source: Stranger)।"
- यदि AI बाद में उस नोट के आधार पर कोई शेड्यूल्ड टास्क सेट करने की कोशिश करता है, तो सिस्टम रसीद की जाँच करता है।
गेटकीपर (The "Provenance Gate"):
AI को कुछ भी महत्वपूर्ण करने (जैसे ईमेल भेजना, फ़ाइल बदलना, या शेड्यूल सेट करना) की अनुमति देने से पहले, उसे एक सुरक्षा द्वार से गुजरना होगा।
- रसीदें चेक करें: गेट यह देखता है कि AI द्वारा निर्णय लेने के लिए उपयोग की जाने वाली हर चीज़ की "रसीदें" क्या हैं।
- नियम: यदि विचार का कोई भी हिस्सा किसी अविश्वसनीय स्रोत (जैसे अजनबी) से आया है, तो गेट बंद हो जाता है।
- अपवाद: गेट केवल तभी खुलेगा जब आप (मालिक) स्पष्ट रूप से कहें, "हाँ, मैं इस विशिष्ट कार्य के लिए इसे स्वीकार करता हूँ।" लेकिन आपको यह विशेष कार्य के लिए ताज़ा (fresh) रूप से करना होगा, न कि केवल एक सामान्य विचार के लिए एक बार।
4. उन्होंने वास्तव में क्या किया
लेखकों ने केवल सिद्धांत नहीं लिखा; उन्होंने यह साबित करने के लिए एक प्रोटोटाइप बनाया कि यह काम करता है।
- परीक्षण (The Test): उन्होंने एक वास्तविक, ओपन-सोर्स AI असिस्टेंट (जिसे OpenClaw कहा जाता है) लिया और "स्लीपर चैनल" हमले का अनुकरण (simulate) किया। उन्होंने दिखाया कि उनके नए गेट के बिना, AI खुशी-खुशी डेटा हमलावर को भेज देता है।
- सुधार (The Fix): उन्होंने अपना "प्रोवेनेंस गेट" (जिसे वे D2 कहते हैं) इंस्टॉल किया।
- परिणाम (The Result): जब AI ने हमलावर का जाल सेट करने की कोशिश की, तो गेट ने रसीदों की जाँच की, "अजनबी" (Stranger) टैग देखा, और उस क्रिया को ब्लॉक कर दिया। हमला विफल रहा।
5. मुख्य निष्कर्ष (The Bottom Line)
शोध पत्र का तर्क है कि जैसे-जैसे AI एजेंट अधिक शक्तिशाली और "हमेशा सक्रिय" होते जा रहे हैं, हम केवल इस बात पर भरोसा नहीं कर सकते कि वे याद रखेंगे कि क्या सुरक्षित है। हमें एक ऐसी प्रणाली की आवश्यकता है जो AI के हर विचार के इतिहास (history) को ट्रैक करे।
- पुराना तरीका: "क्या मालिक ने इसके लिए कहा है?" (हाँ -> कर दो)।
- नया तरीका: "क्या मालिक ने इसके लिए कहा है, और क्या मालिक ने उस विचार के पीछे के स्रोत को भी मंजूरी दी है?" (यदि विचार किसी अजनबी से आया है -> रुक जाओ)।
लेखक इसे एक "टियर्ड डिफेंस" (tiered defense) कहते हैं, जिसका अर्थ है कि उनके पास एक बुनियादी संस्करण और एक मजबूत संस्करण है, लेकिन मूल विचार सरल है: AI को अजनबियों से मिले विचारों पर तब तक कार्य न करने दें जब तक कि आपसे एक ताज़ा और स्पष्ट "ओके" न मिल जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।