Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats
यह शोध पत्र एक एकीकृत, सत्यापन-केंद्रित रक्षा ढांचे का प्रस्ताव करता है जो प्रतिकूल हमलों का प्रभावी ढंग से पता लगाने और उन्हें कम करने के लिए उपयोगकर्ता प्रॉम्प्ट के इरादे और मॉडल प्रतिक्रिया की हानि का संयुक्त रूप से मूल्यांकन करता है, जो कई खतरे की श्रेणियों में मौजूदा एकल-पक्षीय रक्षा प्रणालियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सहायक रोबोट असिस्टेंट (एक LLM) है जिसका उपयोग आप ईमेल लिखने, कोड लिखने या प्रश्न पूछने के लिए करते हैं। आप चाहते हैं कि यह रोबोट सुरक्षित रहे, इसलिए आप दरवाजे पर एक सुरक्षा गार्ड रखते हैं जो लोगों द्वारा पूछे गए प्रश्नों और उनके जवाबों की जांच करता है।
समस्या: "स्प्लिट पर्सनैलिटी" (दोहरा व्यक्तित्व) हमला
यह शोध पत्र तर्क देता है कि वर्तमान सुरक्षा गार्ड बातचीत को एकतरफा दर्पण (one-way mirror) के माध्यम से देखते हैं। वे या तो प्रश्न (प्रॉम्प्ट) की जांच करते हैं या उत्तर (रिस्पॉन्स) की, लेकिन शायद ही कभी दोनों को एक साथ देखते हैं।
यही वह खामी है जिसका फायदा बुरे तत्व उठाते हैं, जिसे लेखक "इंटेंट-हार्म सेपरेशन" (इरादा-हानि अलगाव) कहते हैं।
इसे एक जासूस के उदाहरण से समझें जो एक सुरक्षित इमारत में बम चुराने की कोशिश कर रहा है:
- पुराना तरीका (केवल प्रॉम्प्ट गार्ड): जासूस गार्ड के पास आता है और कहता है, "मैं बम बनाने के तरीके पर एक सुरक्षा प्रशिक्षण सेमिनार के लिए आया हूँ।" गार्ड अनुरोध को देखता है, देखता है कि इसे "शिक्षा" के रूप में पेश किया गया है, और उसे अंदर जाने देता है। गार्ड ने बम नहीं देखा क्योंकि बम अभी तक बनाया ही नहीं गया है।
- पुराना तरीका (केवल रिस्पॉन्स गार्ड): जासूस अंदर चला जाता है, और रोबोट बम बनाता है और उसे सौंप देता है। बाहर निकलने वाले गार्ड को बम दिखता है और वह उसे रोक देता है। लेकिन तब तक बहुत देर हो चुकी होती; रोबोट पहले ही बम बना चुका होता है।
- असली खतरा: कभी-कभी अनुरोध निर्दोष लगता है ("एक खलनायक के बारे में कहानी लिखें"), लेकिन रोबोट का उत्तर वास्तव में अपराध करने के लिए एक चरण-दर-चरण मार्गदर्शिका हो सकता है। या, अनुरोध खतरनाक लग सकता है, लेकिन रोबोट का उत्तर वास्तव में इस बात की एक हानिरहित व्याख्या हो सकती है कि वह क्यों खतरनाक है।
वर्तमान सुरक्षा प्रणालियाँ अक्सर इन्हें मिस कर देती हैं क्योंकि वे केवल बातचीत के एक पक्ष को देखती हैं।
समाधान: "तीन लोगों की जूरी"
लेखक एक नया सुरक्षा सिस्टम प्रस्तावित करते हैं जिसे प्रॉम्प्ट-रिस्पॉन्स वेरिफिकेशन कहा जाता है। एक अकेले गार्ड के बजाय, वे तीन विशेषज्ञ "विश्लेषकों" की एक टीम का उपयोग करते हैं जो एक जूरी की तरह निर्णय लेते हैं कि बातचीत सुरक्षित है या नहीं, इससे पहले कि रोबोट का उत्तर उपयोगकर्ता को दिखाया जाए।
यहाँ उनका "तीन लोगों की जूरी" कैसे काम करता है:
टास्क एनालिस्ट (द "इंटेंट डिटेक्टिव" - इरादा खोजने वाला जासूस):
- काम: उपयोगकर्ता के प्रश्न को देखना।
- प्रश्न: "क्या यह व्यक्ति रोबोट को धोखा देने की कोशिश कर रहा है? क्या वे कुछ बुरा मांग रहे हैं, या वे केवल स्कूल प्रोजेक्ट के लिए मदद मांग रहे हैं?"
- उपमा: एक जासूस की तरह जो किसी व्यक्ति की आईडी और कहानी की जांच करता है ताकि यह देख सके कि क्या उसका कोई छिपा हुआ एजेंडा है।
सेफ्टी एनालिस्ट (द "हार्म इंस्पेक्टर" - हानि निरीक्षक):
- काम: रोबोट के उत्तर को देखना।
- प्रश्न: "क्या इस उत्तर में बम, फिशिंग ईमेल या वायरस है? क्या यह वास्तव में खतरनाक है?"
- उपमा: एक बम निरोधक विशेषज्ञ की तरह जो उस पैकेज का निरीक्षण करता है जिसे रोबोट पकड़े हुए है।
जज (द "मीडिएटर" - मध्यस्थ):
- काम: डिटेक्टिव और इंस्पेक्टर दोनों की बातें सुनना।
- प्रश्न: "डिटेक्टिव कहता है कि कहानी संदिग्ध थी, लेकिन इंस्पेक्टर कहता है कि पैकेज खाली है। या, डिटेक्टिव कहता है कि यह एक स्कूल प्रोजेक्ट है, लेकिन इंस्पेक्टर कहता है कि पैकेज विस्फोटकों से भरा है। हम क्या करें?"
- उपमा: जज दोनों पक्षों के सबूतों को तौलता है। यदि पैकेज विस्फोटकों से भरा है, तो जज उसे ब्लॉक कर देगा, भले ही व्यक्ति की कहानी मासूम लग रही हो। यदि कहानी संदिग्ध थी लेकिन पैकेज खाली है, तो जज उसे जाने दे सकता है।
वे कैसे बात करते हैं (दो-चरणों का संवाद)
ये तीनों केवल अपनी राय चिल्लाते नहीं हैं; उनके बीच एक संरचित बातचीत होती है:
- राउंड 1: डिटेक्टिव और इंस्पेक्टर स्वतंत्र रूप से अपनी रिपोर्ट लिखते हैं।
- राउंड 2: वे एक-दूसरे की रिपोर्ट पढ़ते हैं। यदि इंस्पेक्टर कहता है, "रुको, यह बम जैसा लग रहा है," तो डिटेक्टिव को एहसास हो सकता है, "ओह, मुझे लगा कि यह सिर्फ एक कहानी है, लेकिन शायद वे कहानी में बम को छिपाने की कोशिश कर रहे हैं।" वे अपनी राय में संशोधन करते हैं।
- अंतिम निर्णय: जज अंतिम फैसला लेता है कि उत्तर को अनुमति दें (उत्तर दिखाएं) या ब्लॉक करें (उत्तर रोक दें)।
उन्होंने क्या पाया
शोधकर्ताओं ने पांच प्रकार के बुरे व्यवहार के खिलाफ इस प्रणाली का परीक्षण किया:
- जेलब्रेक्स: रोबोट को अपने नियमों को अनदेखा करने के लिए trick करना।
- प्रॉम्प्ट इंजेक्शन: गुप्त कमांड को चुपके से डालने की कोशिश करना।
- फिशिंग: पासवर्ड चुराने के लिए नकली ईमेल या वेबसाइट बनाना।
- मैलिसियस कोड (दुर्भावनापूर्ण कोड): रोबोट से कंप्यूटर वायरस लिखने के लिए कहना।
- हानिकारक सामग्री: नफरत भरे भाषण, उत्पीड़न या खतरनाक निर्देश।
परिणाम:
- बेहतर पकड़ दर: नए "तीन लोगों की जूरी" ने पुराने "एक-गार्ड" सिस्टम की तुलना में काफी अधिक बुरे तत्वों को पकड़ा। उन्होंने अपनी सफलता दर लगभग 90% से बढ़ाकर 95% कर दी।
- कम गलतियाँ: पुराने सिस्टम अक्सर निर्दोष चीजों को भी ब्लॉक कर देते थे (जैसे कि छात्रों को फिशिंग का उदाहरण दिखाने के लिए एक शिक्षक द्वारा पूछा गया प्रश्न)। नया सिस्टम "बुरे अनुरोध" और "सुरक्षित अनुरोध" के बीच अंतर करने में बहुत बेहतर था, जिससे गलत अलार्म (false alarms) में आधा कमी आई।
- हराना कठिन: यहाँ तक कि जब बुरे तत्वों को पता चल गया कि सुरक्षा प्रणाली में तीन लोग हैं और उन्होंने विशेष रूप से उन्हें धोखा देने की कोशिश की, तब भी "तीन लोगों की जूरी" पुराने सिस्टम की तुलना में चकमा देना बहुत कठिन था।
ट्रेड-ऑफ (समझौता/संतुलन)
पेपर स्वीकार करता है कि इस सिस्टम में थोड़ा अधिक समय और कंप्यूटर पावर (जैसे एक गार्ड की त्वरित सहमति के बजाय जूरी की विचार-विमर्श) लगता है। हालांकि, उच्च-जोखिम वाली स्थितियों में जहाँ सुरक्षा महत्वपूर्ण है, खतरनाक सामग्री को रोकने के लिए अतिरिक्त समय लेना सार्थक है।
सारांश में
यह पेपर कहता है: "केवल प्रश्न या केवल उत्तर की जांच न करें। इरादे और हानि दोनों को समझने के लिए पूरी बातचीत की एक टीम के साथ मिलकर जांच करें, ताकि हम गलत चीजों को दरारों से फिसलने न दें।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।