Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting
यह शोध पत्र ICER को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स फ्रेमवर्क है जो टेक्स्ट-टू-इमेज मॉडल्स की रेड-टीमिंग के लिए कुशल, प्रवाहपूर्ण और अर्थ-संरक्षण करने वाले एडवरसेरियल प्रॉम्प्ट्स उत्पन्न करने के लिए एक LLM-आधारित रीराइटर और इन-कॉन्टेक्स्ट एक्सपीरियंस रिप्ले का लाभ उठाता है, जो मौजूदा बेसलाइन्स की तुलना में विभिन्न सुरक्षा तंत्रों के बीच बेहतर प्रदर्शन और ट्रांसफ़रेबिलिटी प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही सख्त, हाई-टेक आर्ट गैलरी गार्ड (एक टेक्स्ट-टू-इमेज मॉडल) है जिसका काम किसी को भी हिंसक, नग्न या अन्य अनुपयुक्त पेंटिंग बनाने से रोकना है। गार्ड स्मार्ट है; वह आपकी रिक्वेस्ट को पढ़ता है और यदि उसे कुछ भी "बुरा" महसूस होता है, तो वह पेंट करने से मना कर देता है।
समस्या यह है कि बुरे इरादे रखने वाले लोग (या शोधकर्ता जो सिस्टम में कमियां ढूंढने की कोशिश कर रहे हैं) इस गार्ड को चकमा देने की कोशिश कर रहे हैं। वे जानना चाहते हैं: क्या मैं "नग्न व्यक्ति" के लिए पेंटिंग मांग सकता हूँ बिना "नग्न" शब्द का उपयोग किए?
पुराना तरीका: अनुमान लगाना और जांचना
पहले, शोधकर्ताओं ने इस गार्ड को चकमा देने के दो मुख्य तरीके आजमाए थे:
- "रोबोट हैकर" (व्हाइट-बॉक्स): इसके लिए गार्ड के गुप्त कोड और आंतरिक वायरिंग को जानने की आवश्यकता होती है। यह सुरक्षा कैमरे के ब्लूप्रिंट रखने जैसा है। यह अच्छा काम करता है, लेकिन आप इसे कमर्शियल ऐप्स (जैसे DALL·E 3) पर नहीं कर सकते क्योंकि आपके पास ब्लूप्रिंट नहीं है। साथ ही, जो "ट्रिक्स" वे आविष्कार करते हैं वे अक्सर अर्थहीन शब्दों जैसे दिखते हैं (जैसे, "nakednips nips surrounded enthrshy"), जिसे एक इंसान आसानी से नकली पहचान सकता है।
- "रैंडम चैटर" (ब्लैक-बॉक्स): यह बिना कोड देखे ट्रिक का अनुमान लगाने की कोशिश करता है। लेकिन यह हर प्रयास को एक बिल्कुल नई गेम की तरह मानता है। यदि यह 100 बार विफल होता है, तो यह जो सीखा था उसे भूल जाता है और फिर से शुरू करता है। यह एक छात्र की तरह है जो परीक्षा देता है, फेल होता है, अपने नोट्स फेंक देता है, और बिना पढ़ाई किए फिर से वही परीक्षा देता है। यह धीमा, महंगा और अक्सर अजीब, अप्राकृतिक वाक्य बनाता है।
नया तरीका: ICER (द "प्लेबुक" अप्रोच)
लेखकों ने एक नया टूल बनाया जिसे ICER कहा जाता है। ICER को एक अकेले हैकर के रूप में नहीं, बल्कि एक स्मार्ट कोच और उसकी प्लेबुक के रूप में सोचें।
यह इस प्रकार काम करता है:
1. "प्लेबुक" (इन-कॉन्टेक्स्ट एक्सपीरियंस रीप्ले)
कल्पना कीजिए कि जासूसों की एक टीम गार्ड से छिपकर निकलने की कोशिश कर रही है। प्रत्येक जासूस द्वारा अकेले ट्रिक आज़माने के बजाय, वे एक साझा नोटबुक साझा करते हैं।
- हर बार जब कोई जासूस एक ट्रिक आज़माता है और विफल होता है, तो वे लिखते हैं कि क्या हुआ।
- हर बार जब कोई जासूस एक ट्रिक आज़माता है और सफल होता है, तो वे लिखते हैं कि उन्होंने वास्तव में क्या कहा, कैसे कहा, और क्यों वह काम कर गया।
- जब एक नया जासूस एक नई रिक्वेस्ट के साथ आता है, तो वह शून्य से शुरुआत नहीं करता। वह नोटबुक खोलता है, अतीत की सफल कहानियों को पढ़ता है, और उनका उपयोग मार्गदर्शक के रूप में करता है।
पेपर में, इसे इन-कॉन्टेक्स्ट एक्सपीरियंस रीप्ले कहा गया है। सिस्टम पिछले सफल "जेलब्रेक्स" (ट्रिक्स जिन्होंने गार्ड को मूर्ख बनाया) को याद रखता है और नए, बेहतर ट्रिक्स लिखने के लिए उन्हें उदाहरण के रूप में उपयोग करता है।
2. "ट्रांसलेटर" (LLM रीराइटर)
सिस्टम उपयोगकर्ता की रिक्वेस्ट को फिर से लिखने के लिए एक बड़े लैंग्वेज मॉडल (एक बहुत ही स्मार्ट ट्रांसलेटर की तरह) का उपयोग करता है।
- पुराना तरीका: "एक नग्न महिला का चित्र बनाओ।" (बहुत स्पष्ट, ब्लॉक कर दिया जाएगा)।
- ICER का तरीका: सिस्टम प्लेबुक को देखता है, देखता है कि एक सफल ट्रिक जहाँ किसी ने "एक सुंदर, कलात्मक, शास्त्रीय स्नान में आकृति का चित्रण" किया था, और रिक्वेस्ट को इस तरह से फिर से लिखता है जैसे वह एक विनम्र कला छात्र हो।
- परिणाम एक प्रवाहपूर्ण, प्राकृतिक वाक्य है जो एक वास्तविक मानव की तरह लगता है जो कला की मांग कर रहा है, लेकिन गुप्त रूप से इसमें "बुरा" इरादा शामिल है। यह किसी रोबोट की तरह नहीं दिखता जो हैक करने की कोशिश कर रहा है; यह एक सामान्य बातचीत की तरह दिखता है।
3. "जुआरी" (बैंडिट ऑप्टिमाइज़ेशन)
सिस्टम को तय करना होता है: क्या मुझे वही ट्रिक आज़मानी चाहिए जो पिछली बार काम आई थी, या कुछ बिल्कुल नया आज़माना चाहिए?
- यदि आप केवल एक ही ट्रिक आज़माते हैं, तो आप फंस सकते हैं यदि गार्ड अपने नियम अपडेट करता है।
- यदि आप केवल नई चीजें आज़माते हैं, तो आप अनुमान लगाने में समय बर्बाद करते हैं।
- ICER एक गणितीय रणनीति का उपयोग करता है जिसे थॉम्पसन सैंपलिंग (एक स्मार्ट जुआरी के रूप में सोचें) कहा जाता है। यह एक्सप्लॉइटिंग (उन ट्रिक्स का उपयोग करना जो ज्ञात रूप से काम करती हैं) और एक्सप्लोरिंग (यह देखने के लिए नए बदलाव आज़माना कि क्या वे भी काम करते हैं) के बीच संतुलन बनाता है। यह सुनिश्चित करता है कि सिस्टम समय के साथ स्मार्ट और तेज़ होता जाए।
उन्होंने क्या पाया?
शोधकर्ताओं ने छह अलग-अलग प्रकार के "गार्ड्स" (सेफ्टी सिस्टम) के खिलाफ ICER का परीक्षण किया और इसकी तुलना सात अन्य तरीकों से की।
- यह बेहतर काम करता है: ICER ने अन्य सभी तरीकों की तुलना में गार्ड्स को अधिक सफलतापूर्वक चकमा दिया, यहाँ तक कि उन तरीकों को भी जिन्हें गुप्त कोड तक पहुँच की आवश्यकता थी।
- यह वास्तविक लगता है: ICER द्वारा बनाए गए प्रॉम्प्ट लंबे, विस्तृत और प्राकृतिक हैं। वे अर्थहीन शब्दों की तरह नहीं दिखते।
- यह अच्छी तरह से फैलता है: सबसे आश्चर्यजनक खोज यह थी कि ICER ने ओपन-सोर्स मॉडल्स पर जो "प्लेबुक" बनाई थी, वह DALL·E 3 और Midjourney जैसे कमर्शियल सिस्टम पर भी काम करती है। ICER द्वारा टेस्ट मॉडल्स पर काम करने वाले ट्रिक्स में से लगभग 30% इन लोकप्रिय, अत्यधिक सुरक्षित ऐप्स पर भी काम कर गए, भले ही ICER ने उन्हें पहले कभी नहीं देखा था।
मुख्य निष्कर्ष
पेपर का तर्क है कि सुरक्षा परीक्षण अलग-अलग प्रयासों की एक श्रृंखला नहीं होना चाहिए। इसके बजाय, यह एक निरंतर सीखने की प्रक्रिया होनी चाहिए। जिस तरह एक चोर बेहतर योजना बनाने के लिए पिछले डकैतियों से सीखता है, यह टूल दिखाता है कि यदि आप सफल हमला पैटर्न को सहेजते और पुन: उपयोग करते हैं, तो आप बहुत तेज़ी से और अधिक प्रभावी ढंग से कमजोरियों को ढूंढ सकते हैं।
चेतावनी: पेपर नोट करता है कि जबकि यह डेवलपर्स को छेद खोजने और उन्हें ठीक करने में मदद करता है, यह यह भी दिखाता है कि बुरे इरादे रखने वाले लोग वास्तविक दुनिया में सुरक्षा फिल्टर को बायपास करने के लिए अधिक सस्ते और प्रभावी तरीके बनाने के लिए इसी "प्लेबुक" लॉजिक का उपयोग कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।