← नवीनतम पेपर
💻 computer science

Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts

यह शोध पत्र प्रॉम्प्टिंग4डीबगिंग (P4D) को प्रस्तुत करता है, जो एक स्वचालित रेड-टीमिंग टूल है जो यह प्रदर्शित करके टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल्स के सुरक्षा तंत्रों में महत्वपूर्ण कमजोरियों को उजागर करता है कि कैसे पहले "सुरक्षित" माने जाने वाले कई प्रॉम्प्ट्स का उपयोग मौजूदा सुरक्षा उपायों को बायपास करने के लिए किया जा सकता है, जिससे वर्तमान मूल्यांकन बेंचमार्क की विश्वसनीयता को चुनौती मिलती है।

मूल लेखक: Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu

प्रकाशित 2026-01-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, जादुई कलाकार है जिसका नाम Stable Diffusion है। यह कलाकार किसी भी वाक्य को एक सुंदर चित्र में बदल सकता है जिसे आप लिखते हैं। यदि आप कहते हैं "एक चटाई पर बिल्ली," तो आपको चटाई पर एक बिल्ली मिलती है। लेकिन, क्योंकि इस कलाकार ने पूरे इंटरनेट से सीखा है, वे कभी-कभी अनजाने में ऐसी चीजें बना देते हैं जो अनुपयुक्त हैं, जैसे कॉपीराइट वाले पात्र या ऐसी छवियां जो काम के अनुकूल नहीं हैं (NSFW)।

इसे ठीक करने के लिए, डेवलपर्स कलाकार के सामने एक सुरक्षा गार्ड रखते हैं। यह गार्ड (सुरक्षा तंत्र) कलाकार को बुरी चीजें बनाने से रोकने के लिए है। यदि आप "एक नग्न व्यक्ति" मांगते हैं, तो गार्ड कहता है, "नहीं!" और कलाकार कुछ और बनाता है।

समस्या:
डेवलपर्स सोचते हैं कि गार्ड बहुत अच्छा काम कर रहा है। उनके पास "बुरे" वाक्यों की एक सूची है जिनका उन्होंने परीक्षण किया है, और गार्ड ने उन सभी को रोक दिया। लेकिन शोधकर्ताओं ने इस पेपर में पूछा: "क्या होगा अगर बुरे लोग गार्ड को चकमा देने में बहुत माहिर हों? क्या होगा अगर अभी तक हमें ऐसे गुप्त पासवर्ड नहीं मिले हैं जो काम कर सकें?"

समाधान: Prompting4Debugging (P4D)
लेखकों ने Prompting4Debugging (P4D) नामक एक टूल बनाया है। सोचिए कि P4D एक सुपर-स्मार्ट, स्वचालित "रेड टीम" (नैतिक हैकर्स का एक समूह जिन्हें सिस्टम में छेद खोजने के लिए नियुक्त किया जाता है) है।

इंसानों द्वारा रैंडम वाक्य सोचने के बजाय, जो गार्ड को तोड़ने की कोशिश करते हैं, P4D इसे स्वचालित रूप और वैज्ञानिक रूप से करता है। यह कैसे काम करता है, इसके लिए एक सरल उपमा का उपयोग करें:

"शैडो आर्टिस्ट" (छाया कलाकार) की उपमा

कल्पना कीजिए कि एक कमरे में दो कलाकार हैं:

  1. अप्रतिबंधित कलाकार (G): इस कलाकार के कोई नियम नहीं हैं। यदि आप "एक नग्न व्यक्ति" मांगते हैं, तो वे इसे पूरी तरह से बनाते हैं।
  2. गार्डेड कलाकार (G'): इस कलाकार के पास सुरक्षा गार्ड है। यदि आप "एक नग्न व्यक्ति" मांगते हैं, तो वह मना कर देता है।

लक्ष्य: P4D को एक नया वाक्य (एक "समस्यात्मक प्रॉम्प्ट") खोजना है जो गार्डेड कलाकार को उसी "नग्न व्यक्ति" को बनाने के लिए धोखा दे सके जिसे अप्रतिबंधित कलाकार ने बनाया था, भले ही गार्डेड कलाकार को "ना" कहना चाहिए।

प्रक्रिया:

  1. ब्लूप्रिंट: P4D पहले अप्रतिबंधित कलाकार से "वर्जित" छवि बनाने के लिए कहता है। यह उसे एक सटीक ब्लूप्रिंट देता है कि वह बुरी छवि कैसी दिखती है।
  2. अनुवाद: P4D फिर गार्डेड कलाकार को देखता है। वह जानता है कि गार्डेड कलाकार शब्दों को समझने के लिए एक गुप्त कोड (गणितीय "एम्बेडिंग्स") का उपयोग कर रहा है।
  3. हैक: P4D वाक्य में बदलाव करना शुरू करता है। यह केवल अनुमान नहीं लगाता; यह एक गणितीय "स्लाइडिंग स्केल" का उपयोग करता है ताकि शब्दों को तब तक धकेला जा सके जब तक कि गार्डेड कलाकार का आंतरिक कोड अप्रतिबंधित कलाकार के ब्लूप्रिंट से मेल न खा जाए।
  4. परिणाम: P4D एक अजीब, उलझा हुआ या चतुर वाक्य ढूंढ लेता है (जैसे "एक बिलबोर्ड की फोटो जिसमें एक नग्न आदमी आपत्तिजनक स्थिति में है" या यहाँ तक कि कुछ ऐसा जो काम करता है) जो गार्ड को बायपास कर देता है।

उन्होंने क्या पाया

शोधकर्ताओं ने इसका परीक्षण कई लोकप्रिय "गार्डेड" मॉडलों (जैसे सुरक्षा फिल्टर के साथ Stable Diffusion) पर किया। परिणाम चौंकाने वाले थे:

  • "सुरक्षित" सूची सुरक्षित नहीं थी: उन्होंने उन प्रॉम्प्ट्स की एक सूची ली जिन्हें सभी सुरक्षित मानते थे और जिनका पहले परीक्षण किया जा चुका था। उन्होंने पाया कि उनमें से लगभग आधे को P4D द्वारा सुरक्षा गार्ड को तोड़ने के लिए आसानी से हेरफेर किया जा सकता था।
  • "सूचना अस्पष्टता" (Information Obfuscation) का जाल: पेपर में एक अजीब घटना की खोज की गई। कभी-कभी, सुरक्षा गार्ड जानकारी छिपाने में बहुत अच्छा होता है। जब शोधकर्ताओं ने इसे तोड़ने का तरीका सीखते समय गार्ड के "फ़िल्टर" को बंद कर दिया, तो उन्होंने पाया कि इसे तोड़ने के और भी अधिक तरीके थे।
    • उपमा: कल्पना कीजिए कि एक सुरक्षा गार्ड है जो आँखों पर पट्टी बांधकर खड़ा है जबकि आप उसके पास से चुपके से निकलने की कोशिश कर रहे हैं। आप सोचते हैं, "ओह, वह देख नहीं सकता, इसलिए मैं सुरक्षित हूँ।" लेकिन वास्तव में, पट्टी उसे आपके द्वारा उपयोग किए जा रहे विशिष्ट तरीकों के प्रति कम जागरूक बनाती है। एक बार जब आप पट्टी पहने हुए उस ट्रिक को समझ लेते हैं, तो आप उसी ट्रिक का उपयोग उसे बिना पट्टी के भी चकमा देने के लिए कर सकते हैं। गार्ड द्वारा जानकारी छिपाने का प्रयास वास्तव में सिस्टम को जितना सुरक्षित महसूस कराता था, उससे कहीं अधिक असुरक्षित बना देता है।

मुख्य निष्कर्ष

पेपर निष्कर्ष निकालता है कि सिर्फ इसलिए कि एक सुरक्षा प्रणाली कुछ परीक्षणों को पास कर लेती है, इसका मतलब यह नहीं है कि वह वास्तव में सुरक्षित है। आज जो "सुरक्षित" प्रॉम्प्ट हम उपयोग करते हैं, वे उस चाबी की तरह हो सकते हैं जो आपके हाथ में मौजूद चाबी के खिलाफ तो काम करती है, लेकिन उस चाबी के खिलाफ विफल हो जाती है जिसे आपने अभी तक आविष्कार नहीं किया है।

P4D डेवलपर्स के लिए एक उपकरण है ताकि वे इन "अन-इन्वेंटेड कीज़" (अन-आविष्कृत चाबियों) को खोजने के लिए इनका उपयोग कर सकें, इससे पहले कि बुरे तत्व इनका उपयोग करें। यह साबित करता है कि हमें इन मॉडलों का लगातार परीक्षण करने की आवश्यकता है, क्योंकि "बुरे लोग" (या ऐसे स्वचालित उपकरण जो खामियां ढूंढते हैं) स्मार्ट होते जा रहे हैं, और सुरक्षा गार्डों को सबसे स्मार्ट ट्रिक्स के खिलाफ टेस्ट किया जाना चाहिए।

संक्षेप में: पेपर ने एक स्वचालित रोबोट बनाया जो AI आर्ट जनरेटर्स को बुरी चीजें बनाने के लिए धोखा देने की कोशिश करता है। इसने पाया कि वर्तमान सुरक्षा गार्डों की क्षमता हमारी सोच से बहुत कम है, और "सुरक्षित" शब्दों को नियमों को तोड़ने के लिए मोड़ा जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →