← नवीनतम पेपर
🤖 AI

PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models

प्रॉम्प्टगार्ड (PromptGuard) टेक्स्ट-टू-इमेज मॉडल्स के लिए एक नवीन, कुशल कंटेंट मॉडरेशन तकनीक है जो टेक्स्टुअल एम्बेडिंग स्पेस के भीतर यूनिवर्सल और कैटेगरी-स्पेसिफिक सेफ्टी सॉफ्ट प्रॉम्प्ट्स को प्रभावी ढंग से अनुकूलित करती है ताकि इमेज की गुणवत्ता और इन्फरेंस स्पीड को बनाए रखते हुए NSFW कंटेंट के निर्माण को प्रभावी ढंग से दबाया जा सके।

मूल लेखक: Lingzhi Yuan, Xinfeng Li, Chejian Xu, Guanhong Tao, Xiaojun Jia, Yihao Huang, Wei Dong, Yang Liu, Xiaofeng Wang, Bo Li

प्रकाशित 2026-02-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lingzhi Yuan, Xinfeng Li, Chejian Xu, Guanhong Tao, Xiaojun Jia, Yihao Huang, Wei Dong, Yang Liu, Xiaofeng Wang, Bo Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई पेंटब्रश है जो आपके द्वारा लिखे गए किसी भी वाक्य को एक सुंदर चित्र में बदल सकता है। आधुनिक टेक्स्ट-टू-इमेज AI (जैसे Stable Diffusion) यही करता है। आप कहते हैं, "एक स्केटबोर्ड पर बिल्ली," और पूफ—वहाँ स्केटबोर्ड पर एक बिल्ली होती है।

लेकिन यहाँ एक समस्या है: यदि आप कुछ खतरनाक या अनुचित कहते हैं, जैसे "एक हिंसक लड़ाई का दृश्य," तो AI वास्तव में उसे भी बना सकता है। यह एक बड़ा नैतिक मुद्दा है। हमें एक ऐसा तरीका चाहिए जिससे AI को अच्छी चीजें बनाने की क्षमता खोए बिना, बुरी चीजें बनाने से रोका जा सके।

वर्तमान में, अधिकांश सुरक्षा विधियाँ क्लब के बाउंसरों या कठोर संपादकों की तरह हैं:

  • बाउंसर: आपके वाक्य को अंदर जाने से पहले जाँचता है। यदि वह जोखिम भरा लगता है, तो वे आपको बाहर निकाल देते हैं या चित्र बनने के बाद उसे धुंधला कर देते हैं। यह धीमा है और अक्सर गलती से निर्दोष अनुरोधों को भी ब्लॉक कर देता है।
  • कठोर संपादक: पूरे AI मस्तिष्क को फिर से प्रशिक्षित (re-train) करता है ताकि वह बुरी चीजें बनाना "भूल" जाए। यह एक मास्टर शेफ को फिर से यह सिखाने जैसा है कि खाना कैसे बनाया जाता है, जिसमें बहुत समय लगता है और इससे उनके अच्छे व्यंजन भी खराब हो सकते हैं।

पेश है: PromptGuard (एक "जादुगत फुसफुसाहट")

यह पेपर PromptGuard को पेश करता है, जो AI को सुरक्षित रखने का एक नया, चतुर तरीका है। AI को बाउंसर रखने या शेफ को फिर से प्रशिक्षित करने के बजाय, वे AI को एक गुप्त, अदृश्य निर्देश देते हैं जो वह पेंटिंग शुरू करने से पहले खुद को फुसफुसाता है।

यह इस प्रकार काम करता है (सरल उपमाओं का उपयोग करते हुए):

1. "सिस्टम प्रॉम्प्ट" का तरीका

चैटबॉट्स (जैसे कि आप जिससे अभी बात कर रहे हैं) में, एक छिपा हुआ "सिस्टम प्रॉम्प्ट" होता है जो बॉट को बताता है, "मददगार बनो, सुरक्षित रहो, बुरी बातें मत कहो।" बॉट इस नियम का स्वतः पालन करता है।

टेक्स्ट-टू-इमेज मॉडल के पास यह छिपा हुआ नियम नहीं होता। PromptGuard एक डिजिटल "जादुई शब्द" (जिसे सॉफ्ट प्रॉम्प्ट कहा जाता है) बनाता है जो उस छिपे हुए नियम की तरह काम करता है। यह कोई वास्तविक शब्द नहीं है जिसे आप टाइप कर सकें; यह AI के मस्तिष्क में अंतर्निहित एक विशेष कोड है जो कहता है, "हे, आप चाहे जो भी बनाने के लिए कहा जाए, इसे सुरक्षित रखें।"

2. "विभाजित करो और जीतो" (Divide and Conquer) की रणनीति

बुरी चीजें कई रूपों में आती हैं: कुछ हिंसक हैं, कुछ यौन संबंधी हैं, कुछ राजनीतिक हैं, और कुछ बस डरावनी हैं। एक ही जादुई शब्द के साथ सभी को रोकने की कोशिश करना, बारिश, बर्फ और ओलावृष्टि को रोकने के लिए एक ही छाते का उपयोग करने जैसा है—यह पूरी तरह से काम नहीं करता।

इसलिए, PromptGuard विशेषज्ञ गार्डों की एक टीम का उपयोग करता है:

  • एक छोटा जादुई शब्द विशेष रूप से हिंसा को रोकने के लिए प्रशिक्षित किया गया है।
  • दूसरा यौन सामग्री को रोकने के लिए।
  • तीसरा राजनीतिक घृणा को रोकता है, और इसी तरह।

जब आप AI को कुछ चित्रित करने के लिए कहते हैं, तो यह आपके अनुरोध के साथ इन सभी छोटे जादुई शब्दों को एक साथ जोड़ देता है। यह एक सुरक्षा टीम की तरह है जहाँ एक व्यक्ति दरवाजे पर नज़र रखता है, एक खिड़कियों पर नज़र रखता है, और एक छत पर। साथ मिलकर, वे सब कुछ कवर करते हैं।

3. "सुरक्षित संस्करण" प्रशिक्षण

आप AI को यह जादुई शब्द कैसे सिखाते हैं? आप उसे केवल यह नहीं बताते कि "ऐसा मत करो।" इसके बजाय, आप उसे एक पहले-और-बाद का सबक दिखाते हैं।

  • सबक: आप AI को एक "नग्न पुरुष" (एक बुरा अनुरोध) की तस्वीर दिखाते हैं और फिर उसे एक "पूरी तरह से कपड़े पहने हुए पुरुष" (सुरक्षित संस्करण) की तस्वीर दिखाते हैं।
  • लक्ष्य: आप जादुई शब्द को AI के मस्तिष्क को "नग्न" विचार से दूर और "कपड़े पहने हुए" विचार की ओर धकेलने के लिए प्रशिक्षित करते हैं, भले ही उपयोगकर्ता नग्न होने के लिए कहे।
  • परिणाम: यदि कोई असुरक्षित चीज़ के लिए पूछता है, तो AI अभी भी एक चित्र बनाता है, लेकिन यह विवरणों को सूक्ष्म रूप से बदलकर उसे सुरक्षित और यथार्थवादी बनाता है, बजाय इसके कि स्क्रीन को काला कर दे या चित्र बनाने से मना कर दे।

यह एक बड़ी बात क्यों है?

  • यह तेज़ है: क्योंकि इसे अलग कंप्यूटर के साथ चित्र की जाँच करने या पूरे AI को फिर से प्रशिक्षित करने की आवश्यकता नहीं होती है, यह अन्य तरीकों की तुलना में 3.8 गुना तेज़ है। यह एक अलग सुरक्षा गार्ड के बजाय एक अंतर्निहित फ़िल्टर होने जैसा है।
  • यह स्मार्ट है: यह केवल बुरे अनुरोधों को ब्लॉक नहीं करता है; यह उन्हें ठीक करता है। यदि आप एक "डरावने राक्षस" के लिए पूछते हैं, तो यह एक भयानक राक्षस के बजाय एक "डरावना लेकिन प्यारा राक्षस" बना सकता है। यह रचनात्मकता को जीवित रखता है।
  • यह लचीला है: यदि किसी नए प्रकार की बुरी सामग्री (जैसे "आत्म-क्षति") का पता चलता है, तो आप बस एक नया छोटा जादुई शब्द प्रशिक्षित कर सकते हैं और उसे टीम में जोड़ सकते है। आपको पूरा सिस्टम फिर से बनाने की आवश्यकता नहीं है।

निष्कर्ष

PromptGuard AI को अदृश्य सुरक्षा चश्मे देने जैसा है। यह उपयोगकर्ता के अनुरोध को देखता है, लेकिन चश्मे के माध्यम से, यह स्वचालित रूप से खतरनाक हिस्सों को फ़िल्टर कर देता है और एक सुरक्षित, सुंदर चित्र बनाता है। यह AI आर्ट के जादू को सभी के लिए सुरक्षित रखने का एक हल्का, तेज़ और प्रभावी तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →