← नवीनतम पेपर
🤖 AI

Inference-Only Prompt Projection for Safe Text-to-Image Generation with TV Guarantees

यह शोध पत्र SPOT को प्रस्तुत करता है, जो एक इन्फरेंस-टाइम फ्रेमवर्क है जो डिफ्यूजन मॉडल को पुनरप्रशिक्षित किए बिना, एक LLM और एक सुरक्षात्मक VLM का उपयोग करके असुरक्षित प्रॉम्प्ट्स को चुनिष्ट रूप से एक "टाऊ सेफ सेट" (tau safe set) की ओर प्रोजेक्ट करता है ताकि सौहार्दपूर्ण प्रॉम्प्ट्स के व्यवहार को संरक्षित करते हुए अनुचित इमेज जनरेशन को काफी कम किया जा सके।

मूल लेखक: Minhyuk Lee, Hyekyung Yoon, Myungjoo Kang

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minhyuk Lee, Hyekyung Yoon, Myungjoo Kang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई, जमी हुई कला मशीन (एक Text-to-Image AI) है जो आपके द्वारा वर्णित किसी भी चीज़ को बना सकती है। यह अविश्वसनीय रूप से प्रतिभाशाली है, लेकिन कभी-कभी, यदि आप इसे कोई कठिन या खतरनाक प्रॉम्प्ट देते हैं, तो यह गलती से कुछ अनुचित बना सकती है।

समस्या यह है कि यदि आप बुरी चीज़ों को बनाने से रोकने के लिए मशीन को ही "ठीक" करने की कोशिश करते हैं, तो आप अक्सर इसकी अच्छी चीज़ें बनाने की क्षमता को भी अनजाने में खराब कर देते हैं। यह कुछ ऐसा है जैसे किसी शेफ को तीखा खाना बनाने से रोकने के लिए उसका चाकू हटा देना; अचानक, वह सलाद के लिए सब्जियां भी नहीं काट पाएगा।

यह पेपर एक नई विधि पेश करता है जिसे SPOT (Selective Prompt Projection) कहा जाता है, जो मशीन को फिर से बनाने के बजाय, मशीन के पहले बैठे एक स्मार्ट संपादक (Smart Editor) की तरह काम करता है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करके यहाँ दिया गया है:

1. "जमी हुई मशीन" का नियम (The "Frozen Machine" Rule)

लेखकों ने कला मशीन को बिल्कुल न छूने का निर्णय लिया। उन्होंने इसे वैसा ही रखा जैसा यह था (frozen)। क्यों? क्योंकि यदि आप मशीन को बदलते हैं, तो आप उसका व्यक्तित्व बदल देते हैं। वे मशीन के "अच्छे" व्यवहार को बिल्कुल वैसा ही रखना चाहते थे, केवल उसके "बुरे" व्यवहार को रोकना चाहते थे।

2. "सुरक्षा मानचित्र" (The "Safety Map" - द τ Safe Set)

कल्पना कीजिए कि एक मानचित्र है जहाँ कुछ क्षेत्र "ग्रीन ज़ोन" (सुरक्षित रूप से बनाने योग्य) और अन्य "रेड ज़ोन" (असुरक्षित) हैं।

  • लक्ष्य: यदि आप ग्रीन ज़ोन में कुछ मांगते हैं, तो संपादक आपके अनुरोध को अकेला छोड़ देता है। मशीन ठीक वही बनाती है जो आपने मांगा है।
  • समस्या: यदि आप रेड ज़ोन में कुछ मांगते हैं, तो संपादक को हस्तक्षेप करना होगा। लेकिन केवल "नहीं" कहने के बजाय, यह खोजने की कोशिश करता है कि सबसे निकटतम ग्रीन ज़ोन कौन सा है जो आपके मूल अनुरोध जैसा ही दिखता हो।

3. दो-चरणीय जासूसी टीम (The Two-Stage Detective Team)

SPOT एक दो-चरणीय प्रक्रिया का उपयोग करता है, जो एक सुरक्षा टीम की तरह काम करता है जिसके पास एक सस्ता स्कैनर और एक सख्त निरीक्षक है।

  • चरण 1: त्वरित स्कैनर (The Quick Scanner - The LLM)
    जब कोई जोखिम भरा प्रॉम्प्ट आता है, तो एक तेज़, केवल टेक्स्ट-आधारित AI (LLM) एक स्काउट के रूप में कार्य करता है। यह तेज़ी से आपके प्रॉम्प्ट के कुछ "पुनर्लिखित" (rewritten) संस्करण बनाता है। यह पूछता है: "यदि मैं इस शब्द को उस शब्द में बदल दूँ, तो क्या यह सुरक्षित दिखेगा?"

    • यह उस संस्करण को चुनता है जो आपके मूल विचार के सबसे करीब है लेकिन रेड ज़ोन से बाहर निकलकर ग्रीन ज़ोन में चला जाता है।
    • यह तेज़ और सस्ता है क्योंकि यह केवल शब्दों को देखता है, चित्रों को नहीं।
  • **चरण 2: सख्त निरीक्षक (The Strict Inspector - The VLM) **
    एक बार जब संपादक सबसे अच्छा पुनर्लिखित प्रॉम्प्ट चुन लेता है, तो वास्तविक कला मशीन चित्र बनाती है। फिर, एक दूसरा AI (Vision-Language Model) द्वारा बनाए गए वास्तविक चित्र को देखा जाता है।

    • यह पूछता है: "क्या यह चित्र वास्तव में सुरक्षित है?"
    • यदि चित्र सुरक्षित है, तो इसे हरी झंडी मिल जाती है।
    • यदि चित्र अभी भी असुरक्षित है (शायद मशीन ने नए प्रॉम्प्ट को गलत समझा है), तो सिस्टम चरण 1 पर वापस जाता है, एक अलग पुनर्लेखन का प्रयास करता है, और फिर से चित्र बनाता है।

4. "सुरक्षा बनाम रचनात्मकता" का समझौता (The "Safety vs. Creativity" Trade-off)

यह पेपर एक बहुत ही महत्वपूर्ण गणितीय बिंदु बनाता है: आप AI को सुरक्षित बनाए बिना उसके आउटपुट को थोड़ा बदले बिना नहीं कर सकते।
इसे एक नदी की तरह सोचें। यदि आप एक गाँव से दूर खतरनाक बाढ़ (असुरक्षित चित्र) को मोड़ना चाहते हैं, तो आपको एक नया चैनल बनाना होगा। वह नया चैनल पानी के मार्ग को बदल देता है।

  • SPOT की तरकीब: यह केवल खतरनाक बाढ़ के लिए एक नया चैनल बनाता है। यदि पानी पहले से ही सुरक्षित रूप से बह रहा है (benign prompts), तो यह नदी को बिल्कुल वहीं छोड़ देता है जहाँ वह है। यह सुनिश्चित करता है कि जब आप "प्यारा बिल्ली" मांगते हैं, तो आपको "प्यारा बिल्ली" ही मिले, न कि "कार्टून बिल्ली" या "ब्लैक स्क्रीन"।

5. परिणाम (The Results)

लेखकों ने चार अलग-अलग डेटा सेट और तीन अलग-अलग कला मशीनों पर इसका परीक्षण किया।

  • सुरक्षा: इसने अनुचित छवियों की संख्या को बहुत कम कर दिया (अन्य तरीकों की तुलना में 14% से 44% बेहतर)।
  • रचनात्मकता: इसने "अच्छी" छवियों को लगभग वैसा ही बनाए रखा जैसा कि वे सुरक्षा फिल्टर के बिना होतीं।
  • गति: क्योंकि पहला चरण (टेक्स्ट स्कैनर) बहुत तेज़ है, पूरी प्रक्रिया बहुत तेज़ है क्योंकि यह हर एक चित्र विचार को जांचने से पहले ही काम पूरा कर लेती है।

सारांश (Summary)

SPOT एक क्लब के बाउंसर की तरह है जो संगीत या डीजे (AI मॉडल) को नहीं बदलता है। इसके बजाय, यदि कोई दरवाजे पर कुछ अभद्र कहने की कोशिश करता है, तो बाउंसर धीरे से उसे विनम्रता से अपनी बात कहने का सुझाव देता है। यदि पुनर्लिखित वाक्य उन्हें अंदर जाने देता है, तो वे प्रवेश करते हैं। यदि वे अभद्र होने की कोशिश जारी रखते हैं, तो उन्हें अंदर नहीं जाने दिया जाता है। लेकिन यदि वे शुरू से ही विनम्र थे, तो वे बिना किसी बाधा के सीधे अंदर चले जाते हैं।

यह सुनिश्चित करता है कि अच्छे मेहमानों के अनुभव को खराब किए बिना क्लब सुरक्षित रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →