Conditioned Activation Transport for T2I Safety Steering
टेक्स्ट-टू-इमेज मॉडल्स में सुरक्षा और इमेज क्वालिटी के बीच के ट्रेड-ऑफ को संबोधित करने के लिए, लेखक 'कंडीशन्ड एक्टिवेशन ट्रांसपोर्ट' (CAT) का प्रस्ताव करते हैं, जो एक ऐसा फ्रेमवर्क है जो असुरक्षित एक्टिवेशन्स को नियंत्रित करने के लिए एक कंट्रास्टिव डेटासेट और ज्यामिति-आधारित नॉनलीनियर ट्रांसपोर्ट मैप्स का उपयोग करता है ताकि निर्दोष जनरेशन की गुणवत्ता को कम किए बिना उन्हें निर्देशित किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक जादुई कलाकार है जिसका नाम AI है। यह कलाकार अविश्वसनीय रूप से प्रतिभाशाली है; यह आपके द्वारा बताए गए किसी भी चित्र को चित्रित कर सकता है, जैसे कि एक "धूप वाला समुद्र तट" से लेकर एक "भविष्य का शहर" तक। लेकिन एक समस्या है: कभी-कभी, यदि आप कुछ थोड़ा जोखिम भरा मांगते हैं (जैसे कि "थोड़ी अधिक अराजकता वाली एक पार्टी"), तो AI नियंत्रण खो देता है और कुछ खतरनाक, हिंसक या अनुचित बना देता है।
लंबे समय तक, लोगों ने इसे रोकने के लिए तीन तरीके आजमाए:
- कलाकार को बुरी चीजों को भूलने के लिए प्रशिक्षित करना (जो कठिन है क्योंकि कलाकार फिर भी याद रख लेता है)।
- अंतिम चित्र पर एक फ़िल्टर लगाना (जैसे कि सेंसर बार), जो आसानी से हटाया जा सकता है।
- कलाकार को एक वैश्विक "धक्का" (global nudge) देना। यह कलाकार को ऐसा बताने जैसा है कि, "हे, अच्छे बनो!" हर एक चित्र के लिए। समस्या यह है कि इससे अक्सर कलाकार अनाड़ी हो जाता है। "शांतिपूर्ण पिकनिक" की एक मांग भी धुंधली और खराब दिख सकती है क्योंकि कलाकार सुरक्षित रहने के लिए इतना चिंतित है कि वह अच्छी चीजों को ही बिगाड़ देता है।
यह शोध पत्र इस नए, स्मार्ट तरीके को पेश करता है जिसे कंडीशन्ड एक्टिवेशन ट्रांसपोर्ट (CAT) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:
1. समस्या: "ब्रूट फोर्स" (बलपूर्वक) धक्का
कल्पना कीजिए कि AI का मस्तिष्क हजारों डायल वाले एक विशाल नियंत्रण कक्ष की तरह है। पुराने तरीकों ने सभी डायल को एक साथ "सुरक्षा" की दिशा में घुमाने की कोशिश की, चाहे कोई भी चित्र बनाया जा रहा हो।
- परिणाम: यदि आप एक "डरावने राक्षस" के लिए पूछते, तो धक्का काम करता। लेकिन यदि आप एक "प्यारे पिल्ले" के लिए पूछते, तो धक्का अभी भी डायल घुमाता, जिससे पिल्ला अजीब, विकृत या टूटा हुआ दिखता। यह एक चलती कार को रोकने के लिए ब्रेक लगाने जैसा था, भले ही आप केवल पार्किंग लॉट में धीरे चल रहे हों।
2. नया समाधान: "स्मार्ट ट्रैफिक पुलिस" (CAT)
लेखकों ने महसूस किया कि सुरक्षा एक सीधी रेखा नहीं है; यह एक जटिल, घुमावदार आकार है। आप सब कुछ एक ही दिशा में नहीं धकेल सकते। उन्होंने दो मुख्य भागों वाला एक सिस्टम बनाया है:
भाग A: "आकार बदलने वाला" (नॉन-लीनियर ट्रांसपोर्ट)
AI के मस्तिष्क को एक परिदृश्य (landscape) के रूप में सोचें।
- सुरक्षित विचार एक चिकने, हरे घास के मैदान की तरह हैं।
- असुरक्षित विचार एक ऊबड़-खाबड़, चट्टानी घाटी की तरह हैं।
- पुराने तरीकों ने एक विशाल बुलडोजर (एक सीधी रेखा) के साथ उस घाटी को समतल करने की कोशिश की। इसने चट्टानों को तो कुचल दिया लेकिन मैदान को भी चपटा कर दिया, जिससे दृश्य खराब हो गया।
- CAT का "आकार बदलने वाला" एक जादुई मूर्तिकार की तरह है। यह केवल चट्टानों को धीरे से घास के मैदान के आकार में ढालता है। यह मैदान को बिल्कुल नहीं छूता है। यह समझता है कि "बुरे" विचारों का एक अजीब, मुड़ा हुआ आकार होता जिसे ठीक करने के लिए एक जटिल, घुमावदार पथ की आवश्यकता होती, न कि एक सीधे धक्के की।
भाग B: "स्मार्ट गेट" (कंडीशन्ड एक्टिवेशन)
यह सबसे महत्वपूर्ण हिस्सा है। सिस्टम केवल तराशता ही नहीं है; यह सही क्षण का इंतजार करता है।
- एक क्लब के बाउंसर की कल्पना करें।
- पुराने तरीके एक ऐसे बाउंसर की तरह थे जो हर किसी को अंदर आने से रोकता है, भले ही वे केवल जन्मदिन की पार्टी के लिए आए हों।
- CAT का बाउंसर बहुत चौकस है। वह आपकी आईडी (चित्र का विचार) की जांच करता है।
- यदि आप एक "शांतिपूर्ण पिकनिक" मांग रहे हैं, तो बाउंसर कहता है, "आप सुरक्षित हैं! अंदर आ जाइए," और कुछ नहीं करता। चित्र एकदम सही आता है।
- यदि आप कुछ ऐसा मांग रहे हैं जो "चट्टानी घाटी" (असुरक्षित) की ओर बढ़ता हुआ दिख रहा है, तो बाउंसर कहता है, "रुको," और फिर घास के मैदान की ओर वापस ले जाने के लिए 'शेप-शिफ्टर' को सक्रिय करता है।
3. नया मानचित्र (SafeSteerDataset)
इस सिस्टम को यह सिखाने के लिए कि "शांतिपूर्ण पिकनिक" और "खतरनाक दंगे" के बीच अंतर कैसे किया जाए, लेखकों ने SafeSteerDataset नामक एक विशेष प्रशिक्षण मानचित्र बनाया।
- उन्होंने केवल यादृच्छिक (random) बुरे चित्र नहीं लिए। उन्होंने लगभग समान, जुड़वां जैसे प्रॉम्प्ट्स के जोड़े बनाए।
- सुरक्षित: "पार्क में कुत्ता टहलाता हुआ एक व्यक्ति।"
- असुरक्षित: "पार्क में कुत्ता टहलाता हुआ एक व्यक्ति, लेकिन कुत्ता एक बच्चे को काट रहा है।"
- क्योंकि दोनों प्रॉम्प्ट्स इतने समान हैं, AI यह सीख सकता है कि काटने की घटना को रोकने के लिए किस छोटे डायल को घुमाने की आवश्यकता है, बिना यह बदले कि वह पार्क में कुत्ता टहला रहा है। यह उस सटीक सुई को खोजने जैसा है जो समस्या का कारण बनती है, बजाय पूरे ढेर को फेंक देने के।
परिणाम: बेहतर सुरक्षा, कोई टूटा हुआ आर्ट नहीं
जब उन्होंने इसे दो सबसे उन्नत AI आर्ट मॉडल्स (Z-Image और Infinity) पर टेस्ट किया, तो परिणाम प्रभावशाली थे:
- सुरक्षा: इसने AI को हिंसक या विषाक्त चित्र (जैसे स्वास्तिक, खून-खराबा या नग्नता) बनाने से सफलतापूर्वक रोका, भले ही लोगों ने इसे धोखा देने की कोशिश की हो।
- गुणवत्ता: पुराने "ब्रूट फोर्स" तरीकों के विपरीत, सुंदर, सुरक्षित चित्र (जैसे सूर्यास्त, पिल्ले और परिदृश्य) उच्च गुणवत्ता वाले और स्पष्ट बने रहे। "शांतिपूर्ण पिकनिक" धुंधला नहीं हुआ।
संक्षेप में
यह शोध पत्र कहता है: "कलाकार को पेंट करने से न रोकें; बस उन्हें एक स्मार्ट गाइड दें जो केवल तभी हस्तक्षेप करे जब वे कुछ खतरनाक पेंट करने वाले हों, और उन्हें पता हो कि बाकी कैनवास को खराब किए बिना ब्रश के स्ट्रोक को ठीक से कैसे सुधारा जाए।"
यह उस रचनात्मकता और सुंदरता को खोए बिना AI कला को सभी के लिए सुरक्षित बनाता है जिसे हम पसंद करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।