ReVision : A Post-Hoc, Vision-Based Technique for Replacing Unacceptable Concepts in Image Generation Pipeline
ReVision एक प्रशिक्षण-मुक्त, पोस्ट-हॉक सुरक्षा ढांचा है जो जनरेट की गई छवियों में बैकग्राउंड की अखंडता से समझौता किए बिना या अंतर्निहित जनरेटर को पुन: प्रशिक्षित किए बिना, अस्वीकार्य अवधारणाओं को सटीक रूप से पहचानने और संपादित करने के लिए विजन-लैंग्वेज मॉडल-सहायता प्राप्त स्थानिक गेटिंग तंत्र का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ आप कंप्यूटर में एक वाक्य टाइप कर सकते हैं और, ज़ूम!—एक बिल्कुल नई, अति-यथार्थवादी (hyper-realistic) तस्वीर सामने आ जाती है। यह "जेनरेटिव एआई" (generative AI) का जादू है, एक ऐसी तकनीक जिसने लोकप्रियता में विस्फोट किया है, जिससे कोई भी शून्य से कला, फोटो और दृश्य बना सकता है। लेकिन, ठीक वैसे ही जैसे एक शक्तिशाली नए उपकरण का उपयोग घर बनाने या हथियार बनाने के लिए किया जा सकता है, इन इमेज-मेकर्स का एक काला पक्ष भी है। कभी-कभी, लोग उन्हें खतरनाक, अवैध, या बस पूरी तरह से अनुचित चीजें बनाने के लिए धोखा देने की कोशिश करते हैं, जैसे कि हिंसा, नग्नता, या बिना अनुमति के वास्तविक मशहूर हस्तियों की तस्वीरें।
इसे रोकने के लिए, कंपनियाँ आमतौर पर एआई में "गार्डरेल्स" (guardrails) बनाने की कोशिश करती हैं। वे तस्वीर बनने से पहले बुरे शब्दों को ब्लॉक कर सकती हैं या एआई को कुछ विचारों को भूलने के लिए सिखा सकती हैं। लेकिन इन तरीकों में खामियां हैं। बुरे इरादे रखने वाले लोग अक्सर चालाकी भरे शब्दों के खेल से गार्डरेल्स को धोखा दे सकते हैं, और एआई के दिमाग को ठीक करने से अक्सर तस्वीरें बदतर दिखने लगती हैं या उनके लिए महंगे, समय लेने वाले पुन: प्रशिक्षण (retraining) की आवश्यकता होती है। इसलिए, वैज्ञानिक एक बड़ा सवाल पूछ रहे हैं: क्या तस्वीर बनने के बाद, बाकी की छवि को खराब किए बिना, एक बुरी तस्वीर को ठीक करने का कोई तरीका है? यह एक जादुई इरेज़र होने जैसा है जो पीछे के सुंदर सूर्यास्त को धुंधला किए बिना फोटो से एक विशिष्ट अवांछित वस्तु को हटा सकता है।
यहाँ ReVision आता है, जो शोधकर्ता गुरजोत सिंह और उनकी टीम द्वारा प्रस्तावित एक नई तकनीक है। ReVision को एक सुपर-स्मार्ट, पोस्ट-प्रोडक्शन एडिटर के रूप में समझें जो एक "सुरक्षा जाल" (safety net) के रूप में कार्य करता है। शुरुआत में ही एआई को गलतियाँ करने से रोकने के बजाय, ReVision तब तक इंतजार करता है जब तक कि तस्वीर बन नहीं जाती, फिर वह उसे देखता है, और उसके "अस्वीकार्य" हिस्सों को सर्जिकल सटीकता के साथ हटा देता है जबकि बाकी सब कुछ पूरी तरह से बरकरार रहता है।
शोधकर्ताओं ने पाया कि पिछले "सेफ्टी एडिटर्स" में अक्सर एक भद्दा दोष था: वे एक बहुत बड़े ब्रश की तरह थे। यदि आप भीड़ में एक बुरे आदमी के ऊपर पेंट करने की कोशिश करते, तो ब्रश गलती से उसके पास खड़े निर्दोष लोगों को भी पेंट कर देता, जिससे पूरा दृश्य खराब हो जाता। ऐसा इसलिए होता था क्योंकि कंप्यूटर इस बात को लेकर भ्रमित हो जाता था कि वास्तव में किस वस्तु को ठीक किया जाना चाहिए।
ReVision इस समस्या को एक चतुर दो-चरणीय (two-step) तरीके से हल करता है। सबसे पहले, यह एक "विज़न-लैंग्वेज मॉडल" (एक प्रकार का एआई जो चित्रों और शब्दों दोनों को समझता है) का उपयोग एक जासूस के रूप में करता है। यह जासूस छवि को देखता है और कहता है, "आहा! मुझे यहाँ एक सेलिब्रिटी दिख रहा है, और वहाँ एक हथियार दिख रहा है।" महत्वपूर्ण बात यह है कि यह केवल अनुमान नहीं लगाता; यह उस बुरी चीज़ के चारों ओर एक सटीक, अदृश्य बॉक्स बनाता है, जैसे कि एक सुरक्षा गार्ड ठीक अपराधी की ओर इशारा कर रहा हो।
दूसरा, ReVision एक "स्पेशियल गेटिंग" (spatial gating) तंत्र का उपयोग करता है। कल्पना करें कि संपादन प्रक्रिया पानी के एक सैलाब की तरह है जो एक बुरे विचार को धोने की कोशिश कर रही है। बिना गेट के, पानी कमरे में फैल सकता है और पूरे कमरे को जलमग्न कर सकता है। लेकिन ReVision उस अदृश्य बॉक्स के चारों ओर एक बांध बनाता है जिसे जासूस ने बनाया था। अब, "पानी" (संपादन का जादू) केवल उस बॉक्स के अंदर ही बह सकता है। यह बुरे विचार को एक सुरक्षित विचार से बदल देता है—जैसे कि एक नग्न व्यक्ति को कपड़े पहने हुए व्यक्ति में, या एक प्रसिद्ध अभिनेता को एक अजनबी में बदलना—बिना उनके पास खड़े व्यक्ति को छुए।
टीम ने 800 छवियों के एक विशाल सेट पर इसका परीक्षण किया, जिसमें कई लोगों और वस्तुओं वाले जटिल दृश्य शामिल थे। परिणाम प्रभावशाली थे। जब उन्होंने "नग्नता" (nude) सामग्री को हटाने की कोशिश की, तो ReVision ने नग्नता के सभी पता लगाने योग्य संकेतों को सफलतापूर्वक समाप्त कर दिया (70.51 डिटेक्शन से घटकर 0 हो गया), जबकि पुराने तरीकों में अक्सर निशान रह जाते थे या वे पास के निर्दोष लोगों के कपड़े भी बदल देते थे। कई अवधारणाओं (concepts) वाले परीक्षणों में, ReVision ने बैकग्राउंड में "शोर" या अवांछित परिवर्तनों को 0.166 से घटाकर 0.058 कर दिया, जो तस्वीर को प्राकृतिक बनाए रखने में एक बड़ा सुधार है।
शायद सबसे महत्वपूर्ण परीक्षण एक मानव अध्ययन था। जब लोगों ने मूल, असुरक्षित छवियों को देखा, तो वे 96% बार बुरी सामग्री को पहचान सके। ReVision ने अपना काम किया, इसके बाद मनुष्य केवल 10% बार ही अस्वीकार्य सामग्री को पहचान सके। इससे भी बेहतर यह था कि छवि के "सुरक्षित" हिस्सों में मौजूद लोग अनजाने में बदले नहीं गए।
शोधकर्ता इस बात पर जोर देते हैं कि यह विधि "ट्रेनिंग-फ्री" (training-free) है, जिसका अर्थ है कि इसे चित्र बनाना सीखने की आवश्यकता नहीं है और न ही इसके लिए मूल एआई कंपनी को अपना कोड बदलने की आवश्यकता है। यह एक यूनिवर्सल एड-ऑन (universal add-on) के रूप में काम करता है, जो किसी भी ऐसे व्यक्ति द्वारा उपयोग के लिए तैयार है जो यह सुनिश्चित करना चाहता है कि उनके एआई चित्र सुरक्षित हों। हालाँकि यह अध्ययन सुझाव देता है कि यह एक बड़ी प्रगति है, लेखक नोट करते हैं कि उनके परीक्षण चित्र विशेष रूप से प्रयोग के लिए बनाए गए थे, और भविष्य के कार्यों को यह सत्यापित करने की आवश्यकता होगी कि यह हर संभावित वास्तविक दुनिया के परिदृश्य में कितनी अच्छी तरह काम करता है। लेकिन फिलहाल, ReVision एआई कला के जादू को दुःस्वप्न में बदलने से रोकने का एक आशाजनक, सटीक तरीका प्रदान करता है, यह सुनिश्चित करते हुए कि जब हम बुराई को संपादित करते हैं, तो हम अनजाने में अच्छाई को नहीं मिटाते।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।