← नवीनतम पेपर
💻 computer science

Semantic Steering for Controllable Generation: Tuning-Free Concept Erasure in Multimodal Diffusion Transformers

यह शोध पत्र 'सेमेंटिक स्टीयरिंग' नामक एक ट्यूनिंग-मुक्त विधि प्रस्तावित करता है जो मॉडल के मध्य ब्लॉक्स में असुरक्षित और सुरक्षित रिप्रजेंटेशन्स (representations) के बीच के अंतर से प्राप्त स्टीयरिंग वेक्टर का निर्माण और इंजेक्शन करके मल्टीमॉडल डिफ्यूजन ट्रांसफॉर्मर्स में अवांछित अवधारणाओं को मिटा देता है, जिससे मॉडल पैरामीटर्स को संशोधित किए बिना प्रभावी, सुदृढ़ और कम-ओवरहेड वाला कॉन्सेप्ट कंट्रोल प्राप्त होता है।

मूल लेखक: Qiao Li, Xiaomeng Fu, Yuanshu Zhao, Qipeng Wang, Jiao Dai, Jizhong Han

प्रकाशित 2026-08-14
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qiao Li, Xiaomeng Fu, Yuanshu Zhao, Qipeng Wang, Jiao Dai, Jizhong Han

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट डिजिटल कलाकार है जो आपकी हर वर्णनित चीज़ को पेंट कर सकता है, जैसे स्पेससूट में एक बिल्ली या मंगल ग्रह पर सूर्यास्त। यह कलाकार इंसान नहीं है; यह एक कंप्यूटर प्रोग्राम है जिसे "मल्टीमॉडल डिफ्यूजन ट्रांसफॉर्मर" (या संक्षेप में MM-DiT) कहा जाता है। इसे एक विशाल, अराजक रसोई की तरह समझें जहाँ शेफ (AI) ने इंटरनेट से लाखों रेसिपी चखी हैं। यह अविश्वसनीय रूप से प्रतिभाशाली है, लेकिन क्योंकि इसने पूरे इंटरनेट से सीखा है, इसलिए यह कभी-कभी अनजाने में ऐसी चीजें बनाने की कोशिश करता है जिन्हें हम नहीं चाहते, जैसे कि अनुपयुक्त चित्र, कॉपीराइट वाली कला शैलियाँ, या वास्तविक हस्तियों की अनुमति के बिना उनके चित्र।

लंबे समय तक, यदि आप इस डिजिटल शेफ को कोई विशिष्ट व्यंजन बनाने से रोकना चाहते थे, तो आपको या तो शेफ की पूरी रेसिपी बुक को फिर से लिखना पड़ता था (जो कठिन और महंगा है) या बस ज़ोर से चिल्लाना पड़ता था "वह मत बनाओ!" (जो अक्सर काम नहीं करता क्योंकि शेफ बहुत जिद्दी होता है)। यह नया शोध पत्र एक चतुर, "नो-ट्रेनिंग" (बिना प्रशिक्षण के) ट्रिक के बारे में है जो शेफ के हाथ को धीरे से धकेलने के लिए है ताकि वे वह अवांछित व्यंजन बनाना बंद कर दें लेकिन भोजन स्वादिष्ट भी बना रहे। शोधकर्ताओं ने पाया कि शेफ का मस्तिष्क परतों (layers) में काम करता है: शुरुआती परतें भोजन के सामान्य आकार का निर्णय लेती हैं, मध्य परतें मुख्य सामग्री और स्वाद तय करती हैं, और अंतिम परतें सजावट (garnish) जोड़ती हैं। उन्होंने पाया कि यदि आप क्या बनाया जा रहा है उसे बदलना चाहते हैं (जैसे कि एक नग्न फोटो को कपड़ों वाले फोटो में बदलना), तो आपको विशेष रूप से मध्य परतों को एक गुप्त निर्देश फुसफुसाने की आवश्यकता होती है, जहाँ छवि का "अर्थ" निवास करता है।

समस्या: जिद्दी डिजिटल कलाकार

यह शोध पत्र इन शक्तिशाली नए AI मॉडलों (जैसे Stable Diffusion 3 और FLUX) की ओर ध्यान आकर्षित करता है। ये मॉडल टेक्स्ट को चित्रों में बदलने में अद्भुत हैं, लेकिन इनमें सुरक्षा की एक समस्या है। क्योंकि इन्हें वेब से भारी मात्रा में डेटा पर प्रशिक्षित किया गया है, इसलिए ये कभी-कभी असुरक्षित चीजें बना सकते हैं, जैसे कि नग्नता, या ऐसी चीजें जो अवैध हैं, जैसे कि प्रसिद्ध लोगों के चित्र या कॉपीराइट वाली कला शैलियाँ।

पहले, लोगों ने इसे दो तरीकों से ठीक करने की कोशिश की थी:

  1. मस्तिष्क को फिर से लिखना: उन्होंने मॉडल को इन बुरे विचारों को "भूलने" के लिए पुन: प्रशिक्षित (retrain) करने की कोशिश की। लेकिन यह एक जीनियस को शिक्षित करने जैसा है; इसमें बहुत समय, पैसा लगता है और अक्सर यह मॉडल को अच्छी चीजें बनाने में और खराब कर देता है।
  2. प्रॉम्प्ट्स के माध्यम से चिल्लाना: उन्होंने "नेगेटिव प्रॉम्प्ट्स" (AI को कहना "नग्नता नहीं") या अन्य टेक्स्ट ट्रिक्स का उपयोग करने की कोशिश की। लेकिन इन नए, सुपर-स्मार्ट मॉडलों के साथ, बुरे विचार मॉडल के ज्ञान में इतनी गहराई में दबे हुए हैं कि सरल टेक्स्ट कमांड बस टकराकर वापस आ जाते हैं। AI "नहीं" को अनदेखा कर देता है और "हाँ" को ही चित्रित कर देता है।

समाधान: "स्टीयरिंग वेक्टर" (Steering Vector)

लेखकों ने एक अलग विचार निकाला। मॉडल को फिर से प्रशिक्षित करने या उस पर चिल्लाने के बजाय, उन्होंने चित्र बनाते समय उसे सही दिशा में धीरे से धकेलने का निर्णय लिया। वे इसे "सिमेंटिक स्टीयरिंग" (Semantic Steering) विधि कहते हैं।

यहाँ यह कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:

कल्पना कीजिए कि AI एक घर बना रहा है।

  • शुरुआती ब्लॉक (Early Blocks): ये नींव और ढांचा हैं। ये तय करते हैं कि घर एक गगनचुंबी इमारत है या एक छोटा सा कॉटेज।
  • मध्य ब्लॉक (Middle Blocks): यहाँ कमरों, फर्नीचर और घर के मुख्य उद्देश्य का निर्णय लिया जाता है। यहीं पर "अवधारणा" (concept) निवास करती है।
  • अंतिम ब्लॉक (Late Blocks): यह पेंट, पर्दे और दरवाजों के हैंडल हैं।

शोधकर्ताओं ने पाया कि यदि आप अवधारणा को बदलना चाहते हैं (जैसे "नग्न व्यक्ति" को "कपड़े पहने व्यक्ति" में बदलना), तो आपको नींव या पेंट के साथ छेड़छाड़ करने की आवश्यकता नहीं है। आपको बस बीच के कमरों में फर्नीचर को समायोजित करने की आवश्यकता है।

जादुвई ट्रिक:

  1. अंतर खोजें: शोधकर्ता दो चित्र लेते हैं: एक वह जिसमें वह चीज़ है जिसे वे मिटाना चाहते हैं (जैसे "टेलर स्विफ्ट की एक फोटो") और एक सुरक्षित विकल्प के साथ (जैसे "एक साधारण महिला की फोटो")।
  2. मध्य परत: वे इन दोनों चित्रों के बारे में सोचते समय AI के "मध्य ब्लॉकों" को देखते हैं। वे "टेलर स्विफ्ट" के विचार और "साधारण महिला" के विचार के बीच का सटीक गणितीय अंतर पाते हैं।
  3. स्टीयरिंग वेक्टर: वे उस अंतर को एक एकल "स्टीयरिंग वेक्टर" में बदल देते हैं। इसे एक छोटे, अदृश्य तीर की तरह समझें।
  4. धक्का (The Push): जैसे ही AI चित्र बनाता है, शोधकर्ता इस तीर को AI के मस्तिष्क के मध्य ब्लॉकों (और कुछ शुरुआती ब्लॉकों) में इंजेक्ट करते हैं। यह तीर AI के विचारों को "टेलर स्विफ्ट" से दूर और "साधारण महिला" की ओर धीरे से धकेलता है, बिना बाकी चित्र को बदले।

उन्होंने क्या पाया

यह शोध पत्र दिखाता है कि यह विधि अविश्वसनीय रूप से अच्छी तरह से काम करती है। उन्होंने दो प्रमुख AI मॉडलों (Stable Diffusion 3.5 और FLUX.1) पर इसका परीक्षण किया और तीन प्रकार की चीजों को मिटाने की कोशिश की:

  • सेलिब्रिटीज (Celebrities): AI को टेलर स्विफ्ट या लियोनार्डो डिकैप्रियो बनाने से रोकना।
  • कला शैलियाँ (Art Styles): AI को वैन गॉग या मोनेट की शैली में पेंट करना बंद करने के लिए प्रेरित करना।
  • नग्नता (Nudity): AI को नग्न लोगों के बजाय कपड़े पहने लोगों को चित्रित करने के लिए कहना।

परिणाम:

  • यह काम करता है: इस विधि ने पिछले ट्रिक्स की तुलना में इन अवधारणाओं को बहुत बेहतर तरीके से मिटाया। उदाहरण के लिए, टेलर स्विफ्ट को चित्रित करने के लिए कहा जाने पर, AI ने एक साधारण महिला बनाई, और चित्र अभी भी एकदम सही था।
  • कोई प्रशिक्षण आवश्यक नहीं: सबसे अच्छी बात यह है कि उन्हें मॉडल को फिर से प्रशिक्षित करने की आवश्यकता नहीं पड़ी। उन्होंने केवल मॉडल के चलते समय इस "स्टीयरिंग वेक्टर" ट्रिक का उपयोग किया। यह शेफ की पूरी रेसिपी बुक को फिर से लिखने के बजाय उसे एक हल्का सा धक्का देने जैसा है।
  • गुणवत्ता बनी रहती है: चित्र धुंधले या अजीब नहीं हुए। "एस्थेटिक स्कोर" (चित्र कितना सुंदर है) उच्च बना रहा, जिसका अर्थ है कि AI ने अभी भी सुंदर कला बनाई, बस बिना उन अवांछित हिस्सों के।
  • यह मजबूत है: भले ही लोगों ने "एडवर्सरियल" प्रॉम्प्ट्स (विशेष टेक्स्ट जो सुरक्षा फिल्टर को तोड़ने के लिए डिज़ाइन किए गए हैं) के साथ AI को धोखा देने की कोशिश की, यह स्टीयरिंग विधि अभी भी काम करती रही और छवियों को सुरक्षित रखा।

यह क्यों महत्वपूर्ण है

यह शोध पत्र सुझाव देता है कि यह समझने से कि AI के मस्तिष्क में छवि का "अर्थ" वास्तव में कहाँ रहता है (मध्य ब्लॉक), हम इसे अधिक सटीकता से नियंत्रित कर सकते हैं। AI को चीजें भूलने के लिए मजबूर करने के बजाय, हम इसे सुरक्षित और वांछित परिणामों की ओर धीरे से मोड़ सकते हैं।

लेखकों ने पाया कि यह "स्टीयरिंग वेक्टर" मजबूत है। चाहे उन्होंने किसी सेलिब्रिटी, किसी विशिष्ट कला शैली या नग्नता को मिटाने के लिए इसका उपयोग किया हो, यह विधि सफल रही। उन्होंने यह भी दिखाया कि आप इसका उपयोग जानबूझकर शैलियों को बदलने के लिए भी कर सकते हैं—जैसे कि वैन गॉग की पेंटिंग को कार्टून में बदलना—एक अलग स्टीयरिंग वेक्टर का उपयोग करके।

संक्षेप में, यह शोध पत्र शक्तिशाली AI आर्ट जनरेटरों को बिना उन्हें फिर से बनाए, सुरक्षित और अधिक नियंत्रणीय बनाने का एक हल्का और प्रभावी तरीका प्रदान करता है। यह कार को ठीक उसी दिशा में निर्देशित करने के लिए स्टीयरिंग व्हील को थपथपाने के सही स्थान को खोजने जैसा है, जहाँ आपको जाना है, बिना इंजन को बदले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →