← नवीनतम पेपर
💻 computer science

Projected Gradient Unlearning for Text-to-Image Diffusion Models: Defending Against Concept Revival Attacks

यह शोध पत्र टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल्स के लिए प्रोजेक्टेड ग्रेडिएंट अनलर्निंगिंग (PGU) प्रस्तुत करता है, जो एक पोस्ट-हॉक हार्डनिंग तकनीक है जो ग्रेडिएंट अपडेट्स को रिटेन कॉन्सेप्ट एक्टिवेशन्स के ऑर्थोगोनल कॉम्प्लीमेंट में प्रोजेक्ट करती है ताकि बाद के फाइन-ट्यूनिंग के दौरान कॉन्सेप्ट रिवाइवल को प्रभावी ढंग से रोका जा सके और मौजूदा विधियों की तुलना में कम्प्यूटेशनल लागत को काफी कम किया जा सके।

मूल लेखक: Aljalila Aladawi, Mohammed Talha Alam, Fakhri Karray

प्रकाशित 2026-04-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aljalila Aladawi, Mohammed Talha Alam, Fakhri Karray

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट कलाकार (एक AI) है जिसने दुनिया की हर चीज़ को पेंट करना सीख लिया है। लेकिन, कानूनी या नैतिक कारणों से, आपको उस कलाकार को कुछ विशिष्ट चीज़ों को पेंट करना "भुलवाना" होगा, जैसे कि किसी प्रसिद्ध कलाकार की शैली (वैन गॉग) या कोई विशिष्ट वस्तु (एक गोल्फ बॉल)।

आप एक विशेष "इरेज़र" (मिटाने वाले साधन) का उपयोग करते हैं ताकि उसका वह ज्ञान मिटाया जा सके। लेकिन, समस्या यह है कि यदि आप बाद में कलाकार को कुछ नया सीखने के लिए कहते हैं (फाइन-ट्यूनिंग), तो पुराना मिटाया गया ज्ञान जादू की तरह वापस आ जाता है। यह बिल्कुल वैसा ही है जैसे केक बनाने के बाद उसमें से मैदा वापस निकालना; यदि आप नए तत्व मिलाते हैं, तो पुराना मैदा फिर से दिखाई दे सकता है।

यह शोध पत्र एक नई रक्षा प्रणाली पेश करता है जिसे प्रोजेक्टेड ग्रेडिएंट अनलर्निंगिंग (PGU) कहा जाता है, ताकि इस "कॉन्सेप्ट रिवाइवल" (अवधारणा के पुनरुद्धार) को रोका जा सके। यह कैसे काम करता है, इसका सरल विवरण यहाँ दिया गया है:

1. समस्या: "द घोस्ट इन द मशीन" (मशीन में छिपी आत्मा)

AI को विचारों के एक विशाल पुस्तकालय के रूप में सोचें। जब आप उसे वैन गॉग को "भूलने" के लिए कहते हैं, तो वह वैन गॉग के बारे में किताबों को हटाने की कोशिश करता है। हालाँकि, पुस्तकालय अव्यवस्थित है। वैन गॉग के बारे में किताबें "पेंटिंग", "रंगों" और "कला" की किताबों के साथ मिली हुई हैं।

यदि आप बाद में AI को "आधुनिक कला" के बारे में सीखने के लिए कहते हैं, तो वह गलती से वैन गॉग की किताबों को फिर से खोज लेता है क्योंकि वे अभी भी "पेंटिंग" वाले हिस्से में छिपी हुई थीं। इसे कॉन्सेप्ट रिवाइवल (Concept Revival) कहा जाता है।

2. समाधान: "गार्जियन सबस्पेस" (PGU)

लेखक एक चतुर तरकीब का प्रस्ताव देते हैं। केवल बुरी चीज़ों को फिर से मिटाने के बजाय, वे AI और किसी भी नई सीख के बीच एक सुरक्षा गार्ड खड़ा करते हैं।

यहाँ इसका उदाहरण दिया गया है:

  • "रिटेन" (बचाए जाने वाले) कॉन्सेप्ट्स: कल्पना करें कि आप AI की "सूर्यास्त" (sunsets) पेंट करने की क्षमता को सुरक्षित रखना चाहते हैं (जो कि अच्छी बात है)। आप सूर्यास्त के कुछ ऐसे उदाहरण चुनते हैं जो दिखने में उस चीज़ के समान हैं जिसे आप मिटाना चाहते हैं (उदाहरण के लिए, यदि आप "वैन गॉग" को मिटाना चाहते हैं, तो आप "सूर्यास्त" चुनते हैं क्योंकि उनमें समान ब्रशस्ट्रोक और रंग होते हैं)।
  • "कोर ग्रेडिएंट स्पेस" (CGS): AI देखता है कि वह इन "सूर्यास्त" को कैसे प्रोसेस करता है और उसके दिमाग में एक विशिष्ट "सुरक्षित क्षेत्र" (safe zone) का मानचित्र बनाता है। इस क्षेत्र में वे सभी दिशाएँ शामिल हैं जिनकी आवश्यकता AI को सूर्यास्त को सही ढंग से पेंट करने के लिए होती है।
  • "प्रोजेक्शन" (जादुई कदम): अब, जब AI कुछ नया सीखने की कोशिश करता है (जैसे "आधुनिक कला"), तो सुरक्षा गार्ड उस नए सबक की जाँच करता है।
    • यदि नया सबक AI को ऐसी दिशा में ले जाने की कोशिश करता है जो गलती से "वैन गॉग" को वापस ला सकता है, तो गार्ड उसे रोक देता है
    • गार्ड AI को केवल उन दिशाओं में सीखने के लिए मजबूर करता है जो "वैन गॉग" के पथ के पूरी तरह से लंबवत (90-डिग्री के कोण पर) हैं।
    • परिणाम: AI नई चीज़ को पूरी तरह से सीखता है, लेकिन उसके लिए मिटाए गए कॉन्सेप्ट को गलती से फिर से सीखना भौतिक रूप से असंभव हो जाता है। यह उत्तर (North) की ओर चलने की कोशिश करने जैसा है जबकि आपको केवल पूर्व (East) की ओर बढ़ने के लिए मजबूर किया जा रहा हो; आप कभी भी उत्तर के पथ पर वापस नहीं जा सकते।

3. "विजुअल" (दृश्य) "मीनिंग" (अर्थ) से अधिक महत्वपूर्ण क्यों है

शोधकर्ताओं ने यह पता लगाया कि "सुरक्षित क्षेत्र" (रिटेन कॉन्सेप्ट्स) चुनने के बारे में एक आश्चर्यजनक बात क्या है।

  • गलत तरीका (सिमेंटिक/अर्थ संबंधी): यदि आप "गोल्फ बॉल्स" को मिटाना चाहते हैं, तो आप सोच सकते हैं, "मैं 'टेनिस बॉल्स' को रखूँगा क्योंकि वे दोनों खेल की गेंदें हैं।"
    • क्यों विफल होता है: AI के लिए, एक टेनिस बॉल और एक गोल्फ बॉल बहुत अलग दिखते हैं (एक रोएँदार और पीला है, दूसरा सफेद और गड्ढों वाला है)। वे AI के मस्तिष्क के अलग-अलग हिस्सों में रहते हैं।
  • सही तरीका (विजुअल/दृश्य संबंधी): आपको ऐसी चीज़ें चुननी चाहिए जो दिखने में समान हों, जैसे "मार्बल्स" (कंचे), "अंडे", या "मोती"।
    • क्यों काम करता है: ये सभी गोल, सफेद और चिकने हैं। ये AI के मस्तिष्क में ठीक उन्हीं "आकार" और "बनावट" (texture) वाले न्यूरॉन्स को सक्रिय करते हैं। इन्हें सुरक्षित करके, आप एक ऐसी दीवार बनाते हैं जो "गोल्फ बॉल" के न्यूरॉन्स को भी कवर करती है।

उदाहरण: यदि आप एक विशिष्ट प्रकार के चोर (गोल्फ बॉल) को रोकना चाहते हैं, तो आप "खेल" के दरवाजे की रखवाली नहीं करते। आप "गोल और सफेद" के दरवाजे की रखवाली करते हैं, क्योंकि चोर वहीं रहता है।

4. गति और दक्षता

यह शोध पत्र एक अन्य उच्च-तकनीकी रक्षा पद्धति "मेटा-अनलर्निंग" (Meta-Unlearning) से इसकी तुलना करता है।

  • मेटा-अनलर्निंग एक ऐसी टीम को काम पर रखने जैसा है जो किसी भी संभावित तरीके को सिम्युलेट करती है जिससे कोई मिटाए गए कॉन्सेप्ट को वापस ला सकता है, इससे पहले कि आप शुरू भी करें। यह अविश्वसनीय रूप से गहन है लेकिन इसमें 2 घंटे लगते हैं और इसके लिए विशाल सुपरकंप्यूटर की आवश्यकता होती है।
  • PGU एक स्मार्ट लॉक लगाने जैसा है जो संदिग्ध गतिविधियों को स्वचालित रूप से रोकता है। इसमें केवल 6 मिनट लगते हैं और यह एक सामान्य कंप्यूटर पर चल सकता है।

5. यह कब सबसे अच्छा काम करता है?

शोध पत्र ने पाया कि सबसे अच्छा टूल इस बात पर निर्भर करता है कि आप क्या मिटा रहे हैं:

  • शैलियों (जैसे वैन गॉग) के लिए: PGU एक सुपरहीरो है। शैलियाँ AI के मस्तिष्क में फैली होती हैं (एक जटिल रेसिपी की तरह)। PGU का "गार्ड" उन सभी रास्तों को ब्लॉक कर देता है जो उस शैली को वापस ला सकते हैं।
  • वस्तुओं (जैसे गोल्फ बॉल्स) के लिए: PGU बहुत अच्छा है, लेकिन पूर्ण नहीं। वस्तुएं AI के मस्तिष्क में एक बहुत ही विशिष्ट, सघन स्थान पर संग्रहीत होती हैं। कभी-कभी, "गार्ड" इन विशिष्ट वस्तुओं के लिए हमले के हर कोण को ब्लॉक नहीं कर पाता है। ऐसी स्थितियों में, धीमी और भारी "मेटा-अनलर्निंग" विधि बेहतर हो सकती है।

निष्कर्ष

यह शोध पत्र हमें AI मॉडल को "हार्डन" (मजबूत) करने का एक तेज़ और कुशल तरीका देता है। एक बार जब आप एक बुरे कॉन्सेप्ट को मिटा देते हैं, तो आप इस 6 मिनट की प्रक्रिया को चलाकर यह सुनिश्चित कर सकते हैं कि आप भविष्य में AI को जो भी नया डेटा खिलाएं, वह बुरा कॉन्सेप्ट हमेशा के लिए मिटा रहे। यह "वर्जित ज्ञान" के कमरे के दरवाजे पर स्थायी ताला लगाने जैसा है, ताकि यदि आप घर का नवीनीकरण भी करें, तो भी दरवाजा बंद ही रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →