← नवीनतम पेपर
🤖 machine learning

TILDE: TILt-based Distributional Erasure for Concept Unlearning

यह शोध पत्र TILDE का प्रस्ताव करता है, जो टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल में कॉन्सेप्ट अनलर्निंग (concept unlearning) के लिए एक नया फ्रेमवर्क है, जो इस कार्य को एक वितरण संरेखण समस्या (distributional alignment problem) के रूप में तैयार करता है ताकि अवांछित अवधारणाओं को प्रभावी ढंग से दबाते हुए सौहार्दपूर्ण डेटा पर मॉडल की गुणवत्ता, विविधता और सिमेंटिक कवरेज को संरक्षित किया जा सके।

मूल लेखक: Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji

प्रकाशित 2026-07-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक मास्टर शेफ है जिसने दुनिया के हर व्यंजन को बनाना सीख लिया है, जिसमें एक विशिष्ट, विवादास्पद सामग्री (मान लीजिए, "स्पाइसी घोस्ट पेपर्स") की रेसिपी भी शामिल है, जिसे अब आप उनके कौशल से पूरी तरह हटाना चाहते हैं।

समस्या पेचीदा है: यदि आप शेफ से सिर्फ यह कहते हैं, "घोस्ट पेपर के व्यंजन बनाना बंद करो," तो वे भ्रमित हो सकते हैं और अन्य व्यंजनों को भी खराब करना शुरू कर सकते हैं। शायद वे सामान्य टमाटर सूप बनाना भी भूल जाएं क्योंकि वह भी लाल है, या वे कोई भी तीखा व्यंजन बनाना ही बंद कर दें। यह कॉन्सेप्ट अनलर्निंग (Concept Unlearning) की मुख्य चुनौती है: आप एक AI इमेज जनरेटर को एक विशिष्ट चीज़ (जैसे किसी सेलिब्रिटी का चेहरा, किसी विशेष कलाकार की शैली, या किसी कॉपीराइट वाले पात्र) को भूलने के लिए कैसे प्रेरित करते हैं बिना उसकी बाकी सब कुछ बनाने की क्षमता को बिगाड़े?

यह शोध पत्र एक नई विधि पेश करता है जिसे TILDE (TILt-based Distributional Erasure) कहा जाता है ताकि इसे हल किया जा सके। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

1. पुराना तरीका: "मेज को तोड़ना" बनाम "ऊपर पेंट करना"

पिछले तरीकों ने कॉन्सेप्ट को अनलर्न करने के दो मुख्य तरीके आजमाए, जिनमें दोनों में कमियां थीं:

  • डायरेक्ट सप्रेशन (Direct Suppression): कल्पना कीजिए कि आप शेफ को घोस्ट पेपर के बजाय रोकने की कोशिश कर रहे हैं और जब भी वे मसालों के जार की ओर हाथ बढ़ाते हैं, तो आप "नहीं!" चिल्लाकर उन्हें रोकते हैं। यह अक्सर शेफ को घबरा देता है और वे कोई भी तीखा व्यंजन बनाना ही छोड़ देते हैं, जिससे साधारण मिर्च जैसे अच्छे व्यंजन भी खराब हो जाते हैं।
  • एंकर रिप्लेसमेंट (Anchor Replacement): कल्पना कीजिए कि आप शेफ को कहते हैं, "घोस्ट पेपर के बजाय, बस रेगुलर पेपर का उपयोग करें।" यह काम तो करता है, लेकिन यह शेफ को अपनी शैली बदलने के लिए मजबूर करता है ताकि वह "रेगुलर पेपर" के व्यंजन से मेल खा सके। यह वैसा ही है जैसे किसी चित्रकार को वैन गॉग (Van Gogh) को छोड़कर मोनेट (Monet) बनने के लिए मजबूर करना, सिर्फ इसलिए कि वह वैन गॉग को चित्रित करना बंद कर दे।

2. TILDE का समाधान: "एक अदृश्य फिल्टर"

TILDE एक अलग दृष्टिकोण अपनाता है। "नहीं" चिल्लाने या एक नई शैली थोपने के बजाय, यह शेफ के दिमाग पर एक स्मार्ट फिल्टर बनाता है।

सोचिए कि AI का ज्ञान संभावनाओं का एक विशाल परिदृश्य (landscape) है।

  • "घोस्ट पेपर" ज़ोन: इस परिदृश्य में एक विशिष्ट क्षेत्र है जहाँ अवांछित कॉन्सेप्ट की छवियां रहती हैं।
  • "सुरक्षित" ज़ोन: बाकी सब जगह सुंदर, सुरक्षित छवियां (benign concepts) भरी हुई हैं।

TILDE "घोस्ट पेपर" ज़ोन को हटाने या शेफ को किसी विशिष्ट "रेगुलर पेपर" ज़ोन की ओर जाने के लिए मजबूर करने की कोशिश नहीं करता है। इसके बजाय, यह धीरे से परिदृश्य को झुकाता (tilt) है

  • यह "घोस्ट पेपर" क्षेत्र को एक ढलान वाली, फिसलन भरी पहाड़ी जैसा बना देता है जिससे शेफ स्वाभाविक रूप से दूर फिसल जाता है।
  • महत्वपूर्ण बात यह है कि यह बाकी परिदृश्य को नहीं झुकाता। "सुरक्षित" ज़ोन पहले की तरह ही सपाट और आरामदायक रहते हैं। शेफ अभी भी सुरक्षित ज़ोन में बिल्कुल वैसे ही घूम सकता है जैसे वह पहले करता था।

इसे "डिस्ट्रीब्यूशनल एलाइनमेंट" (Distributional Alignment) कहा जाता है। लक्ष्य एक नया गंतव्य ढूंढना नहीं है; बल्कि यह सुनिश्चित करना है कि अवांछित गंतव्य अप्राप्य हो जाए जबकि बाकी का नक्शा बिल्कुल वैसा ही रहे जैसा वह पहले था।

3. इसे कैसे पता चलता है कि किसे बचना है: "CLIP स्कोर"

AI को कैसे पता चलता है कि कौन सी छवियां "घोस्ट पेपर" हैं और कौन सी केवल "लाल टमाटर" हैं?
TILDE CLIP (एक प्रणाली जो टेक्स्ट और इमेज के बीच संबंध को समझती है) को एक सुरक्षा गार्ड के रूप में उपयोग करता है।

  • गार्ड के पास अवांछित कॉन्सेप्ट के विवरणों की एक सूची है (जैसे, "पिकाचू," "पीला पोकेमोन")।
  • जब AI एक इमेज बना रहा होता है, तो गार्ड चेक करता है: "क्या यह पिकाचू जैसा दिखता है?"
  • थ्रेशोल्ड (Threshold): यही असली जादू है। गार्ड केवल तभी अलार्म बजाता है जब इमेज बहुत स्पष्ट रूप से पिकाचू जैसी हो। यदि कोई इमेज सिर्फ "एक पीला कार्टून" है लेकिन पूरी तरह पिकाचू नहीं है, तो गार्ड कहता है, "यह ठीक है, जारी रखें।"
  • यह AI को उन निर्दोष छवियों को दंडित करने से रोकता है जो दिखने में थोड़ी बहुत forbidden concept जैसी हो सकती हैं।

4. प्रशिक्षण प्रक्रिया: "सुधार को सीखना"

पूरे शेफ को फिर से प्रशिक्षित करने के बजाय (जिसमें बहुत समय लगता है), TILDE रेसिड्यूअल GFlowNet (Residual GFlowNet) नामक तकनीक का उपयोग करता है।

  • कल्पना कीजिए कि शेफ पहले से ही 99% व्यंजन पूरी तरह से बनाना जानता है।
  • TILDE केवल एक छोटे सहायक (एक "रेसिड्यूअल" नेटवर्क) को प्रशिक्षित करता है जिसका एकमात्र काम शेफ को सुधार के लिए फुसफुसाना है।
  • यदि शेफ "घोस्ट पेपर" वाले व्यंजन की ओर बढ़ने लगता है, तो सहायक फुसफुसाता है, "हे, वह रास्ता एक वर्जित क्षेत्र की ओर जाता है, थोड़ा बाईं ओर मुड़ें।"
  • यदि शेफ एक सुरक्षित व्यंजन बना रहा है, तो सहायक चुप रहता है।
  • क्योंकि सहायक केवल सुधार के लिए फुसफुसाता है, शेफ के मूल कौशल बरकरार रहते हैं, और वह सुरक्षित व्यंजनों को बनाना नहीं भूलता है।

परिणाम

इस शोध पत्र का परीक्षण विशिष्ट कलाकारों (वैन गॉग), पात्रों (पिकाचू), और वस्तुओं को हटाने पर किया गया।

  • सफलता: TILDE ने अवांछित कॉन्सेप्ट उत्पन्न करने से AI को सफलतापूर्वक रोका (लगभग 100% सफलता)।
  • कोई नुकसान नहीं (No Collateral Damage): अन्य तरीकों के विपरीत, TILDE ने संबंधित चीजों को बनाने की AI की क्षमता को नहीं बिगाड़ा। उदाहरण के लिए, "वैन गॉग" को अनलर्न करने के बाद भी, AI अभी भी "इंप्रेशनिस्ट" (Impressionist) शैली की कला पूरी तरह से बना सकता था।
  • विविधता: AI "ऊब" नहीं गया और केवल एक प्रकार की सुरक्षित इमेज बनाने तक सीमित नहीं रहा; इसने अपने सुरक्षित आउटपुट की पूरी विविधता को बनाए रखा।

सारांश

TIL-DE एक कोमल, अदृश्य हाथ की तरह है जो AI को किसी विशिष्ट अवांछित विचार से दूर ले जाता है, बिना उसे किसी नए, जबरन विचार में धकेले या उसके बाकी सब कुछ करने की क्षमता को बिगाड़े। यह अवांछित छवियों को उत्पन्न करने की संभावना को गणितीय रूप से शून्य के करीब "झुकाकर" (tilting) करता है, जबकि सभी अच्छी छवियों की संभावना को बिल्कुल वहीं छोड़ देता है जहाँ वह पहले थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →