← नवीनतम पेपर
🤖 machine learning

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

यह सर्वेक्षण विजन, लैंग्वेज, ऑडियो और वीडियो मोडैलिटीज में मल्टीमॉडल अनलर्निंग विधियों, डेटासेट्स और बेंचमार्क का एक एकीकृत, सिस्टम-ओरिएंटेड वर्गीकरण प्रस्तुत करता है, जो मॉडल की समग्र उपयोगिता को बनाए रखते हुए फाउंडेशन मॉडल्स से संवेदनशील या कॉपीराइट वाली जानकारी को चुनिंदा रूप से हटाने की चुनौती का समाधान करता है।

मूल लेखक: Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

प्रकाशित 2026-07-10
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक सुपर-स्मार्ट, सुपर-क्रिएटिव रोबोट दोस्त बनाया है जो एक साथ चित्र बना सकता है, कहानियाँ लिख सकता है, गाने गा सकता है और वीडियो बना सकता है। इस रोबोट ने पूरे इंटरनेट को पढ़कर सीखा है, लेकिन ऐसा करते समय इसने अनजाने में कुछ ऐसी चीजें भी याद कर लीं जो उसे नहीं सीखनी चाहिए थीं: शायद किसी पड़ोसी की निजी फोटो, किसी प्रसिद्ध कलाकार की कॉपीराइट वाली पेंटिंग, या कोई अजीब, असुरक्षित चुटकुला।

अब, वह पड़ोसी चाहता है कि उस फोटो को भुला दिया जाए, कलाकार चाहता है कि उसकी शैली (स्टाइल) मिटा दी जाए, और इंटरनेट चाहता है कि वह चुटकुला गायब हो जाए। इसे ठीक करने का पुराना तरीका खराब डेटा को हटाना और रोबोट को फिर से शून्य से बनाना था। लेकिन यह एक गगनचुंबी इमारत को हटाने के लिए उसे पूरी तरह ढहाने जैसा है—इसमें बहुत समय लगता है, भारी खर्च आता है, और यह अव्यावहारिक है।

यह शोध पत्र एक विशाल सर्वेक्षण (वर्तमान परिदृश्य का एक विशाल मानचित्र) है जो एक नए, स्मार्ट तरीके की खोज करता है: मल्टीमॉडल अनलर्निंग (Multimodal Unlearning)। पूरे रोबोट को फिर से बनाने के बजाय, ये तरीके "चयनात्मक विस्मरण" (selective forgetting) करने की कोशिश करते हैं, यानी केवल बुरी यादों को सर्जिकल तरीके से हटाना, जबकि रोबोट की चित्र बनाने, लिखने और गाने की क्षमता को पूरी तरह बरकरार रखना।

बड़ा मानचित्र: हम कहाँ कट लगाते हैं?

लेखक सभी अलग-अलग तरीकों को एक "सिस्टम-फर्स्ट" मानचित्र में व्यवस्थित करते हैं। केवल गणित को देखने के बजाय, वे इस बात पर ध्यान देते हैं कि आप रोबोट के मस्तिष्क में कब और कहाँ हस्तक्षेप करते हैं। उन्होंने इस सर्जरी को करने के लिए पाँच मुख्य स्थान पाए हैं:

  1. डेटा पक्ष (रोबोट के सीखने से पहले): कल्पना कीजिए कि रोबोट के देखने से पहले ही खराब फोटो या टेक्स्ट पर "इसे न सीखें" का स्टिकर लगा दिया जाए। कुछ तरीके डेटा को थोड़ा बदल देते हैं ताकि रोबोट इसे याद न कर सके, या वे प्रशिक्षण लाइब्रेरी को साफ कर देते हैं ताकि छवियों और शब्दों के "जहरीले" जोड़ों को हटाया जा सके।
  2. प्रशिक्षण-समय संपादन (जब रोबोट सीख रहा हो): यह रोबोट को पढ़ाई करते समय एक नया नियम सिखाने जैसा है। आप उसे बताते हैं, "हे, जब तुम इस विशिष्ट चीज़ को देखो, तो इसे याद मत करना, लेकिन बाकी सब याद रखना।" रोबोट अपने मस्तिष्क के भार (weights) को लक्ष्य को भूलने के लिए समायोजित करता है जबकि बाकी चीजों को थामे रखता है।
  3. आर्किटेक्चर बाधाएं (रोबोट के हार्डवेयर को बदलना): कभी-कभी, नियमों को बदलने के बजाय, आप रोबोट की संरचना को बदलते हैं। आप रोबोट के मस्तिष्क के कुछ हिस्सों को "फ्रीज" (लॉक) कर सकते हैं ताकि वे बदल न सकें, या उस विशिष्ट कनेक्शन को काट (प्रून) सकते हैं जो बुरी याद को थामे हुए है, फिर रोबोट को उस खाली जगह के आसपास अच्छी चीजों को फिर से सीखने दें।
  4. प्रशिक्षण-मुक्त अनलर्निंग (जादुई इरेज़र): यह सबसे शानदार हिस्सा है। ये तरीके रोबोट को फिर से प्रशिक्षित नहीं करते हैं। वे रोबोट के मस्तिष्क के भार या उसकी आंतरिक प्रस्तुतियों (जिस तरह से वह चीजों के बारे में "सोचता" है) को सीधे संपादित करने के लिए गणित का उपयोग करते हैं। यह एक विशिष्ट रासायनिक विलायक (solvent) का उपयोग करके कागज के बाकी हिस्से को छुए बिना केवल बुरी स्याही को घोलने जैसा है।
  5. डिकोडिंग समय (प्रदर्शन के दौरान): कल्पना कीजिए कि रोबोट एक चित्र बना रहा है। बिल्कुल आखिरी सेकंड में, चित्र दिखने से पहले, एक फ़िल्टर हस्तक्षेप करता है और कहता, "नहीं, वह विशिष्ट चेहरा मत बनाओ।" रोबोट का मस्तिष्क वही रहता है, लेकिन आउटपुट को वर्जित सामग्री से दूर ले जाया जाता है।

खेल के नियम

यह शोध पत्र बहुत स्पष्ट है कि ये तरीके क्या हासिल करने की कोशिश कर रहे हैं और वे क्या नहीं कर रहे हैं।

  • लक्ष्य: मुख्य लक्ष्य चयनात्मक निष्कासन (selective removal) है। आप एक विशिष्ट "विस्मरण सेट" (जैसे एक निजी चेहरा या कॉपीराइट शैली) को भूलना चाहते हैं जबकि "रिटेन सेट" (बाकी सब कुछ) को पूरी तरह से काम करने देना चाहते हैं। पेपर इसे गणितीय रूप से परिभाषित करता है: भूलने के बाद का रोबोट लगभग वैसा ही व्यवहार करना चाहिए जैसा कि वह रोबोट करता जिसने कभी उस खराब डेटा पर प्रशिक्षण ही नहीं लिया था।
  • जो वे खारिज करते हैं: पेपर स्पष्ट रूप से इस विचार के खिलाफ तर्क देता है कि आप बस डेटा को डिलीट कर दें और उम्मीद करें कि रोबोट स्वचालित रूप से भूल जाएगा। यह दिखाता है कि ज्ञान रोबोट के मस्तिष्क में फैला हुआ है; डेटा फाइल को डिलीट करने से स्मृति (मेमोरी) नहीं मिटती। यह इस विचार को भी खारिज करता है कि वर्तमान तरीके पूर्ण हैं। वे अक्सर अनुभवजन्य (heuristic) (ट्रायल और एरक और स्मार्ट अनुमानों पर आधारित) होते हैं, न कि इस बात के पक्के गणितीय प्रमाण कि मेमोरी 100% हमेशा के लिए चली गई है।
  • "अनलर्निंग" बनाम "छिपाना" का जाल: पेपर सुझाव देता है कि कुछ तरीके केवल जानकारी को छिपा रहे हैं, न कि वास्तव में मिटा रहे हैं। यदि आप रोबोट को सही "एडवर्सरियल" (प्रतिरोधी) सवालों के साथ उकसाते हैं (जैसे कि एक जेलब्रेक), तो भूली हुई याद वापस आ सकती है। पेपर नोट करता है कि हमारे पास कई तरीके तो हैं, लेकिन हमारे पास इस बात की गारंटी नहीं है कि मेमोरी वास्तव में मिट गई है, खासकर चतुर हमलों के खिलाफ।

टूलकिट: डेटासेट और बेंचमार्क

इन तरीकों का परीक्षण करने के लिए, शोधकर्ता विशिष्ट "प्रशिक्षण मैदानों" का उपयोग करते हैं। पेपर में उपयोग किए जाने वाले कई डेटासेट सूचीबद्ध हैं:

  • चेहरों के लिए: वे CelebA (2,02,599 छवियां) और VGGFace2 (3.3 मिलियन चेहरे की छवियां) जैसे डेटासेट का उपयोग करते हैं ताकि यह परीक्षण किया जा सके कि क्या रोबोट किसी विशिष्ट व्यक्ति के चेहरे को भूल सकता है।
  • कॉपीराइट के लिए: वे UnlearnCanvas (60 कलात्मक शैलियाँ) का उपयोग करते हैं ताकि यह देखा जा सके कि क्या रोबोट किसी विशिष्ट कलाकार की शैली को भूल सकता है।
  • सुरक्षा के लिए: वे I2P (4,700 प्रॉम्प्ट्स) जैसे डेटासेट का उपयोग करते हैं ताकि यह परीक्षण किया जा सके कि क्या रोबलेट असुरक्षित या अनुचित सामग्री उत्पन्न करना भूल सकता है।
  • ऑडियो के लिए: वे VoxCeleb1 (1,50,000 कथनों) का उपयोग करते हैं ताकि यह परीक्षण किया जा सके कि क्या रोबोट किसी विशिष्ट वक्ता की आवाज़ को भूल सकता है।

पेपर उन बेंचमार्क (जैसे MU-Bench और MLLMU-Bench) को भी रेखांकित करता है जिनका उपयोग यह मापने के लिए किया जाता है कि ये तरीके कितने प्रभावी हैं। ये बेंचमार्क तीन चीजें जांचते हैं:

  1. क्या इसने भुला दिया? (क्या रोबोट उस बुरी चीज़ को पहचानने में विफल रहता है?)
  2. क्या इसने अच्छी चीजों को बनाए रखा? (क्या रोबोट अभी भी बाकी सब कुछ के बारे में चित्र बनाने और लिखने में सक्षम है?)
  3. क्या यह सुरक्षित है? (क्या कोई हैकर रोबोट को उस बुरी चीज़ को फिर से याद करने के लिए धोखा दे सकता है?)

वास्तविकता की जाँच: क्या अभी भी टूटा हुआ है?

लेखक ईमानदार हैं कि कमियां मौजूद हैं। वे सुझाव देते हैं कि हालांकि हमारे पास कई शानदार उपकरण हैं, लेकिन हम अभी भी "शुरुआती दिनों" में हैं।

  • कोई जादुई गारंटी नहीं: अधिकांश तरीके सिम्युलेटेड हैं या विशिष्ट मॉडलों पर परीक्षण किए गए हैं। हमारे पास कोई सार्वभौमिक गणितीय प्रमाण नहीं है जो कहता है, "यह तरीका हमेशा मेमोरी को हमेशा के लिए मिटा देगा, चाहे कुछ भी हो।"
  • "पुनरुत्थान" (Resurfacing) की समस्या: पेपर सुझाव देता है कि जनरेटिव मॉडल (जैसे इमेज क्रिएटर) में, भूई हुई अवधारणाएं फिर से उभर सकती हैं यदि रोबोट को बाद में फाइन-ट्यून किया जाता है या यदि कोई चतुर प्रॉम्प्ट का उपयोग करता है। यह एक गाना भूलने जैसा है, लेकिन फिर एक समान धुन सुनकर उसे फिर से याद कर लेना।
  • समझौता (Trade-off): अक्सर एक समझौता होता है। आप जितनी आक्रामक तरीके से भूलने की कोशिश करेंगे, उतना ही आप रोबोट की अन्य चीजें करने की क्षमता को नुकसान पहुँचा सकते हैं। पेपर नोट करता है कि बहुत कम डेटा को डिलीट करने से भी अन्य कार्यों पर प्रदर्शन में गिरावट आ सकती है।
  • क्रॉस-मोडलिटी लीक: यदि आप रोबोट को छवियों में एक चेहरा भूलने के लिए सिखाते हैं, तो क्या वह टेक्स्ट विवरणों में भी उस चेहरे को भूल जाता है? पेपर सुझाव देता है कि यह एक बड़ी खुली चुनौती है; एक मोड (टेक्स्ट) में सुरक्षा का मतलब दूसरे मोड (इमेज) में सुरक्षा नहीं है।

निचोड़

यह पेपर एक सर्वेक्षण है, जिसका अर्थ है कि यह एक नया आविष्कार नहीं, बल्कि एक व्यापक मार्गदर्शिका है कि वर्तमान में क्या मौजूद है। यह "AI को कैसे भुलाने दें" की अराजकता को एक स्पष्ट प्रणाली में व्यवस्थित करता है। यह सुझाव देता है कि हमारे पास AI मॉडल पर "सर्जरी" करने के शक्तिशाली उपकरण हैं, लेकिन हम अभी भी यह समझने की कोशिश कर रहे हैं कि इस सर्जरी को 100% विश्वसनीय, हैकर्स के लिए सुरक्षित और रोबोट के मस्तिष्क के बाकी हिस्सों को नुकसान न पहुँचाने के लिए सटीक कैसे बनाया जाए।

लेखक एक क्यूरेटेड रिपॉजिटरी (कोड और डेटा का एक सार्वजनिक संग्रह) जारी कर रहे हैं ताकि अन्य लोग इस पर आगे बढ़ सकें। वे आशावादी हैं कि समस्याओं को मैप करके—जैसे कि बेहतर बेंचमार्क और मजबूत गारंटी की आवश्यकता—हम अंततः ऐसा AI बना पाएंगे जो गोपनीयता और कॉपीराइट का सम्मान करता है, बिना हर बार किसी के भूलने के अनुरोध पर उसे फिर से शून्य से बनाने की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →