← नवीनतम पेपर
🤖 machine learning

A Model Merging Approach for Continual MLLM Unlearning

यह शोध पत्र MCU को प्रस्तुत करता है, जो एक मॉडल मर्जिंग दृष्टिकोण है जो निरंतर मल्टीमॉडल अनलर्निंग (continual multimodal unlearning) की चुनौतियों को प्रभावी ढंग से संबोधित करने के लिए क्रॉस-टास्क डिपेंडेंसी मैनेजमेंट के माध्यम से इंटरफेरेंस को कम करने और उपयोगिता को बनाए रखने हेतु कई वन-शॉट अनलर्निंग एडेप्टर को एक एकीकृत मॉडल में गतिशील रूप से एकीकृत करता है।

मूल लेखक: Yuhang Wang, Linlin Zhang, Haoxuan Ji, Xianmin Ye, Zhenxing Niu, Haichang Gao

प्रकाशित 2026-08-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhang Wang, Linlin Zhang, Haoxuan Ji, Xianmin Ye, Zhenxing Niu, Haichang Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट दोस्त बनाया है जो तस्वीरें देख सकता है, टेक्स्ट पढ़ सकता है और लगभग किसी भी चीज़ के बारे में बात कर सकता है। यह रोबोट एक "मल्टीमॉडल लार्ज लैंग्वेज मॉडल" (MLLM) है। यह अविश्वसनीय रूप से प्रतिभाशाली है, लेकिन कभी-कभी यह ऐसी चीजें सीख लेता है जो इसे नहीं सीखनी चाहिए—जैसे कि निजी रहस्य, कॉपीराइट वाली कहानियाँ, या पुराना तथ्य। AI की दुनिया में, इन रोबोटों को विशिष्ट बुरी या संवेदनशील जानकारी को "अनलर्न" (भूलने) के लिए सिखाने की बढ़ती आवश्यकता है, बिना उनके द्वारा सीखी गई बाकी चीजों को भुलाए। इसे ऐसे समझें जैसे आप अपने पसंदीदा स्वेटर से एक विशिष्ट दाग हटाने की कोशिश कर रहे हैं, बिना पूरे कपड़े को सिकोड़े या उसके पैटर्न को खराब किए।

लंबे समय तक, वैज्ञानिकों ने ऐसा करने के लिए रोबोट के मस्तिष्क पर "रीसेट" बटन दबाने की कोशिश की जब भी कोई नई जानकारी मिटाने की आवश्यकता होती थी। लेकिन समस्या यह है कि यदि आप बार-बार रीसेट बटन दबाते रहते हैं, तो रोबोट भ्रमित होने लगता है। वह उस चीज़ को भूल सकता है जिसे आपने उसे भूलने के लिए कहा था, या इससे भी बुरा, वह उन चीजों को भूल सकता है जिन्हें उसे याद रखना चाहिए था, जैसे कि चुटकुला कैसे सुना जाए या बिल्ली की पहचान कैसे की जाए। इसे "अनलर्निंग रीबाउंड" (unlearning rebound) और "रिटेंशन ड्रिफ्ट" (retention drift) कहा जाता है। रोबोट जितना अधिक सुधारने की कोशिश की जाती है, वह उतना ही खराब रोबोट बनता जाता है। यह शोध पत्र इस उलझन भरी समस्या को हल करता है कि कैसे एक रोबोट को साफ और तेज रखा जाए जब आपको एक लंबी, कभी न खत्म होने वाली गुप्त सूचनाओं की सूची को एक-एक करके मिटाना हो।

यहाँ आता है MCU (मर्जिंग फॉर कॉन्टिनुअल अनलर्निंग), एक चतुर नया दृष्टिकोण जिसे शोधकर्ता युहांग वांग और उनकी टीम ने प्रस्तावित किया है। रोबोट के मस्तिष्क को लगातार फिर से लिखने के बजाय, जो इतनी सारी उलझन और नुकसान का कारण बनता है, MCU प्रत्येक "भूलने के अनुरोध" को एक अलग, छोटे निर्देश मैनुअल की तरह मानता है। कल्पना कीजिए कि आपके पास स्टिकी नोट्स का एक ढेर है, जिनमें से प्रत्येक रोबोट को एक अलग रहस्य भूलने के लिए कहता है। पुराने तरीके इन नोट्स को एक-एक करके रोबोट के मस्तिष्क पर चिपकाने की कोशिश करते हैं, जिससे अंततः मस्तिष्क कागजों के एक अस्त-व्यस्त, विरोधाभासी ढेर से ढक जाता है।

MCU एक अलग, अधिक व्यवस्थित दृष्टिकोण अपनाता है। यह उन सभी स्टिकी नोट्स (जिन्हें शोधकर्ता "एडेप्टर" कहते हैं) को इकट्ठा करता है और उन्हें रोबोट पर लागू करने से पहले एक एकल, उत्तम निर्देश शीट में मिला देता है। जादू इस बात में है कि वे इन नोट्स को कैसे मिलाते हैं। शोधकर्ताओं ने पाया कि ये "भूलने वाले नोट्स" अलग-थलग नहीं हैं; वे वास्तव में एक-दूसरे से बात करते हैं। कभी-कभी, दो नोट्स एक-दूसरे को बेहतर ढंग से भूलने में मदद करते हैं (सिनर्जी/synergy), लेकिन अन्य समय में, वे आपस में लड़ते हैं और एक-दूसरे को रद्द कर देते हैं (इंटरफेरेंस/interference), या वे गलती से अच्छी यादों के साथ बुरी यादों को भी मिटा देते हैं।

इसे हल करने के लिए, MCU एक मास्टर शेफ की तरह काम करता है जो सामग्रियों को मिलाता है। सबसे पहले, यह नोट्स को देखता है और केवल सबसे महत्वपूर्ण हिस्सों को रखता है, कमजोर और धुंधले रेखांकनों को बाहर निकाल देता है (इसे "डोमिनेंट डायरेक्शन सिलेक्शन" कहा जाता है)। फिर, यह जांचता है कि क्या कोई एक नोट बहुत जोर से चिल्ला रहा है और दूसरों को दबा रहा है, और धीरे से उसका वॉल्यूम कम कर देता है (यह "चैनल कैपेसिटी कंट्रोल" है)। अंत में, और सबसे महत्वपूर्ण बात, यह नोट्स को इस तरह से पुनर्व्यवस्थित करता है कि सहायक नोट्स एक साथ मिलकर काम करें जबकि लड़ने वाले नोट्स अलग रहें, जिससे यह सुनिश्चित हो सके कि वे रोबोट के अन्य कौशल को खराब न करें।

टीम ने दो प्रमुख बेंचमार्क, ICU-Bench और MLLMU-Bench पर इसका परीक्षण किया, जो AI अनलर्निंग के लिए विशाल बाधा दौड़ की तरह हैं। उन्होंने प्रयोग किया जहाँ रोबोट को क्रमवार 100 अलग-अलग चीजें भूलनी थीं। परिणाम प्रभावशाली थे। जबकि अन्य तरीके ढहने लगे, अच्छी चीजों को भूलने लगे या भूलने में विफल रहे जैसे-जैसे सूची लंबी होती गई, MCU स्थिर रहा। उदाहरण के लिए, Qwen2-VL-7B मॉडल पर 100 कार्यों के बाद, MCU ने "फॉरगेट" स्कोर (जिसका अर्थ है कि उसने सफलतापूर्वक बुरी जानकारी मिटा दी) को लगभग 28.7 तक कम कर दिया, जबकि "रिटेन" स्कोर (कि उसने अपनी सामान्य बुद्धिमत्ता को कितनी अच्छी तरह बनाए रखा) को 75.6 पर उच्च रखा। इसके विपरीत, अन्य तरीकों में रिटेंशन स्कोर काफी गिर गया या उनका अनलर्निंग अप्रभावी हो गया।

यह शोध पत्र सुझाव देता है कि इन अनलर्निंग निर्देशों को क्रमवार लागू करने के बजाय बुद्धिमानी से मर्ज करने से, हम रोबोट को बहुत अधिक डिलीशन के बाद "ब्रेन फॉग" (दिमागी धुंध) होने से रोक सकते हैं। यह एक तरीका है जिससे AI की मेमोरी साफ और उसका दिमाग तेज रखा जा सकता है, जो यह साबित करता है कि मशीन को ठीक करने के लिए उसे तोड़ना जरूरी नहीं है। लेखक दिखाते हैं कि यह तरीका बिना पूरे मॉडल को शुरू से फिर से प्रशिक्षित किए काम करता है, जो इसे एक सुरक्षित और अपडेटेड AI रखने के लिए एक व्यावहारिक उपकरण बनाता है, जहाँ गोपनीयता और कॉपीराइट मायने रखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →