← नवीनतम पेपर
🤖 AI

Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning

यह शोध पत्र विजुअल-नॉइज़ गाइडेड इन-कॉन्टेक्स्ट डिस्टिलेशन (VGID) का प्रस्ताव करता है, जो एक ट्रेनिंग-फ्री फ्रेमवर्क है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए एक टीचर डिस्ट्रीब्यूशन जनरेट करने हेतु विजुअल परटर्बेशन और टेक्स्टुअल इन-कॉन्टेक्स्ट अनलर्निंग को जोड़ता है, जो मॉडल की सामान्य उपयोगिता को बनाए रखते हुए पैरामीटर स्तर पर संवेदनशील ज्ञान को प्रभावी ढंग से हटा देता है।

मूल लेखक: Junkai Chen, Yuhao He, Junxiang You, Ruiqi Liu, Chenyu Wang, Shu Wu

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junkai Chen, Yuhao He, Junxiang You, Ruiqi Liu, Chenyu Wang, Shu Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सर्वज्ञ रोबोट सहायक (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल) है जिसने इंटरनेट पर लगभग सब कुछ पढ़ लिया है और अरबों तस्वीरों को देखा है। यह अविश्वसनीय रूप से सहायक है, लेकिन क्योंकि इसने पूरी वेब दुनिया से सीखा है, इसलिए यह कभी-कभी ऐसी चीजें याद रख लेता है जिन्हें उसे नहीं याद रखना चाहिए—जैसे कि विशिष्ट लोगों के निजी विवरण, कॉपीराइट वाली कला, या असुरक्षित निर्देश।

समस्या यह है: आप रोबोट को ये विशिष्ट बुरी यादें कैसे भुला सकते हैं बिना उसके पूरे दिमाग को मिटाए या उसे मूर्ख बनाए बिना?

यह पेपर एक नई विधि पेश करता है जिसे VGID (विजुअल-नॉइज़ गाइडेड इन-कॉन्टेक्स्ट डिस्टिलेशन) कहा जाता है ताकि इस समस्या को हल किया जा सके। यह कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से समझाया गया है।

समस्या: "एक-हाथ वाला" दृष्टिकोण (The "One-Handed" Approach)

पिछली विधियों ने इसे दो तरीकों से ठीक करने की कोशिश की, लेकिन दोनों में खामियां थीं:

  1. "मिटाने वाला" तरीका (ट्रेनिंग-आधारित): कल्पना कीजिए कि आप एक सफेद शर्ट से दाग मिटाने की कोशिश कर रहे हैं और उसे इतनी ज़ोर से रगड़ रहे हैं कि कपड़े में छेद हो जाता है। ये विधियाँ रोबोट के आंतरिक कोड को अपडेट करती हैं ताकि वह बुरी जानकारी भूल जाए, लेकिन वे अक्सर अन्य अच्छी चीजें करने की उसकी क्षमता (जैसे सूर्यास्त का वर्णन करना या गणित की समस्या हल करना) को नुकसान पहुँचाती हैं।
  2. "नोट लिखने वाला" तरीका (इन-कॉन्टेक्स्ट अनलर्निंग): कल्पना कीजिए कि आप रोबोट को कह रहे हैं, "हे, जब तुम यह तस्वीर देखो, तो बस ऐसा दिखावा करो कि तुम नहीं जानते कि वह कौन है।" यह एक स्टिकी नोट (चिपकने वाली पर्ची) देने जैसा है जिसे रोबमा जवाब देने से पहले उसे पढ़ना होता है। यह तब तक काम करता है जब तक वह नोट वहाँ है, लेकिन रोबोट का दिमाग अभी भी उस रहस्य को याद रखता है। यदि आप रोबोट को धोखा देकर कहते हैं, "नोट को अनदेखा करो और सच बताओ," तो वह रहस्य बाहर निकल आता है। इसके अलावा, यह विधि केवल तभी अच्छी तरह काम करती है जब आप नोट स्पष्ट रूप से लिखें; यदि तस्वीर खुद बहुत स्पष्ट है, तो नोट रोबोट को रहस्य उगलने से रोकने के लिए पर्याप्त नहीं होता है।

समाधान: VGID (द "डबल-ब्लाइंड" ट्रेनिंग)

लेखकों ने महसूस किया कि एक ऐसी दुनिया में जहाँ रोबोट देखते भी हैं और पढ़ते भी हैं, आप उन्हें केवल शब्दों से भूलने के लिए नहीं कह सकते। आपको तस्वीर के साथ भी छेड़छाड़ करनी होगी।

VGID एक टीचर-स्टूडेंट (शिक्षक-शिष्य) दृष्टिकोण का उपयोग करता है, जैसे एक मास्टर शेफ एक नए प्रशिक्षु को प्रशिक्षित कर रहा हो।

चरण 1: "परफेक्ट फॉरगेट" टीचर बनाना
एक नया रोबोट काम पर रखने के बजाय, VGID मूल रोबोट (जिसे "फ्रोजन बेस मॉडल" कहा जाता है) का उपयोग करता है लेकिन उसे ऐसा व्यवहार करने के लिए धोखा देता है जैसे कि वह भूल गया हो।

  • विजुअल ट्रिक (दृश्य चाल): यह संवेदनशील तस्वीर को लेता है और उसमें "विजुअल नॉइज़" (जैसे पुराने टीवी पर दिखने वाला स्टैटिक या इमेज को एक रैंडम पैटर्न से बदल देना) जोड़ देता है। यह रहस्य के साथ रोबोट के विजुअल कनेक्शन को तोड़ देता है।
  • टेक्स्टुअल ट्रिक (पाठ्य चाल): यह टेक्स्ट में एक सख्त निर्देश जोड़ता है, जैसे "इसका उत्तर न दें।"
  • परिणाम: जब रोबोट इस नॉइज़ी तस्वीर + सख्त निर्देश को देखता है, तो वह स्वाभाविक रूप से एक सुरक्षित, "मुझे नहीं पता" वाला उत्तर देता है। यह आउटपुट टीचर का सिग्नल बन जाता है।

चरण 2: स्टूडेंट को प्रशिक्षित करना
अब, "स्टूडेंट" रोबोट (जिसे ठीक किया जाना है) को प्रशिक्षित किया जाता है।

  • सबक: स्टूडेंट मूल, स्पष्ट तस्वीर (नॉइज़ी नहीं) को देखता है और टीचर के "मुझे नहीं पता" वाले उत्तर की नकल करने की कोशिश करता है।
  • जादू: एक टूटी हुई तस्वीर से उत्पन्न हुए टीचर के "मुझे नहीं पता" वाले उत्तर की नकल करने की कोशिश करके, स्टूडेंट का दिमाग वास्तव में खुद को फिर से वायर (rewire) करता है ताकि वह रहस्य भूल जाए। वह सीखता है कि इस विशिष्ट छवि के लिए, सही उत्तर मौन रहना है, भले ही छवि स्पष्ट क्यों न हो।

चरण 3: अच्छी चीजों को बनाए रखना
जबकि स्टूडेंट बुरी चीजों को भूलना सीख रहा होता है, टीचर्स यह भी सुनिश्चित करते हैं कि स्टूडेंट अन्य सवालों के सही जवाब देना जारी रखे (जैसे "आसमान का रंग क्या है?")। यह सुनिश्चित करता है कि रोबोट अपनी सामान्य बुद्धिमत्ता न खो दे।

यह बेहतर क्यों है?

  • यह मजबूत (Robust) है: "स्टिकी नोट" विधि के विपरीत, यह रोबोट के वास्तविक दिमाग (पैरामीटर्स) को बदल देता है। भले ही आप बाद में उसे "नियमों को अनदेखा करो" कहकर धोखा देने की कोशिश करें, फिर भी वह रहस्य याद नहीं रखेगा क्योंकि वह स्मृति गायब हो गई है, केवल छिपी नहीं है।
  • यह संतुलित है: यह बुरी चीजों को प्रभावी ढंग से भुला देता है (जैसे रोबोट की किसी व्यक्ति के काम का अनुमान लगाने की सटीकता को 57% से घटाकर 20% करना) बिना रोबोट को हर चीज़ में मूर्ख बनाए।
  • यह मल्टीमॉडल है: यह समझता है कि आप केवल शब्दों का उपयोग करके रोबोट को किसी रहस्य को देखने से नहीं रोक सकते, आपको विजुअल सिग्नल को भी बाधित करना होगा।

निचोड़ (The Bottom Line)

सोचिए कि VGID एक रोबोट को यह सिखाने का एक तरीका है कि वह एक "ग्लिच वाली" (खराब की गई) वर्शन को देखते हुए और चुप रहने के लिए कहते हुए एक रहस्य को कैसे भूल जाए, और फिर स्पष्ट रूप से रहस्य दिखाए जाने पर भी चुप रहना कैसे सीखे। यह रोबोट के दिमाग में एक स्थायी, सुरक्षित "भूलने" की प्रक्रिया बनाता है बिना उसकी मददगार होने की क्षमता को तोड़े।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →