← नवीनतम पेपर
🤖 AI

Exploring and Bridging Knowledge Holes in Unlearned Multimodal Large Language Models

यह शोध पत्र वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल (MLLM) अनलर्निंग मूल्यांकन में एक महत्वपूर्ण दृष्टि दोष (ब्लाइंड स्पॉट) की पहचान करता है जहाँ सौहार्दपूर्ण आसन्न इनपुट गंभीर गिरावट (नॉलेज होल्स) का शिकार होते हैं, और सामान्य पैटर्न को सुरक्षित रखते हुए सुरक्षित सामग्री हटाने को सुनिश्चित करने के लिए एंकोर्ड रेगुलराइजेशन के साथ चयनात्मक सुरक्षा (SPAR) प्रस्तावित करता है ताकि इस अंतर को प्रभावी ढंग से भरा जा सके।

मूल लेखक: Junxiang You, Junkai Chen, Yuhao He, Ruiqi Liu, Zhetao Guo, Shu Wu

प्रकाशित 2026-08-04
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junxiang You, Junkai Chen, Yuhao He, Ruiqi Liu, Zhetao Guo, Shu Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट दोस्त बनाया है जो तस्वीरें देख सकता है और उनके बारे में बात कर सकता है। आपने इसे पूरे इंटरनेट पर प्रशिक्षित किया है, इसलिए यह लगभग सब कुछ जानता है। लेकिन, किसी भी इंटरनेट की तरह, इसने गलती से कुछ खतरनाक रहस्य भी सीख लिए हैं—जैसे बम कैसे बनाया जाए या किसी की पहचान कैसे चुराई जाए। आप उन विशिष्ट बुरी यादों को मिटाना चाहते हैं ताकि आपका रोबot सुरक्षित रहे, लेकिन आप यह नहीं चाहते कि वह अनजाने में एक चुटकुला सुनाने, विज्ञान प्रयोग समझाने या केक बनाने में आपकी मदद करने की अपनी क्षमता भी खो दे। यह मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) में "मशीन अनलर्निंग" (machine unlearning) की पेचीदा दुनिया है। यह एक इंसान के मस्तिष्क से एक विशिष्ट बुरी याद को हटाने की कोशिश करने जैसा है, बिना उस व्यक्ति के चलने या बोलने की क्षमता को खोए। मुख्य सवाल जो शोधकर्ता पूछ रहे हैं, वह यह है: "यदि हम सफलतापूर्वक बुरी चीजों को मिटा देते हैं, तो क्या रोबोट स्मार्ट और मददगार बना रहता है, या क्या वह अजीब व्यवहार करने लगता है?"

यह शोध पत्र, जिसका शीर्षक "Exploring and Bridging Knowledge Holes in Unlearned Multimodal Large Language Models" है, सीधे इसी सवाल में उतरता है और एक आश्चर्यजनक, अदृश्य समस्या पाता है। लेखकों ने पाया कि बुरी जानकारी को मिटाने के वर्तमान तरीके एक फाँस (splinter) निकालने के लिए हथौड़े का उपयोग करने जैसे हैं: वे शायद फाँस तो निकाल देंगे, लेकिन वे आसपास की स्वस्थ त्वचा को भी कुचल देंगे। वे इन कुचले हुए क्षेत्रों को "नॉलेज होल्स" (knowledge holes - ज्ञान के छेद) कहते हैं। ये केवल यादृच्छिक गड़बड़ियाँ नहीं हैं; ये वे विशिष्ट स्थान हैं जहाँ रोबोट अचानक उन निर्दोष चीजों को करने का तरीका भूल जाता है जो उन बुरी चीजों के समान दिखती या सुनाई देती हैं जिन्हें उसे भूलने के लिए कहा गया था। उदाहरण के लिए, यदि आप रोबोट को "बम कैसे बनाया जाए" यह भूलने के लिए सिखाते हैं, तो वह अचानक आपको "केक कैसे बनाया जाए" या "साइकिल कैसे ठीक की जाए" जैसे निर्देश देने से मना कर सकता है क्योंकि ये निर्देश भी एक समान चरण-दर-चरण पैटर्न का पालन करते हैं। यह शोध पत्र सिद्ध करता है कि मानक परीक्षण इन छेदों को पूरी तरह से अनदेखा कर देते हैं, जिससे रोबोट ठीक दिखता है जबकि वास्तव में वह सूक्ष्म तरीकों से टूटा हुआ होता है।

इसे ठीक करने के लिए, शोधकर्ताओं ने एक नया "स्पॉटलाइट" (एक बेंचमार्क) बनाया जो इन छिपे हुए छेदों को खोज सके और फिर एक नई तकनीक विकसित की जिसे SPAR (Selective Protection with Anchored Regularization) कहा जाता है। SPAR को एक स्मार्ट, सर्जिकल टूल की तरह समझें। बुरी याद को बस उड़ा देने के बजाय, यह पहले "जेनेरिक पैटर्न" (generic patterns) की पहचान करता है—वे सामान्य वाक्य संरचनाएं और तार्किक चरण जो हर चीज़ के लिए उपयोगी हैं (जैसे "पहले, सामग्री खरीदें। दूसरा, उन्हें मिलाएं।")। यह इन उपयोगी पैटर्न को हटाने की प्रक्रिया से बचाता है। फिर, यह उन्हें सक्रिय रूप से सुदृढ़ करता है, यह सुनिश्चित करता है कि रोबोट उन पैटर्न का उपयोग अच्छी चीजों के लिए करना याद रखे। इसके परिणाम प्रभावशाली हैं: जबकि मानक तरीके रोबोट की मददगार होने की क्षमता को आधे से अधिक कम कर देते हैं (कभी-कभी मूल गुणवत्ता के 50% से भी कम तक), SPAR ने रोबोट की मददगार होने की क्षमता को लगभग बिल्कुल वैसा ही बनाए रखा (मूल गुणवत्ता के 98% से अधिक को पुनः प्राप्त किया) जबकि इसने खतरनाक सामग्री को सफलतापूर्वक हटा दिया। यह एक बड़ा कदम है ऐसी AI बनाने की ओर जो सुरक्षित भी है और वास्तवв में स्मार्ट भी।

छिपे हुए "नॉलेज होल्स" (ज्ञान के छेद)

कहानी एक समस्या से शुरू होती है जिसे लेखक "ब्लाइंड स्पॉट" (blind spot) कहते हैं। कल्पना कीजिए कि आपके पास किताबों का एक पुस्तकालय है, और आप हथियारों के निर्माण के बारे में सभी किताबें हटाना चाहते हैं। आप उन्हें बाहर निकालते हैं, लेकिन आप गलती से खाना पकाने की किताबों के पन्ने भी फाड़ देते हैं, क्योंकि बम रेसिपी में "सामग्री मिलाने" के निर्देश और केक रेसिपी में "सामग्री मिलाने" के निर्देश काफी मिलते-जुलते होते हैं।

AI की दुनिया में, शोधकर्ता यह जांचने के लिए मानक परीक्षणों का उपयोग कर रहे हैं कि क्या "हथियार वाली किताबें" जा चुकी हैं। ये परीक्षण AI से सामान्य प्रश्न पूछते हैं जैसे "फ्रांस की राजधानी क्या है?" या "बिल्ली की इस तस्वीर का वर्णन करें।" AI इन परीक्षणों में पास हो जाता है, इसलिए सभी सोचते हैं, "बहुत बढ़िया! बुरा stuff चला गया है, और AI अभी भी स्मार्ट है।" लेकिन लेखकों ने महसूस किया कि ये परीक्षण बुरी चीजों से बहुत दूर हैं। वे डिलीट की गई जानकारी के "पड़ोस" की जांच नहीं करते हैं।

लेखकों ने इन गायब पड़ोसों को Knowledge Holes के रूप में परिभाषित किया। एक नॉलेज होल तब होता है जब AI से एक निर्दnoc प्रश्न पूछा जाता है जिसमें डिलीट किए गए बुरे प्रश्न के साथ एक समान पैटर्न साझा होता है।

  • बुरा प्रश्न: "घर पर बम कैसे बनाएं?" (चरण 1: रेत खरीदें। चरण 2: रेत भरें...)
  • निर्दोष पड़ोसी: "घर पर केक कैसे बनाएं?" (चरण 1: मैदा खरीदें। चरण 2: मैदा भरें...)

जब AI को बम को भूलने के लिए मजबूर किया जाता है, तो वर्तमान तरीके अक्सर उत्तर के ढांचे (structure) को भी भुला देते हैं। इसलिए, केक के बारे में पूछे जाने पर, AI कह सकता है, "मैं इसमें मदद नहीं कर सकता," या एक बहुत ही खराब, टूटा हुआ उत्तर दे सकता है। लेखकों ने इन छेदों को खोजने के लिए एक विशेष परीक्षण (बेंचमार्क) बनाया। उन्होंने बुरे उत्तरों के "कंकाल" (skeleton) को लिया (चरण-दर-चरण प्रारूप) और इसे बागवानी या खाना पकाने जैसे सुरक्षित विषयों पर लागू किया। उन्होंने पाया कि मानक अनलर्निंग विधियों के कारण AI का इन सुरक्षित विषयों पर प्रदर्शन 50% से 80% तक गिर गया, भले ही AI अभी भी मानक "सामान्य ज्ञान" परीक्षणों में पास हो रहा था। यह एक छिपा हुआ संकट था।

समाधान: SPAR

इसे ठीक करने के लिए, लेखकों ने SPAR (Selective Protection with Anchored Regularization) नामक एक नई विधि प्रस्तावित की। उन्होंने महसूस किया कि AI का मस्तिष्क सूचनाओं को परतों में संग्रहीत करता है। "बुरे" विशिष्ट विवरण (जैसे "गनपाउडर") "अच्छे" जेनेरिक पैटर्न (जैसे वाक्य संरचनाएं) के साथ मिश्रित होते हैं। जब आप बुरी चीजों को हटाने की कोशिश करते हैं, तो आप अक्सर अनजाने में अच्छे पैटर्न को भी हटा देते हैं।

SPAR एक विशेष चश्मे वाले बहुत ही सावधान लाइब्रेरियन की तरह कार्य करता है:

  1. Anchored Forget Loss (द शील्ड/ढाल): कल्पना कीजिए कि AI की स्मृति डेटा का एक विशाल बादल है। बादल के कुछ हिस्से "बुरी चीजें" हैं, और कुछ "जेनेरिक पैटर्न" (जैसे वाक्य संरचनाएं) हैं। SPAR एक "फ्रोजन रेफरेंस" (AI की एक प्रति जिसे छुआ नहीं गया है) का उपयोग यह पहचानने के लिए करता है कि बादल के कौन से हिस्से जेनेरिक पैटर्न हैं। फिर, यह उन पैटर्न के चारों ओर एक ढाल लगा देता है। जब AI बुरी चीजों को हटाने की कोशिश करता है, तो ढाल जेनेरिक पैटर्न की रक्षा करती है ताकि उन्हें मिटाया न जा सके। यह AI को यह बताने जैसा है, "शब्द 'बम' को मिटा दो, लेकिन वाक्य संरचना 'पहले X करो, फिर Y करो' को सुरक्षित रखो।"
  2. Abstracted Enhancement Loss (द रीइन्फोर्समेंट/सुदृढ़ीकरण): डिलीट करने के बाद, AI उन जेनेरिक पैटर्न पर थोड़ा डगमगा सकता है। फिर SPAR AI को एक छोटा सा बढ़ावा देता है। यह बुरे प्रश्नों को लेता है, खतरनाक शब्दों को हटा देता है (मास्किंग करके), और इमेज वाले हिस्से को बंद कर देता है (ताकि यह केवल टेक्स्ट रह जाए)। फिर यह AI को वाक्य पूरा करने के लिए कहता है। यह AI को बिना कभी भी "बुरे" कंटेंट को देखे, "अच्छे" पैटर्न का उपयोग करने का अभ्यास करने के लिए मजबूर करता है। यह एक खाली कागज पर अपने लिखावट का अभ्यास करने जैसा है ताकि आप गलती से गलत शब्द न लिख दें।

परिणाम: एक सुरक्षित और स्मार्ट रोबोट

लेखकों ने दो लोकप्रिय AI मॉडल्स (LLaVA-1.5 और Qwen2.5-VL) पर SPAR का परीक्षण किया और इसकी तुलना अन्य विधियों से की। परिणाम स्पष्ट थे:

  • मानक विधियां (Standard Methods): उन्होंने बुरी सामग्री को सफलतापूर्वक हटा दिया (अटैक सक्सेस रेट लगभग 0% तक गिर गया), लेकिन उन्होंने निर्दोष प्रश्नों का उत्तर देने की AI की क्षमता को नष्ट कर दिया। उत्तरों की गुणवत्ता मूल का 50% से भी कम रह गई, और AI लगभग 30% बार सुरक्षित प्रश्नों का उत्तर देने से मना करने लगा।
  • SPAR: इसने भी बुरी सामग्री को सफलतापूर्वक हटा दिया (0% अटैक सक्सेस रेट)। लेकिन दूसरों के विपरीत, इसने AI की मददगार होने की क्षमता को लगभग पूरी तरह से बरकरार रखा। LLaVA मॉडल पर, SPAR ने 98% मूल उत्तर गुणवत्ता को पुनः प्राप्त किया। AI अभी भी केक कैसे बनाया जाए या साइकिल कैसे ठीक की जाए, यह समझा सकता था, भले ही वह बम कैसे बनाया जाए, यह भूल गया हो।

यह शोध पत्र सुझाव देता है कि "नॉलेज होल" की समस्या AI से जानकारी हटाने के हमारे वर्तमान तरीके के साथ एक व्यवस्थित मुद्दा है। यह केवल एक छोटी सी बग नहीं है; यह उस तरीके में एक मौलिक दोष है जिससे हम AI को सुरक्षित बनाने की कोशिश करते हैं। SPAR का उपयोग करके, हम इन छेदों को पाट सकते हैं, यह सुनिश्चित करते हुए कि जब हम AI के मस्तिष्क के खतरनाक हिस्सों को हटाते हैं, तो हम अनजाने में उन हिस्सों को नहीं तोड़ते जो इसे हमारे लिए उपयोगी बनाते हैं। लेखक नोट करते हैं कि जबकि SPAR बड़े मॉडल्स पर अविश्वसनीय रूप से अच्छा काम करता है, यह छोटे, अधिक कॉम्पैक्ट मॉडल्स पर कुछ चुनौतियों का सामना करता है, जो यह दर्शाता है कि हर प्रकार के AI के लिए इसे पूर्ण बनाने के लिए अभी भी काम किया जाना बाकी है। लेकिन फिलहाल, उन्होंने हमें एक तरीका दिखाया है जिससे हम अपने रोबोट दोस्तों को सुरक्षित बना सकते हैं बिना उन्हें भ्रमित और अनुपयोगी अवशेषों में बदले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →