← नवीनतम पेपर
💻 computer science

Consistency-Aware Editing for Entity-level Unlearning in Language Models

यह शोधपत्र कंसिस्टेंसी-अवेयर एडिटिंग (CAE) प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो मॉडल की क्षमताओं को संरक्षित करते हुए व्यापक ज्ञान निष्कासन सुनिश्चित करने के लिए विविध इकाई-संबंधित प्रॉम्प्ट्स पर लो-रैंक अपडेट्स को संयुक्त रूप से अनुकूलित करके कुशल और सुदृढ़ इकाई-स्तरीय अनलर्निंग के लिए मॉडल एडिटिंग तकनीकों को अनुकूलित करता है।

मूल लेखक: Xiaoqi Han, Víctor Gutiérrez-Basulto, Ru Li, Xiaoli Li, Jiye Liang, Jeff Z. Pan

प्रकाशित 2026-01-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoqi Han, Víctor Gutiérrez-Basulto, Ru Li, Xiaoli Li, Jiye Liang, Jeff Z. Pan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Consistency-Aware Editing for Entity-level Unlearning in Language Models" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "डिजिटल अम्मनेसिया" (Digital Amnesia) की दुविधा

एक लार्ज लैंग्वेज मॉडल (LLM) को एक ऐसी सुपर-एनसाइक्लोपीडिया के रूप में कल्पना करें जिसने इंटरनेट पर मौजूद लगभग सब कुछ पढ़ लिया है। कभी-कभी, यह एनसाइक्लोपीडिया गलती से ऐसी चीजें याद कर लेती है जो उसे नहीं याद रखनी चाहिए, जैसे कि किसी सेलिब्रिटी का निजी घर का पता, कॉपीराइट वाली किताबों के अध्याय, या हानिकारक रूढ़ियाँ (stereotypes)।

हम इस एनसाइक्लोपीडिया को ये विशिष्ट चीजें भूलने के लिए सिखाना चाहते हैं। हालाँकि, इसमें एक पेंच है:

  1. हम पूरी लाइब्रेरी को जलाना नहीं चाहते। हम केवल "जैकी चैन" (Jackie Chan) के बारे में विशिष्ट पन्ने हटाना चाहते हैं, न कि "मार्शल आर्ट्स" या "मूवीज" के बारे में सामान्य पन्ने।
  2. हम सिर्फ एक वाक्य को मिटा नहीं सकते। यदि आप पूछते हैं, "जैकी चैन कहाँ पैदा हुआ था?" तो मॉडल को कहना चाहिए, "मुझे नहीं पता।" लेकिन यदि आप पूछते हैं, "रश ऑवर वाले अभिनेता कौन हैं?" तो उसे भी कहना चाहिए, "मुझे नहीं पता।"

चुनौती: मौजूदा तरीके एक सूची से नाम मिटाने के लिए एक विशिष्ट लाइन को काटने की तरह हैं। यदि कोई प्रश्न को थोड़े अलग तरीके से पूछता है (एक "पैराफ्रेज़"), तो मॉडल को उत्तर याद रह सकता है क्योंकि उसने केवल विशिष्ट वाक्य को भुलाया है, उस अवधारणा (concept) को नहीं।

समाधान: CAE (कंसिस्टेंसी-अवेयर एडिटिंग)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे CAE कहा जाता है। इसे एक ऐसे मास्टर इरेज़र (Master Eraser) के रूप में सोचें जो पुराने वाले से अलग काम करता है।

1. पुराना तरीका: "रैंडम इरेज़र" (Random Eraser)

कल्पना करें कि आपके पास एक व्हाइटबोर्ड है जिसमें "जैकी चैन" के बारे में पूछने के 100 अलग-अलग तरीके हैं (जैसे, "वह कहाँ पैदा हुआ था?", "उसका जन्मदिन क्या है?", "रश ऑवर वाला आदमी कौन है?")।

  • पुराना तरीका: आप प्रत्येक प्रश्न के लिए एक अलग इरेज़र लेते हैं। आप प्रश्न #1 के उत्तर को मिटाते हैं, फिर प्रश्न #2 को, फिर प्रश्न #3 को।
  • समस्या: क्योंकि आप बिना किसी योजना के एक-एक करके मिटा रहे हैं, तो हो सकता है कि जब आप प्रश्न #2 को ठीक करने की कोशिश कर रहे हों, तो आप गलती से प्रश्न #1 का उत्तर मिट दें। या, आप प्रश्न #5 को बिना छुए छोड़ सकते हैं क्योंकि आपका इरेज़र फिसल गया। परिणाम अस्त-व्य経過 है: मॉडल कुछ चीजें भूल जाता है लेकिन कुछ याद रखता है, या वह भ्रमित हो जाता है और गलत जानकारी (hallucinate) देने लगता है।

2. नया तरीका (CAE): "सिंक्रोनाइज्ड टीम" (Synchronized Team)

CAE रणनीति बदल देता है। एक-एक करके मिटाने के बजाय, यह सभी 100 प्रश्नों को एक सिंगल टीम के रूप में मानता है।

  • रणनीति: यह "जैकी चैन" के बारे में पूछने के सभी अलग-अलग तरीकों को इकट्ठा करता है।
  • "कंसिस्टेंसी" (Consistency) का नियम: यह सभी इरेज़र्स को बिल्कुल एक ही दिशा में चलने के लिए मजबूर करता है। यह एक सिंक्रोनाइज्ड स्विमिंग टीम की तरह है; हर तैराक अपना हाथ बिल्कुल उसी कोण और गति से चलाता है।
  • परिणाम: 100 छोटे-छोटे बिखरे हुए निशानों के बजाय, टीम एक बड़ा, साफ और एकीकृत प्रहार करती है जो मॉडल के दिमाग से जैकी चैन की पूरी अवधारणा को हटा देती है, चाहे प्रश्न को किसी भी तरह से पूछा गया हो।

यह कैसे काम करता है (इसके पीछे की कार्यप्रणाली)

पेपर इस बात की गहराई में जाता है कि मॉडल कैसे "सोचता" है ताकि यह पता लगाया जा सके कि इरेज़र को कहाँ लागू करना सबसे अच्छा है।

  • मेमोरी को खोजना: शोधकर्ताओं ने पाया कि मॉडल विशिष्ट लोगों (जैसे जैकी चैन) के बारे में तथ्य अपने मस्तिष्क के एक विशिष्ट भाग में संग्रहीत करता है जिसे MLP लेयर्स (इन्हें मॉडल के 'फाइलिंग कैबिनेट' के रूप में सोचें) कहा जाता है।
  • "की" (Key) का चयन: वे केवल रैंडम प्रश्न नहीं उठाते। वे एक गणितीय उपकरण (SVD) का उपयोग करके सबसे महत्वपूर्ण 70 प्रश्नों को चुनते हैं जो "जैकी चैन" की अवधारणा का सबसे अच्छा प्रतिनिधित्व करते हैं। यह किसी व्यक्ति के सबसे प्रतिनिधि 70 फोटो चुनने जैसा है ताकि आप उन्हें किसी भी कोण से पहचान सकें।
  • "लो-रैंक" अपडेट (Low-Rank Update): पूरी एनसाइक्लोपीडिया को फिर से लिखने के बजाय (जिसमें बहुत समय और पैसा लगता है), वे फाइलिंग कैबिनेट में एक छोटा, सटीक समायोजन करते हैं। यह पूरे गोदाम को फिर से बनाने के बजाय शेल्फ पर एक सिंगल लेबल बदलने जैसा है।

उन्होंने क्या पाया (परिणाम)

टीम ने दो प्रमुख बेंचमार्क (RWKU और ToFU) पर परीक्षण किया और अन्य तरीकों से तुलना की।

  1. बेहतर विस्मृति (Better Forgetting): CAE इस बात में बहुत बेहतर है कि मॉडल लक्षित एंटिटी (target entity) के बारे में किसी भी प्रश्न के लिए "मुझे नहीं पता" कहे, यहाँ तक कि उन कठिन प्रश्नों के लिए भी जहाँ नाम का सीधा उल्लेख नहीं है।
  2. कम संपार्श्विक क्षति (Less Collateral Damage): क्योंकि "इरेज़र्स" तालमेल में चलते हैं, वे गलती से संबंधित विषयों के बारे में ज्ञान को नहीं मिटाते हैं। उदाहरण के लिए, मॉडल अभी भी फिल्मों या अभिनेताओं के बारे में बात करना जानता है; वह बस जैकी चैन के बारे में विशेष रूप से नहीं जानता।
  3. दक्षता (Efficiency): यह अविश्वसनीय रूप से तेज़ है। जबकि अन्य तरीकों को पूरे मॉडल को फिर से प्रशिक्षित करने की आवश्यकता हो सकती है (जैसे पूरी नई डिग्री के लिए पढ़ाई करना), CAE केवल एक त्वरित, लक्षित संपादन करता है। यह केवल कुछ दर्जन उदाहरणों के साथ ऐसा कर सकता है।
  4. स्थिरता (Stability): पेपर दिखाता है कि भले ही आप प्रश्नों का क्रम बदल दें या अलग-अलग मॉडल का उपयोग करें, CAE लगातार (consistently) काम करता है। यह मजबूत (robust) है।

निष्कर्ष (The Bottom Line)

यह पेपर तर्क देता है कि किसी विशिष्ट व्यक्ति या एंटिटी को AI से वास्तव में "अनलर्न" (unlearn) करने के लिए, आप केवल व्यक्तिगत छेदों को पैच नहीं कर सकते। आपको एक समन्वित, सुसंगत दृष्टिकोण की आवश्यकता है जो यह समझता हो कि AI उस जानकारी को कैसे संग्रहीत करता है।

CAE एक सटीक लेज़र की तरह है जो मॉडल की मेमोरी में पूरे "जैकी चैन" फोल्डर को निशाना बनाता है और उसे सफाई से हटा देता है, जिससे बाकी लाइब्रेरी पूरी तरह सुरक्षित रहती है। यह इस समस्या को हल करता है कि जब आप प्रश्न को नए तरीके से पूछते हैं तो मॉडल उत्तर याद रखता है, जो पिछले तरीकों की सबसे बड़ी कमजोरी थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →