← नवीनतम पेपर
🤖 machine learning

De-attribute to Forget for LLM Unlearning

यह शोध पत्र DareU को प्रस्तुत करता है, जो एक नवीन LLM अनलर्निंग फ्रेमवर्क है जो भूलने वाले डेटा सेट (forget sets) के लिए डेटा एट्रिब्यूशन स्कोर को शून्य करने के लिए सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करता है, जिससे मौजूदा लॉस-आधारित अनुकूलन विधियों की तुलना में ओवर-फॉरगेटिंग को प्रभावी ढंग से कम किया जाता है और मॉडल उपयोगिता को संरक्षित किया जाता है।

मूल लेखक: Xinyang Lu, Jiabao Pan, Rachael Hwee Ling Sim, See-Kiong Ng, Anthony Kum Hoe Tung, Bryan Kian Hsiang Low

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinyang Lu, Jiabao Pan, Rachael Hwee Ling Sim, See-Kiong Ng, Anthony Kum Hoe Tung, Bryan Kian Hsiang Low

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान लाइब्रेरियन (लार्ज लैंग्वेज मॉडल, या LLM) है जिसने सवालों के जवाब देने के लिए लाखों किताबें पढ़ी हैं। हाल ही में, कुछ लेखकों ("फॉरगेट सेट" या भूलने वाले समूह) को एहसास हुआ कि वे नहीं चाहते कि उनकी विशिष्ट पुस्तकें अब लाइब्रेरी में रहें। उन्होंने लाइब्रेरियन से अपनी कहानियों को "अनलर्न" (भूलने) के लिए कहा ताकि उन्हें फिर से सुनाया या संदर्भित न किया जा सके।

समस्या यह है कि लाइब्रेरियन इतना बड़ा है और उसने इतना कुछ पढ़ा है कि आप उसे बस निकाल नहीं सकते और उस नए लाइब्रेरियन को काम पर नहीं रख सकते जिसने वे किताबें कभी पढ़ी ही नहीं थीं। इसमें लाखों डॉलर और वर्षों लग जाएंगे। इसलिए, आपको एक ऐसा तरीका ढूंढना होगा जिससे आप लाइब्रेरियन को केवल उन विशिष्ट पुस्तकों को "भूलने" में मदद कर सकें बिना उसकी बाकी सब कुछ बताने की क्षमता खोए।

पुराना तरीका: "स्कॉर्च्ड अर्थ" (Scorched Earth) दृष्टिकोण

पिछले तरीकों ने लाइब्रेरियन को यह कहकर भुलाने की कोशिश की कि, "यह मत बोलो! यह मत बोलो!" बार-बार चिल्लाकर। उन्होंने उन विशिष्ट पुस्तकों के बारे में बात करने के दौरान "गलती के स्कोर" (mistake score) को अधिकतम करने की कोशिश की।

समस्या: यह दृष्टिकोण बहुत अधिक आक्रामक था। यह ऐसा था जैसे लाइब्रेरियन को चिल्लाकर कहना, "अगर तुमने कभी 'सेब' शब्द का उल्लेख किया, तो तुम्हें पूरी तरह से निरर्थक बात जैसे 'पर्पल बनाना' कहनी होगी!"

  • अत्यधिक भूलना (Over-forgetting): लाइब्रेरियन उन वर्जित पुस्तकों का उल्लेख करने से इतना डर गया कि उसने उन विषयों पर भी बकवास करना शुरू कर दिया जो उससे असंबंधित थे, जैसे कि "संतरे"।
  • भ्रम (Confusion): लक्ष्य स्पष्ट नहीं था। क्या लाइब्रेरियन को "मुझे नहीं पता" कहना चाहिए? क्या उसे "केला" कहना चाहिए? पुराने तरीकों के पास कोई सटीक लक्ष्य नहीं था, इसलिए लाइब्रेरियन अक्सर टूट जाता था और बकवास बोलने लगता था।

नया तरीका: DareU (द "एट्रिब्यूशन डिटेक्टिव")

यह पेपर DareU नामक एक नई विधि पेश करता है। "इसे मत बोलो!" चिल्लाने के बजाय, DareU लक्ष्य को पूरी तरह से बदल देता है। यह एक अलग सवाल पूछता है: "इस कहानी के लेखक कौन हैं?"

इसे इस तरह समझें:

  1. एट्रिब्यूशन स्कोर (The Attribution Score): कल्पना कीजिए कि लाइब्रेरियन द्वारा सुनाई गई हर कहानी के साथ एक छोटा, अदृश्य टैग लगा हुआ है जो कहता है, "यह कहानी लेखक X से प्रेरित है।"
  2. लक्ष्य: अनलर्न करने का लक्ष्य लाइब्रेरियन को बात करने से रोकना नहीं है; बल्कि यह सुनिश्चित करना है कि जब वे उन वर्जित पुस्तकों के बारे में बात करें, तो वह टैग अब "लेखक X" न कहे। इसे "कोई नहीं" या "कोई और" कहना चाहिए।
  3. पुरस्कार प्रणाली (The Reward System): यह पेपर रीइन्फोर्समेंट लर्निंग (जैसे कुत्ते को ट्रीट देकर प्रशिक्षित करना) नामक एक तकनीक का उपयोग करता है।
    • यदि लाइब्रेरियन एक कहानी सुनाता है और "एट्रिब्यूशन डिटेक्टिव" (एक छोटा, तेज़ AI क्लासिफायर) कहता है, "हे, यह तो लेखक X की तरह लग रहा है," तो लाइब्रेरियन को सजा (नेगेटिव रिवॉर्ड) मिलती है।
    • यदि लाइब्रेरियन एक कहानी सुनाता है और डिटेक्टिव कहता है, "यह बिल्कुल भी लेखक X जैसा नहीं लगता," तो लाइब्रेरियन को ट्रीट (पॉजिटिव रिवॉर्ड) मिलती है।

यह व्यवहार में कैसे काम करता है

सिस्टम पहले एक छोटे, तेज़ "डिटेक्टिव" AI को प्रशिक्षित करता है। यह डिटेक्टिव "फॉरगेट" लेखकों की शैली को पहचानना सीखता है। फिर मुख्य लाइब्रेरियन (बड़ा LLM) एक खेल खेलता है:

  • यह सवालों के जवाब देने की कोशिश करता है।
  • डिटेक्टिव जवाब की जाँच करता है।
  • यदि जवाब अभी भी "फॉरगेट" लेखक की गंध देता है, तो लाइब्रेरियन को दंड मिलता है।
  • लाइब्रेरियन अपने मस्तिष्क को उस तरह के उत्तर देने से रोकने के लिए समायोजित करता है जो उस लेखक की गंध देते हैं, लेकिन वह यह भी सुनिश्चित करता है कि उत्तर समझदारी भरे और मददगार बने रहें।

यह बेहतर क्यों है

पेपर का दावा है कि यह विधि "बकवास" (gibberish) वाली समस्या को हल करती है।

  • सटीकता (Precision): लाइब्रेरियन को "मुझे नहीं पता" या "केला" कहने के लिए मजबूर करने के बजाय, लक्ष्य केवल "लेखक X" टैग को हटाना है। लाइब्रेरियन अभी भी विषय के बारे में एक बेहतरीन कहानी सुना सकता है, बस वह उस व्यक्ति से जुड़ा नहीं होगा जिसे भुलाया जाना था।
  • संतुलन (Balance): पुराने तरीके अक्सर अन्य चीजों के बारे में बात करने की लाइब्रेरियन की क्षमता को खराब कर देते थे (रिटेन सेट)। DareU एक विशेष "डिस्टिलेशन" ट्रिक का उपयोग करता है ताकि लाइब्रेरियन को याद दिलाया जा सके, "हे, इस एक को भूलते समय अन्य लेखकों के बारे में बात करना मत भूलना।"

परिणाम

शोधकर्ताओं ने दो अलग-अलग "लाइब्रेरी" (डेटासेट) पर इसका परीक्षण किया:

  1. TOFU: फर्जी ट्रिविया प्रश्नों का एक सेट।
  2. ArXiv: वैज्ञानिक शोध पत्रों के सारांशों का एक सेट।

उन्होंने पाया कि DareU "फॉरगेट" लेखकों के प्रभाव को हटाने में बहुत बेहतर था बिना लाइब्रेरियन को एक बकवास मशीन बनाए। इसने एक बेहतर संतुलन हासिल किया: लाइब्रेरियन ने सफलतापूर्वक विशिष्ट लेखकों को "भूल" दिया (कम एट्रिब्यूशन स्कोर) लेकिन अन्य सभी के लिए स्मार्ट और उपयोगी बना रहा।

कमी (सीमाएं)

पेपर स्वीकार करता है कि इस नई विधि में पुराने "चिल्लाने" वाले तरीकों की तुलना में थोड़े अधिक कंप्यूटिंग पावर और समय की आवश्यकता होती है। यह लाइब्रेरियन पर चिल्लाने के बजाय हर जवाब की जाँच करने के लिए एक जासूस को काम पर रखने जैसा है। हालाँकि, पेपर का तर्क है कि यह ट्रेड-ऑफ (समझौता) सार्थक है क्योंकि परिणाम एक बहुत अधिक स्मार्ट, अधिक विश्वसनीय लाइब्रेरियन है जो कुछ भूलने के लिए कहे जाने पर टूटता नहीं है।

संक्षेप में: किसी विषय के बारे में बात करना बंद करने के लिए मजबूर करने के बजाय (जिससे वह हकलाने और बड़बड़ाने लगता है), यह विधि AI को उस विषय के बारे में इस तरह से बात करना सिखाती है कि वह उस व्यक्ति जैसा न लगे जिसे भुलाया जाना था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →