← नवीनतम पेपर
💬 NLP

Position: The Term "Machine Unlearning" Is Overused in LLMs

यह स्थिति पत्र तर्क देता है कि "मशीन अनलर्निंग" (machine unlearning) शब्द का वर्तमान में LLM अनुसंधान में रिफ्यूज़ल (refusal) या सप्रेशन (suppression) जैसे विविध कार्यों का वर्णन करने के लिए अत्यधिक उपयोग किया जा रहा है, और भ्रामक मूल्यांकन को रोकने तथा विभिन्न उद्देश्यों के लिए उपयुक्त शब्दावली सुनिश्चित करने हेतु इस शब्द को विशेष रूप से डेटासेट-परिभाषित विलोपन (dataset-defined deletion) और रिट्रेनिंग-तुल्यता गारंटी (retraining-equivalence guarantees) के लिए आरक्षित करने का आह्वान करता है।

मूल लेखक: Sangyeon Yoon, Yeachan Jun, Albert No

प्रकाशित 2026-06-29
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sangyeon Yoon, Yeachan Jun, Albert No

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके पेपर की व्याख्या दी गई है।

मुख्य विचार: "अनलर्निंग" (Unlearning) का गलत उपयोग हो रहा है

कल्पना कीजिए कि आपके पास एक छात्र है जिसने विशेषज्ञ बनने के लिए किताबों के एक विशाल पुस्तकालय का अध्ययन किया है। अब, कल्पना कीजिए कि उन किताबों में से एक चोरी हो गई है, या लेखक मांग करता है कि उस किताब को छात्र के दिमाग से निकाल दिया जाए।

पेपर यह तर्क देता है कि शोधकर्ता "मशीन अनलर्निंग" (Machine Unlearning) शब्द का बहुत ढीले ढंग से उपयोग कर रहे हैं। वे कई अलग-अलग चीज़ों को "अनलर्निंग" कह रहे हैं, लेकिन वास्तव में वे बहुत अलग काम कर रहे हैं।

लेखक कहते हैं कि हमें इन चीज़ों को मिलाना बंद करना चाहिए। हमें सख्त शब्द "मशीन अनलर्निंग" को एक विशिष्ट, बहुत कठिन कार्य के लिए सुरक्षित रखना चाहिए, और अन्य आसान कार्यों के लिए अलग नाम रखने चाहिए।


1. सख्त परिभाषा: "इरेज़र" (The Eraser)

इसका वास्तविक अर्थ क्या है:
सच्ची "मशीन अनलर्निंग" एक पेंटिंग पर जादुई इरेज़र (magic eraser) का उपयोग करने की तरह है। आप पेंट के स्ट्रोक्स के एक विशिष्ट सेट (जिसे "फॉरगेट सेट" कहा जाता है) को इतनी पूर्णता से हटाना चाहते हैं कि पेंटिंग बिल्कुल वैसी ही दिखे जैसी तब होती जब कलाकार ने उन स्ट्रोक्स को कभी बनाया ही न होता

  • गोल्ड स्टैंडर्ड (मानक): यह साबित करने के लिए कि आपने अच्छा काम किया है, आपको अपनी "मिटाई गई" पेंटिंग की तुलना एक नई पेंटिंग से करनी होगी जो एक ऐसे कलाकार द्वारा बनाई गई है जिसने शेष किताबों के साथ शून्य से शुरुआत की थी, और जिसने उस चोरी की गई किताब को कभी देखा ही नहीं था
  • लक्षत: दोनों पेंटिंग्स एक दूसरे से अभिन्न (indistinguishable) होनी चाहिए। यदि छात्र उस गणित की समस्या को हल कर सकता है जिसे उसने केवल चोरी की गई किताब से सीखा था, तो उसने वास्तव में उसे "अनलर्न" नहीं किया है, भले ही वह उस विशिष्ट प्रश्न का उत्तर देने से इनकार कर दे।

2. भ्रम: लोग वास्तव में क्या कर रहे हैं

वर्तमान में, कई शोधकर्ता कहते हैं कि वे "अनलर्निंग" कर रहे हैं, जबकि वे वास्तव में इनमें से कोई एक चीज़ कर रहे होते हैं:

  • "रिफ्यूज़ल" (The Refusal - गार्ड डॉग): मॉडल को प्रशिक्षित किया जाता है कि जब प्रतिबंधित विषय के बारे में पूछा जाए तो वह कहे, "मुझे नहीं पता" या "मैं इसका उत्तर नहीं दे सकता।"
    • उदाहरण: यह एक गार्ड डॉग की तरह है जो भौंकता है और आपको कमरे में जाने से रोकता है। कुत्ते को पता है कि कमरा मौजूद है, लेकिन वह आपको अंदर नहीं आने देता। कुत्ते ने कमरे को भुलाया नहीं है; उसे बस आपको रोकने के लिए प्रशिक्षित किया गया है।
  • "सप्रेशन" (The Suppression - म्यूट बटन): मॉडल को इस तरह से ट्यून किया जाता है कि प्रतिबंधित विषय से जुड़े विशिष्ट शब्दों को बोलने की संभावना बहुत कम हो जाए।
    • उदाहरण: यह किसी विशिष्ट शब्द पर म्यूट बटन लगाने जैसा है। शब्द अभी भी डिक्शनरी में है, लेकिन वक्ता को उसे छोड़ने के लिए प्रशिक्षित किया गया है।
  • "एडिटिंग" (The Editing - रीराइट): मॉडल को पुराने तथ्य को बदलने के लिए एक नया तथ्य सिखाया जाता है।
    • उदाहरण: "पेरिस फ्रांस की राजधानी है" की याद को मिटाने के बजाय, आप इसे "लंदन राजधानी है" के साथ ओवरराइट कर देते हैं। पुरानी याद अभी भी वहीं हो सकती है, बस एक नई याद के नीचे दब गई है।

समस्या: शोधकर्ता अक्सर दावा करते हैं कि उन्होंने कुछ "अनलर्न" कर लिया है क्योंकि मॉडल उत्तर देने से मना कर देता है (गार्ड डॉग भौंका)। लेकिन लेखक कहते हैं कि यह एक चाल है। मॉडल गहराई में अभी भी जानकारी जान सकता है; वह बस नाटक कर रहा है कि उसे नहीं पता।

3. छिपा हुआ खतरा: "डेरिव्ड कैपेबिलिटीज" (Derived Capabilities)

यह इस पेपर का सबसे महत्वपूर्ण हिस्सा है। कभी-कभी, एक विशिष्ट चीज़ सीखने से आपको एक सुपरपावर मिल जाती है जो केवल उस एक तथ्य से परे होती है।

  • उदाहरण: कल्पना कीजिए कि एक छात्र चोरी की गई पाठ्यपुस्तक का उपयोग करके गणित की एक विशिष्ट समस्या को हल करना सीखता है। भले ही आप उसे चोरी की गई किताब के विशिष्ट उत्तरों को "भूलने" के लिए कहें, फिर भी उसने उस किताब को पढ़ने से तर्क (logic) या तर्क करने का कौशल (reasoning skill) सीख लिया होगा।
  • जोखिम: यदि आप केवल यह जाँचते हैं कि क्या वह उत्तर दे सकता है (आउटपुट फेलियर), तो वह टेस्ट में फेल हो सकता है। लेकिन यदि आप उससे एक नया गणित का सवाल पूछते हैं जिसमें उसी तर्क का उपयोग किया गया है, तो वह उसे भी पूरी तरह से हल कर सकता है।
  • पेपर का बिंदु: सच्ची "अनलर्निंग" का अर्थ है उस सुपरपावर को भी हटाना। यदि चोरी की गई किताब ने उसे एक कौशल दिया, और आपने उसे "अनलर्न" किया, तो उसे वह कौशल भी खो देना चाहिए, भले ही इससे वह गणित में थोड़ा कमजोर हो जाए। यदि वह कौशल बनाए रखता है, तो उसने उस किताब के प्रभाव को वास्तव में अनलर्न नहीं किया है।

4. वर्तमान परीक्षण क्यों विफल हो रहे हैं

पेपर बताता है कि वर्तमान के अधिकांश परीक्षण बहुविकल्पीय प्रश्नों (multiple-choice quizzes) की तरह हैं।

  • वर्तमान टेस्ट: "क्या मॉडल प्रश्न A का उत्तर दे सकता है?" यदि मॉडल कहता है "मुझे नहीं पता," तो टेस्ट कहता है: "बहुत बढ़िया! आप भूल गए!"
  • दोष: यह केवल यह परीक्षण करता है कि क्या मॉडल उत्तर छिपा रहा है। यह यह परीक्षण नहीं करता कि क्या मॉडल ने ज्ञान को मिटा दिया है।
  • समाधान: हमें अपने "अनलर्न" किए गए मॉडल की तुलना एक "री-ट्रेन्ड" (retrained) मॉडल से करने की आवश्यकता है (वह मॉडल जिसने उस खराब डेटा को कभी नहीं देखा था)।

5. लेखकों का समाधान: एक नया नियम पुस्तिका

लेखक इस अव्यवस्था को ठीक करने के लिए तीन मुख्य बदलाव प्रस्तावित करते हैं:

  1. "अनलर्निंग" को एक सामान्य शब्द के रूप में उपयोग करना बंद करें।

    • यदि आप केवल मॉडल को उत्तर देने से मना करने के लिए प्रशिक्षित कर रहे हैं, तो इसे "रिफ्यूज़ल" (Refusal) या "सप्रेशन" (Suppression) कहें।
    • यदि आप वास्तव में एक री-ट्रेन्ड मॉडल के समान होने के लिए प्रशिक्षण के प्रभाव को हटा रहे हैं, तभी इसे "मशीन अनलर्निंग" (Machine Unlearning) कहें।
  2. तुलना के लिए एक "रेफरेंस मॉडल" (Reference Model) का उपयोग करें।

    • आप केवल यह नहीं कह सकते कि "मॉडल भूल गया।" आपको यह कहना होगा कि "मॉडल उस व्यवहार को प्रदर्शित करता है जैसा कि एक मॉडल करता है जिसे उस डेटा के बिना प्रशिक्षित किया गया था।"
    • (लेखक स्वीकार करते हैं कि बड़े मॉडल्स को री-ट्रेन करना महंगा है, लेकिन वे कहते हैं कि हमें सबसे अच्छा प्रॉक्सी उपयोग करना चाहिए या यह स्वीकार करना चाहिए कि हम वास्तविक अनलर्निंग नहीं कर रहे हैं)।
  3. "सुपरपावर्स" (Derived Capabilities) के लिए परीक्षण करें।

    • मॉडल से केवल वही प्रश्न न पूछें जिन पर उसे प्रशिक्षित किया गया था। ऐसे नए प्रश्न पूछें जिनमें वे कौशल शामिल हों जो उसने खराब डेटा से सीखे होंगे। यदि वह उन नए कार्यों को अभी भी कर सकता है, तो अनलर्निंग विफल रही।

सारांश

यह पेपर विज्ञान में ईमानदारी के लिए एक अपील है।

  • "रिफ्यूज़ल" (यह कहना कि "मुझे नहीं पता") को "अनलर्निंग" (याददाश्त मिटाना) न कहें।
  • यह न सोचें कि क्योंकि एक मॉडल प्रश्न का उत्तर नहीं दे रहा है, तो उसने ज्ञान को भुला दिया है। वह केवल लुका-छिपी खेल रहा हो सकता है।
  • अपने परिणामों की तुलना उस मॉडल से करें जिसने शुरुआत में ही उस खराब डेटा को नहीं देखा था।
  • जाँचें कि क्या मॉडल के पास अभी भी वह "सुपरपावर" है जो उसने खराब डेटा से प्राप्त की थी।

यदि हम इस शब्दावली को ठीक नहीं करते हैं, तो हम यह सोचकर सुरक्षित और अनुपालन (compliant) महसूस कर सकते हैं कि हम वास्तव में केवल सच्चाई को छिपा रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →