← नवीनतम पेपर
🤖 machine learning

PURGE: Projected Unlearning via Retain-Guided Erasure

यह शोध पत्र PURGE को प्रस्तुत करता है, जो एक मशीन अनलर्निंग एल्गोरिदम है जो निरंतर सीखने (continual learning) और अनलर्निंग के बीच की द्वैतता का लाभ उठाते हुए ग्रेडिएंट प्रोजेक्शन बाधाओं को मल्टी-लेयर रिप्रेजेंटेशन इरेज़र और एक रिटेन-कंफ्यूजन लक्ष्य के साथ जोड़ता है ताकि मॉडल की उपयोगिता को बनाए रखते हुए और मेंबरशिप इंफरेंस हमलों का प्रतिरोध करते हुए विशिष्ट डेटा को प्रभावी ढंग से हटाया जा सके।

मूल लेखक: Vedant Jawandhia, Daksh Ahuja, Ghufran Alam Siddiqui, Prashant Trivedi, Yash Sinha, Pratik Narang

प्रकाशित 2026-06-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vedant Jawandhia, Daksh Ahuja, Ghufran Alam Siddiqui, Prashant Trivedi, Yash Sinha, Pratik Narang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान छात्र है जिसने विशेषज्ञ बनने के लिए किताबों का एक विशाल पुस्तकालय पढ़ा है। अब, कल्पना कीजिए कि एक विशिष्ट व्यक्ति (मान लीजिए, "बॉब") उस छात्र से गोपनीयता कानूनों के कारण उसके बारे में सब कुछ भूल जाने के लिए कहता है।

पुराना, "नादान" तरीका यह है कि छात्र को कहना: "पुस्तकालय में वापस जाओ, बॉब की किताबें बाहर फेंको, और शून्य से फिर से पढ़ना शुरू करो।" यह पूरी तरह से काम करता है, लेकिन इसमें वर्षों लग जाते हैं और बहुत अधिक खर्च आता है।

PURGE एक नया, चतुर शॉर्टकट है। यह एक जादुई इरेज़र (मिटाने वाले यंत्र) की तरह है जो छात्र के दिमाग से बॉब के प्रभाव को हटा देता है बिना उसके द्वारा सीखी गई बाकी चीजों को भुलाए।

यह पेपर इस प्रक्रिया को सरल उपमाओं (analogies) का उपयोग करके कैसे समझाता है, यहाँ दिया गया है:

1. मूल विचार: एक ही सिक्के के दो पहलू

लेखकों ने कुछ दिलचस्प देखा: सीखना (Learning) और भूलना (Forgetting) वास्तव में एक ही समस्या के विपरीत पहलू हैं।

  • सीखना (निरंतर सीखना - Continual Learning): आप एक नया कौशल (जैसे गिटार बजाना) सीखना चाहते हैं बिना अपने पुराने कौशल (जैसे पियानो बजाना) को भूले।
  • भूलना (मशीन अनलर्निंग - Machine Unlearning): आप एक विशिष्ट स्मृति (बॉब) को मिटाना चाहते हैं बिना लाइब्रेरी की बाकी चीजों को भुलाए।

पेपर कहता है, "आइए उस गणित को उधार लें जिसका उपयोग नई चीजें सीखने के लिए किया जाता है और उसे चीजों को भूलने में मदद करने के लिए उलट दें।"

2. जादू का खेल: "गार्डरेल" (ग्रेडिएंट प्रोजेक्शन)

जब छात्र बॉब की याददाश्त मिटाने की कोशिश करता है, तो वह गलती से फूलों का एक फूलदान (रिटेन सेट या अन्य डेटा) गिरा सकता है।

PURGE एक तकनीक का उपयोग करता है जिसे ग्रेडिएंट प्रोजेक्शन (Gradient Projection) कहा जाता है। इसे एक गार्डरेल (सुरक्षा घेरा) या एक बाउंसर के रूप में सोचें।

  • हर बार जब छात्र बॉब को मिटाने के लिए एक कदम उठाने की कोशिश करता है, तो बाउंसर जाँच करता है: "क्या यह कदम फूलों को नुकसान पहुँचाएगा?"
  • यदि उत्तर "हाँ" है, तो बाउंसर छात्र के पैर को धीरे से वापस धकेलता है ताकि वह केवल उसी दिशा में आगे बढ़े जिससे फूलों को कोई नुकसान न पहुँचे।
  • यह गारंटी देता है कि जबकि वे बॉब को मिटा रहे हैं, बाकी उनका ज्ञान सुरक्षित और सटीक रहता है।

3. "नकली भ्रम" की रणनीति (रिटेन-कन्फ्यूजन टारगेट)

आमतौर पर, जब आप किसी मॉडल को कुछ भूलने के लिए कहते हैं, तो आप उसे यादृच्छिक रूप से अनुमान लगाने (जैसे पासा फेंकना) के लिए कहते हैं। पेपर ने इसमें एक समस्या पाई: रोबोट नकली यादृच्छिकता (randomness) को पहचानने में बहुत माहिर होते हैं। यदि कोई मॉडल अचानक से यादृच्छिक अनुमान लगाने लगता है, तो एक हैकर बता सकता है, "अहा! इस मॉडल को कुछ भूलने के लिए मजबूर किया गया था!"

इसके बजाय, PURGE एक रिटेन-कन्फ्यूजन टारगेट (Retain-Confusion Target) का उपयोग करता है।

  • कल्पना कीजिए कि छात्र उन किताबों को देखता है जिन्हें उसने रखा है और देखता है कि वह कहाँ भ्रमित होता है। शायद वह कभी-कभी "बिल्लियों" और "कुत्तों" के बीच भ्रमित हो जाता है।
  • बॉब को मिटाते समय, छात्र को बताया जाता है: "यादृच्छिक अनुमान न लगाओ। इसके बजाय, ठीक उसी भ्रमित तरीके से अनुमान लगाओ जैसे तुम रखी हुई किताबों के साथ होते हो।"
  • यह "मिटाए गए" मॉडल को बिल्कुल वैसा ही बना देता है जैसा कि वह छात्र होता जिसने कभी बॉब को देखा ही न हो। एक हैकर के लिए, अंतर करना असंभव है।

4. गहरा सफ़ाई: "अंतरात्मा की भावना" को मिटाना

कभी-कभी, भले ही मॉडल सही उत्तर देना बंद कर दे, फिर भी वह अपने दिमाग के भीतर (मध्यवर्ती परतों में) सही उत्तर को "महसूस" करता है।

  • पुराने तरीके केवल मॉडल को अंत में (आउटपुट पर) गलत उत्तर देने से रोकने के लिए कहते हैं।
  • PURGE और गहराई तक जाता है। यह "अंतरात्मा की भावना" (इंटरमीडिएट रिप्रेजेंटेशन) को पूरी तरह साफ कर देता है, जिससे आंतरिक मस्तिष्क गतिविधि ऐसी दिखने लगती है जैसे वह उस व्यक्ति की गतिविधि हो जिसने कभी बॉब को नहीं जाना था।

5. "ऑटो-स्टॉप" बटन

छात्र को यह कैसे पता चलेगा कि मिटाना कब रोकना है?

  • पुराना तरीका: आपको मिनटों को गिनना पड़ता है या यह अनुमान लगाना पड़ता है कि कितनी बार अभ्यास करना है।
  • PURGE का तरीका: इसके पास दो स्व-विनियमित (self-regulating) स्टॉप साइन हैं:
    1. बजट: "यदि हम फूलों (रिटेन डेटा) को बहुत अधिक नुकसान पहुँचाने लगते हैं, तो तुरंत रुक जाएँ।"
    2. लक्ष्य: "यदि बॉब की स्मृति इतनी धुंधली हो जाती है कि हम यादृच्छिक संभावना (random chance) से बेहतर उसका अनुमान नहीं लगा सकते, तो रुक जाएँ।"
      इसका मतलब है कि एल्गोरिदम खुद तय करता है कि वह कब समाप्त हुआ, ताकि इंसानों को अनुमान न लगाना पड़े।

6. "फ्रोजन स्टैटिस्टिक" का आश्चर्य

पेपर ने एक छिपा हुआ जाल पाया: जब आप डेटा के एक पूरे वर्ग (जैसे "बिल्लियों" की सभी तस्वीरें) को मिटाते हैं, तो मॉडल का आंतरिक कैलकुलेटर (BatchNorm) भ्रमित हो जाता है क्योंकि वह केवल "बिल्लियों" को देखता है और "कुत्तों" को कैसे संभालना है, यह भूल जाता है।

  • समाधान: लेखकों ने महसूस किया कि उन्हें इस कैलकुलेटर को फ्रीज (जमना/स्थिर करना) करना होगा ताकि यह अजीब, एकतरफा डेटा के साथ अपने आँकड़ों को अपडेट न करे। यह एक सर्जरी के दौरान कैलकुलेटर को यह बताने जैसा है, "जब हम यह कर रहे हों, तो अपनी सेटिंग्स न बदलें।" इसके बिना, पूरा सिस्टम क्रैश हो जाता है।

परिणाम: उन्होंने क्या पाया?

लेखकों ने पांच अलग-अलग प्रकार के डेटा (हाथ से लिखे नंबरों से लेकर मेडिकल इमेज तक) पर परीक्षण किया।

  • गोपनीयता (Privacy): "मिटाया गया" मॉडल इतना अच्छा है कि हैकर यह नहीं बता सकते कि बॉब उनके प्रशिक्षण डेटा में था या नहीं (0.5 का स्कोर, जो कि परफेक्ट है)।
  • उपयोगिता (Utility): मॉडल बाकी सब कुछ 96%+ सटीकता के साथ याद रखता है।
  • गति (Speed): यह पूरे मॉडल को शून्य से फिर से प्रशिक्षित करने की तुलना में लगभग 13 गुना तेज़ है।

संक्षेप में: PURGE एक तेज़, सुरक्षित और स्मार्ट तरीका है जिससे AI की याददाश्त से विशिष्ट डेटा को मिटाया जा सकता है। यह यह सुनिश्चित करने के लिए कि AI अनजाने में अपना बाकी ज्ञान न भूल जाए या हैकर्स द्वारा पकड़ा न जाए, AI के सीखने के तरीकों से ही कुछ ट्रिक्स उधार लेता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →