← नवीनतम पेपर
💬 NLP

From Anchors to Supervision: Memory-Graph Guided Corpus-Free Unlearning for Large Language Models

यह शोध पत्र MAGE का प्रस्ताव करता है, जो एक कॉर्पस-मुक्त अनलर्निंग फ्रेमवर्क है जो हल्के उपयोगकर्ता एंकर्स (user anchors) का उपयोग करके लक्षित स्मृति (target memorization) को स्वचालित रूप से रिकवर और व्यवस्थित करने के लिए एक मेमोरी ग्राफ में बदल देता है, जिससे मूल प्रशिक्षण डेटा तक पहुंच की आवश्यकता के बिना बड़े भाषा मॉडलों से संवेदनशील सामग्री को प्रभावी ढंग से मिटाने के लिए स्कोप्ड सुपरविजन (scoped supervision) उत्पन्न किया जा सके।

मूल लेखक: Wenxuan Li, Zhenfei Zhang, Mi Zhang, Geng Hong, Mi Wen, Xiaoyu You, Min Yang

प्रकाशित 2026-04-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenxuan Li, Zhenfei Zhang, Mi Zhang, Geng Hong, Mi Wen, Xiaoyu You, Min Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, सुपर-स्मार्ट डिजिटल लाइब्रेरियन है जिसका नाम LLM (लार्ज लैंग्वेज मॉडल) है। इस लाइब्रेरियन ने इंटरनेट पर लगभग सब कुछ पढ़ लिया है। क्योंकि इसने बहुत कुछ पढ़ा है, इसलिए यह कभी-कभी ऐसी चीजें भी याद रख लेता है जो इसे नहीं याद रखनी चाहिए, जैसे कि किसी सेलिब्रिटी का निजी घर का पता या किसी कॉपीराइट वाली किताब का अध्याय।

जब कोई कहता है, "मैं चाहता हूँ कि तुम इसे भूल जाओ," तो लाइब्रेरियन आमतौर पर यह भूलने के लिए एक सटीक सूची (list) मांगता है।

समस्या: खतरनाक "भूलने की सूची" (The Dangerous "Forget List")

पुराने तरीके में, उपयोगकर्ता को लाइब्रेरियन को एक भौतिक सूची (एक "फॉरगेट सेट") देनी पड़ती थी जिसमें लिखा होता था, "यहाँ एलिस के बारे में पन्ने हैं; कृपया इन्हें जला दें।"

यह तीन बड़ी समस्याएँ पैदा करता है:

  1. प्राइवेसी लीक (Privacy Leak): सूची देने के लिए, उपयोगकर्ता को संवेदनशील जानकारी फिर से अपलोड करनी पड़ती है। यदि लाइब्रेरियन का सर्वर हैक हो जाता है, तो वह संवेदनशील जानकारी दूसरी बार लीक हो जाती है।
  2. "नकली" सूची (The "Fake" List): एक बुरा व्यक्ति एक ऐसी सूची दे सकता है जिसमें लिखा हो, "एलिस को भूल जाओ," लेकिन गुप्त रूप से इसमें बॉब (एक अन्य निर्दोष व्यक्ति) के बारे में पन्ने शामिल हों या इसमें एक वायरस शामिल हो जो लाइब्रेरियन के दिमाग को खराब कर दे।
  3. जांचना कठिन है (Hard to Check): लाइब्रेरियन को उपयोगकर्ता पर भरोसा करना पड़ता है। यह जांचना कठिन है कि क्या सूची ईमानदार है, क्योंकि इसके लिए हर एक पन्ने को पढ़ना पड़ेगा, जिसमें बहुत समय लगता है।

समाधान: MAGE (मेमोरी डिटेक्टिव)

इस शोध पत्र के लेखक एक नया सिस्टम प्रस्तावित करते हैं जिसे MAGE कहा जाता है। उपयोगकर्ता से सूची मांगने के बजाय, MAGE एक मेमोरी डिटेक्टिव (याददाश्त का जासूस) की तरह काम करता है।

MAGE कैसे काम करता है, इसका एक सरल उदाहरण यहाँ दिया गया है:

1. "एंकर" (नाम का टैग)

एक लंबी सूची के बजाय, उपयोगकर्ता MAGE को बस एक छोटा सा एंकर देता है।

  • उपयोगकर्ता कहता है: "एलिस के बारे में सब कुछ भूल जाओ।"
  • MAGE कहता है: "समझ गया। बस 'एलिस' नाम। मैं बाकी सब संभाल लूँगा।"

2. "मेमोरी ग्राफ" (संबंधों का जाल)

MAGE केवल अनुमान नहीं लगाता। यह "एलिस" नाम से शुरुआत करता है और लाइब्रेरियन से पूछता है, "तुम एलिस से संबंधित किसे जानते हो?"

  • लाइब्रेरियन कहता है: "टेलर स्विफ्ट।"
  • MAGE पूछता है: "तुम टेलर स्विफ्ट से संबंधित किसे जानते हो?"
  • लाइब्रेरियन कहता है: "न्यूयॉर्क," "2008," "लव स्टोरी।"

MAGE इन संबंधों का एक मकड़ी का जाल (ग्राफ) बनाता है। यह "एलिस" और "टेलर स्विफ्ट" के बीच रेखाएं खींचता है, और "टेलर स्विफ्ट" और "न्यूयॉर्क" के बीच भी। यह इन रेखाओं को एक भार (weight) भी देता है: यदि लाइब्रेरियन "लव स्टोरी" का हजारों बार उल्लेख करता है, तो वह रेखा मोटी और मजबूत है। यदि वे "पेंसिल्वेनिया" का एक बार उल्लेख करते हैं, तो वह रेखा पतली है।

यह जाल दर्शाता है कि लाइब्रेरियन ने एलिस के बारे में वास्तव में क्या याद रखा है, बिना उपयोगकर्ता द्वारा कोई संवेदनशील डेटा अपलोड किए।

3. "स्कोपड सुपरविजन" (लक्षित इरेज़र)

अब जब MAGE के पास जाल है, तो उसे लाइब्रेरियन को भूलना सिखाना होगा।

  • फॉरगेट सेट (The Forget Set): MAGE जाल में मोटी, मजबूत रेखाओं (उन चीजों को जो लाइब्रेरियन सबसे स्पष्ट रूप से याद रखता है) को देखता है और परीक्षण के लिए विशिष्ट प्रश्न बनाता है।
    • उदाहरण प्रश्न: "'लव स्टोरी' किसने रिलीज़ किया?" (उत्तर: एलिस/टेलर स्विफ्ट)।
      MAGE लाइब्रेरियन को इन विशिष्ट प्रश्नों के लिए "मुझे नहीं पता" या "मुझे याद नहीं है" कहना सिखाता है।
  • नेबर सेट (The Neighbor Set - सुरक्षा कवच): MAGE उन पतली रेखाओं को भी देखता है (ऐसी चीजें जो संबंधित तो हैं लेकिन एलिस के बारे में नहीं हैं, जैसे एड शीरन)। यह उनके लिए भी प्रश्न बनाता है।
    • उदाहरण प्रश्न: "'न्यूयॉर्क' किसने रिलीज़ किया?" (उत्तर: एड शीरन)।
      MAGE लाइब्रेरियन को इस प्रश्न का सही उत्तर देते रहने के लिए प्रशिक्षित करता है। यह सुनिश्चित करता है कि लाइब्रेरियन गलती से एड शीरन को न भूल जाए क्योंकि वह एलिस को भूलने की कोशिश कर रहा है।

यह बेहतर क्यों है?

  • कोई प्राइवेसी जोखिम नहीं: उपयोगकर्ता कभी भी संवेदनशील डेटा अपलोड नहीं करता। लाइब्रेरियन खुद अपनी याददाश्त से इसे बाहर निकालता है।
  • कोई धोखाधड़ी नहीं: चूंकि MAGE खुद अपनी सूची बनाता है, इसलिए कोई बुरा व्यक्ति सिस्टम को तोड़ने के लिए नकली सूची नहीं डाल सकता।
  • सटीकता (Precision): यह हथौड़े के बजाय स्कैल्पल (सर्जिकल चाकू) के उपयोग जैसा है। यह एलिस के बारे में विशिष्ट यादों को हटा देता है जबकि लाइब्रेरियन के बाकी ज्ञान (जैसे गणित या इतिहास) को बरकरार रखता है।

परिणाम

इस शोध पत्र ने इसे दो अलग-अलग "लाइब्रेरियनों" (AI मॉडल्स) पर टेस्ट किया। उन्होंने पाया कि MAGE पुराने तरीकों की तरह ही लक्षित व्यक्ति को भुलाने में उतना ही अच्छा था, लेकिन इसने यह सब बिना उपयोगकर्ता द्वारा किसी खतरनाक डेटा की सूची दिए किया।

संक्षेप में: MAGE "गुप्त सूचनाओं की सूची सौंपने" की एक जोखिम भरी, मैनुअल प्रक्रिया को "AI के अपने दिमाग के भीतर ब्रेडक्रंब्स (रोटी के टुकड़ों) के निशान का पीछा करके रहस्यों को खोजने और मिटाने" की एक सुरक्षित, स्वचालित प्रक्रिया में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →