← नवीनतम पेपर
🤖 machine learning

Auditing of Unlearning Algorithms

यह शोध पत्र एक व्यावहारिक ऑडिटिंग फ्रेमवर्क प्रस्तुत करता है जो अनलर्निंग गारंटी (unlearning guarantees) पर डेटा-निर्भर निचली सीमाओं की गणना करने के लिए मेंबरशिप इन्फरेंस हमलों का उपयोग करता है, जो एक तीव्र प्रदर्शन अंतराल को प्रकट करता है जहाँ कठोरता से प्रमाणित एल्गोरिदम प्रभावी रूप से डेटा प्रभाव को हटा देते हैं जबकि अनुभवजन्य विधियाँ ऐसा करने में विफल रहती हैं।

मूल लेखक: Sahasrajit Sarmasarkar, Anastasia Koloskova, Sanmi Koyejo

प्रकाशित 2026-07-08
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Sahasrajit Sarmasarkar, Anastasia Koloskova, Sanmi Koyejo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अत्यंत बुद्धिमान पुस्तकालय (एक मशीन लर्निंग मॉडल) है जिसने कहानियाँ लिखना सीखने के लिए लाखों किताबें पढ़ी हैं। एक दिन, एक विशिष्ट लेखक यह मांग करता है कि उनकी किताब को पुस्तकालय की स्मृति से हटा दिया जाए क्योंकि वे चाहते हैं कि उन्हें "भ भुला दिया जाए।"

समस्या:
सिर्फ किताब को शेल्फ से हटा देना काफी नहीं है। लाइब्रेरियन (AI) ने पहले ही लेखक की शैली, शब्दावली और कथानक के मोड़ों को याद कर लिया है। यदि आप लाइब्रेरियन को एक कहानी लिखने के लिए कहते हैं, तो वे अनजाने में उस लेखक के विशिष्ट वाक्यांशों का उपयोग कर सकते हैं। एक चतुर जासूस (एक एडवर्सरी) लाइब्रेरियन से विशिष्ट प्रश्न पूछकर पता लगा सकता है, "आह, इस लाइब्रेरियन ने निश्चित रूप से वह विशिष्ट पुस्तक पढ़ी थी!"

समाधान (अनलर्निंग/विस्मरण):
इसे ठीक करने के लिए, डेवलपर्स ने "अनलर्निंग एल्गोरिदम" बनाए हैं। ये विशेष प्रक्रियाएं हैं जिन्हें पुस्तकालय की स्मृति को इतनी अच्छी तरह से साफ करने के लिए डिज़ाइन किया गया है कि वह बिल्कुल वैसा व्यवहार करे जैसे वह लेखक की पुस्तक वहां कभी थी ही नहीं। इनमें से कुछ "प्रमाणित" (certified) होते हैं, जिसका अर्थ है कि वे एक गणितीय गारंटी (जैसे एक वारंटी) के साथ आते हैं कि स्मृति वास्तव में मिटा दी गई है। अन्य "ह्यूरिस्टिक" (heuristic) होते हैं, जिसका अर्थ है कि वे वास्तव में भूलने की पूरी कोशिश करते हैं, लेकिन उनके पास कोई औपचारिक गारंटी नहीं होती है।

बड़ा सवाल:
हमें कैसे पता चलेगा कि लाइब्रेरियन वास्तव में भूल गया है? यह शोध पत्र एक नया टूल पेश करता है जिसे ऑडिटर (Auditor) कहा जाता है। इसे AI की स्मृति के लिए एक "झूठ पकड़ने वाले टेस्ट" (Lie Detector Test) के रूप में समझें।

ऑडिटर कैसे काम करता है (जासूसी का खेल):
ऑडिटर, AI के साथ एक अनुमान लगाने वाला खेल खेलता है:

  1. सेटअप: ऑडिटर किताबों का एक बड़ा ढेर लेता है और उन्हें कई छोटे समूहों में विभाजित करता है।
  2. चाल: एक दौर में, ऑडिटर AI को कहता है कि "समूह A" को भूल जाओ। अगले दौर में, वह AI को कहता है कि "समूह B" को भूल जाओ। AI को यह नहीं पता होता कि वास्तव में कौन सा समूह हटाया गया है; वह बस इतना जानता है कि कुछ समूह हटाया गया है।
  3. अनुमान: समूह को हटाने के बाद, ऑडिटर पूछता है: "आपने वास्तव में किस समूह को भुला दिया?"
  4. स्कोर:
    • यदि AI अनलर्निंग करने में अच्छा है, तो वह भ्रमित होना चाहिए। वह यह अंतर नहीं बता पाना चाहिए कि "समूह A हटाया गया था" और "समूह B हटाया गया था" के बीच क्या अंतर है। ऑडिटर के अनुमान यादृच्छिक (random) होंगे (जैसे सिक्का उछालना)।
    • यदि AI अनलर्निंग करने में बुरा है, तो उसमें अभी भी जानकारी के "लीक" (leaks) मौजूद होंगे। ऑडिटर सही अनुमान लगाने में यादृच्छिक संयोग (random chance) से बेहतर प्रदर्शन करेगा।

"ε" (एप्सिलॉन) स्कोर:
यह शोध पत्र भूलने की स्थिति कितनी खराब है, इसे ε (एप्सिलॉन) नामक संख्या से मापता है।

  • कम ε: AI वास्तव में भूल रहा है। ऑडिटर यादृच्छिक संयोग से बेहतर अनुमान नहीं लगा सकता। "वारंटी" कायम है।
  • उच्च ε: AI झूठ बोल रहा है। ऑडिटर आसानी से अनुमान लगा सकता है कि कौन सा डेटा हटाया गया था। "वारंटी" टूट गई है।

शोध पत्र ने क्या पाया:
लेखकों ने इस ऑडिटर का दो प्रकार के पुस्तकालयों पर परीक्षण किया:

  1. "प्रमाणित" (Certified) पुस्तकालय: ये कठोर, गणित-आधारित तरीकों (जैसे शोर जोड़ना या समय को पीछे ले जाना) का उपयोग करते हैं।
    • परिणाम: ऑडिटर को लगभग कोई लीक नहीं मिला। ε स्कोर बहुत कम था। ये तरीके वास्तव में वादे के अनुसार काम करते हैं।
  2. "ह्यूरिस्टिक" (Heuristic) पुस्तकालय: ये त्वरित और आसान तरीकों (जैसे शेष पुस्तकों पर फिर से प्रशिक्षण देना या डेटा को दूर धकेलकर "अनलर्न" करने की कोशिश करना) का उपयोग करते हैं।
    • परिणाम: ऑडिटर को इसमें भारी लीक्स मिले। ε स्कोर बहुत अधिक था (कभी-कभी 50 या 60!)। इसका मतलब है कि ये तरीके वास्तव में डेटा को भूल नहीं रहे हैं, भले ही वे दावा करते हों कि वे कुशल हैं।

निष्कर्ष:
इस शोध पत्र ने "नकली" अनलर्निंग को उजागर करने के लिए एक व्यावहारिक उपकरण बनाया है। यह दिखाता है कि जहां कुछ जटिल, प्रमाणित तरीके वास्तव में डेटा को हटा देते हैं, वहीं कई लोकप्रिय, तेज़ तरीके केवल भूलने का नाटक कर रहे हैं। यदि आप गोपनीयता की रक्षा के लिए उन तेज़ तरीकों पर भरोसा करते हैं, तो आप मुसीबत में पड़ सकते हैं क्योंकि डेटा अभी भी वहीं है, जो सामने ही छिपा हुआ है।

संक्षेप में: यह शोध पत्र कहता है, "केवल AI पर भरोसा न करें जब वह कहता है कि वह भूल गया है। यह जांचने के लिए हमारे ऑडिटर का उपयोग करें कि क्या वह वास्तव में सच बोल रहा है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →