LLM Unlearning with LLM Beliefs
यह शोध पत्र वर्तमान LLM अनलर्निंग (unlearning) विधियों में "स्क्वीजिंग इफेक्ट" (squeezing effect) की पहचान करता है, जहाँ संभाव्यता द्रव्यमान (probability mass) अर्थ संबंधी रूप से संबंधित पुनर्गठित वाक्यों (rephrasings) की ओर स्थानांतरित हो जाता है, और एक बूटस्ट्रैपिंग फ्रेमवर्क प्रस्तावित करता है जो मॉडल के अपने उच्च-विश्वास वाले विश्वासों (high-confidence beliefs) का लाभ उठाकर लक्षित प्रतिक्रियाओं और उनके पुनर्गठित वाक्यों दोनों को अधिक प्रभावी ढंग से दबाने के साथ-साथ उपयोगिता (utility) को भी सुरक्षित रखता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक बड़ी समस्या: AI की याददाश्त का "व्हैक-ए-मोल" (Whac-A-Mole)
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, बहुत पढ़ा-लिखा लाइब्रेरियन (AI) है जिसने किताबों की एक विशाल लाइब्रेरी को याद कर लिया है। एक दिन, आपको एहसास होता है कि उन किताबों में से एक में कोई खतरनाक रहस्य या कोई निजी पता है जो वहां नहीं होना चाहिए। आप चाहते हैं कि लाइब्रेरियन उसे पूरी तरह से भूल जाए।
आप लाइब्रेरियन से कहते हैं: "कृपया, अब कभी भी 'Secret' (रहस्य) शब्द का उपयोग न करें।"
वर्तमान तरीकों के साथ क्या होता है?
लाइब्रेरियन "Secret" कहने से बचने की बहुत कोशिश करता है। लेकिन क्योंकि उसका दिमाग विचारों को जोड़ने के लिए बना है, जब आप "Secret" शब्द को ब्लॉक करते हैं, तो उसका दिमाग स्वाभाविक रूप से अगली सबसे अच्छी चीज़ की ओर कूद जाता है। "Secret" कहने के बजाय, वह कहना शुरू कर देता है "The hidden thing" (छिपी हुई चीज़), "The confidential info" (गोपनीय जानकारी), या "The private address" (निजी पता)।
लाइब्रेरियन को लगता है कि वह शब्दों को बदलकर मदद कर रहा है, लेकिन वह अभी भी उस रहस्य को उजागर कर रहा है! इसे ही पेपर में "Spurious Unlearning" (छद्म विस्मरण) कहा गया है। ऐसा लगता है जैसे वह भूल गया है, लेकिन उसने बस एक रास्ता (loophole) ढूंढ लिया है।
"स्क्वीजिंग इफेक्ट" (Squeezing Effect): पुराने तरीके क्यों विफल होते हैं
पेपर एक घटना की पहचान करता है जिसे Squeezing Effect कहा जाता है।
कल्पना कीजिए कि लाइब्रेरियन का दिमाग पानी से भरा एक गुब्बारा है (संभावना/probability)। पानी उन सभी चीजों का प्रतिनिधित्व करता है जो लाइब्रेरियन कह सकता है।
- लक्ष्य: आप गुब्बारे के "Secret" वाले हिस्से से पानी बाहर निकालना चाहते हैं।
- समस्या: पानी गायब नहीं होता; यह बस दूसरी जगह चला जाता है। जब आप "Secret" वाले स्थान को दबाते (squeeze) हैं, तो पानी पड़ोसी क्षेत्रों में चला जाता है।
- परिणाम: "पड़ोसी क्षेत्र" वे चीजें हैं जो रहस्य के लगभग समान लगती हैं (शब्दों का फेरबदल)। इसलिए, रहस्य को मिटाने की कोशिश में, आप अनजाने में उन पुनर्व्यवस्थित शब्दों (rephrasings) की आवाज़ को तेज़ कर देते हैं।
मौजूदा AI उपकरण रहस्य को दबाकर मिटाने की कोशिश करते हैं, लेकिन वे यह नहीं समझते कि वे केवल उसके पुनर्व्यवस्थित संस्करणों की आवाज़ को बढ़ा रहे हैं।
नया समाधान: AI के अपने विश्वासों (Beliefs) के साथ "बूटस्ट्रैपिंग" (Bootstrapping)
लेखकों ने एक नया तरीका प्रस्तावित किया है जिसे Bootstrapping (BS) कहा जाता है। नाम "अपने जूतों के फीतों से खुद को ऊपर खींचने" (pulling yourself up by your bootstraps) के विचार से आया है, लेकिन यहाँ इसका अर्थ है AI के अपने विचारों का उपयोग करके उसे भूलने में मदद करना।
मूल विचार सरल है: AI को केवल यह न बताएं कि उसे क्या नहीं कहना है। उसे यह भी बताएं कि उसे वे चीजें भी नहीं कहनी हैं जिन्हें वह सबसे अधिक कहना चाहता है।
जब AI किसी रहस्य को भूलने की कोशिश करता है, तो वह स्वाभाविक रूप से निकटतम, सबसे तार्किक विकल्प कहने की इच्छा रखता है। नया तरीका कहता है: "हमें पता है कि तुम वह विकल्प कहना चाहते हो। हम तुम्हें वह कहने के लिए भी दंडित करेंगे।"
वे इसे दो तरीकों से करते हैं:
1. BS-T (टोकन स्तर): "वर्ड पुलिस" (The Word Police)
कल्पना कीजिए कि लाइब्रेरियन एक वाक्य बोलने वाला है।
- पुराना तरीका: "'Secret' मत कहो।"
- नया तरीका (BS-T): "'Secret' मत कहो। साथ ही, 'Hidden Thing' या 'Confidential Info' भी मत कहो।"
- यह कैसे काम करता है: AI अपने ही दिमाग को देखता है, देखता है कि वह अगला शब्द चुनने के लिए सबसे अधिक संभावित (most likely) किन शब्दों की ओर झुक रहा है (उसके "विश्वास"), और खुद से कहता है: "नहीं, वे भी नहीं।" यह लक्षित शब्द और उन शीर्ष कुछ शब्दों को दबा देता है जिनकी ओर AI झुक रहा था। यह पानी को पड़ोसियों में जाने से रोकता है।
2. BS-S (अनुक्रम स्तर): "स्टोरी पुलिस" (The Story Police)
कभी-कभी, AI केवल एक शब्द नहीं बदलता; वह पूरे वाक्य की संरचना बदल देता है।
- पुराना तरीका: "रहस्य मत बताओ।"
- नया तरीका (BS-S): AI एक पूरी नई कहानी बनाता है जो लगभग रहस्य को उजागर करती है (जैसे, "मैं आपको रहस्य नहीं बता सकता, लेकिन यहाँ एक समान रहस्य के बारे में एक कहानी है...")। नया तरीका उस पूरी उत्पन्न कहानी को लेता है और कहता है, "इस पूरी कहानी को भी मिटा दो।"
- यह कैसे कार्य करता है: यह AI को न केवल विशिष्ट उत्तर को, बल्कि सोचने के उस पूरे मार्ग (path) को भी भूलने के लिए मजबूर करता है जो उत्तर तक ले जाता है।
यह बेहतर क्यों है
इसे व्हाइटबोर्ड पर एक ड्राइंग को मिटाने जैसा समझें।
- पुराना तरीका: आप एक इरेज़र लेते हैं और विशेष रूप से "Secret" शब्द पर ज़ोर से रगड़ते हैं। स्याही फैल जाती है, और अब यह एक बड़े, गंदे धब्बे जैसा दिखता है जो अभी भी शब्द जैसा दिखता है।
- नया तरीका: आप महसूस करते हैं कि रगड़ने से केवल स्याही फैलती है। इसलिए, आप एक गीले कपड़े से शब्द के आस-पास के पूरे क्षेत्र को पोंछ देते हैं, जिसमें फैले हुए निशान भी शामिल हैं, जिससे यह सुनिश्चित होता है कि पूरा हिस्सा साफ हो गया है।
परिणाम
पेपर ने विभिन्न AI मॉडलों पर इसका परीक्षण किया।
- पुराने तरीकों को स्वचालित परीक्षणों (जैसे यह जांचना कि "Secret" शब्द आया या नहीं) में उच्च स्कोर मिला, लेकिन जब मनुष्यों ने उत्तर पढ़े, तो AI अभी भी चतुराई भरे तरीकों से जानकारी लीक कर रहा था।
- नए तरीके ने वास्तव में AI को जानकारी पूरी तरह से भुला दिया। इसने AI को खामियां (loopholes) खोजने से रोका, जबकि AI को अन्य प्रश्नों के उत्तर देने के लिए पर्याप्त स्मार्ट बनाए रखा।
सारांश
यह पेपर एक पेचीदा समस्या को हल करता है जहाँ AI मॉडल चीजों को केवल अपने शब्दों को थोड़ा बदलकर "भूलने" का नाटक करते हैं। लेखकों ने पाया कि AI को न केवल लक्ष्य को, बल्कि उसके अपने "पसंदीदा" वैकल्पिक उत्तरों को भी भूलने के लिए मजबूर करके, वे बिना AI की मददगार होने की क्षमता को नुकसान पहुँचाए, वास्तविक और गहरा विस्मरण प्राप्त कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।