Natively Unlearnable Large Language Models
यह शोध पत्र NULLs (Natively Unlearnable LLMs) को प्रस्तुत करता है, जो एक ऐसा मॉडल आर्किटेक्चर है जो साझा बैकबोन न्यूरॉन्स और विरल रूप से सक्रिय स्रोत-विशिष्ट सिंक्स (source-specific sinks) का उपयोग करता है ताकि संयुक्त शिक्षण और सामान्य भाषा क्षमताओं के लाभों को संरक्षित करते हुए व्यक्तिगत प्रशिक्षण स्रोतों के कुशल, सुदृढ़ और डेटा-मुक्त अनलर्निंग (unlearning) को सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल मस्तिष्क (एक लार्ज लैंग्वेज मॉडल) के भीतर ज्ञान का एक विशाल पुस्तकालय बना रहे हैं। आमतौर पर, जब आप इस मस्तिष्क को सिखाते हैं, तो आप सब कुछ आपस में मिला देते हैं। यदि आप इसे "हैरी पॉटर" के बारे में एक तथ्य और "द्वितीय विश्व युद्ध" के बारे में एक तथ्य सिखाते हैं, तो वे यादें एक ही न्यूरॉन्स में उलझ जाती हैं। यदि बाद में आपको कानूनी अनुरोध के कारण "हैरी पॉटर" की याद मिटानी पड़ती है, तो यह एक स्वेटर से एक अकेला धागा निकालने जैसा है बिना पूरे स्वेटर को उधेड़े। आप अनजाने में इतिहास का पाठ भी मिटा सकते हैं, या हैरी पॉटर की याद वापस आ सकती है।
यह पेपर इन AI मस्तिष्कों को बनाने का एक नया तरीका पेश करता है जिसे NULLs (नेटीवली अनलर्नबल एलएलएम्स - Natively Unlearnable LLMs) कहा जाता है। सब कुछ एक बड़े ढेर में मिलाने के बजाय, NULLs पहले दिन से ही एक विशेष "सॉर्टिंग सिस्टम" के साथ मस्तिष्क का निर्माण करता है।
यह कैसे काम करता है, सरल उपमाओं का उपयोग करके यहाँ दिया गया है:
1. "साझा रसोई" बनाम "व्यक्तिगत लॉकर" (The Shared Kitchen vs. Personal Lockers)
सोचिए कि AI का मस्तिष्क दो प्रकार के स्टोरेज रखता है:
- साझा रसोई (द बैकबोन): यह वह जगह है जहाँ AI उन सामान्य चीजों को सीखता है जो हर चीज़ पर लागू होती हैं, जैसे व्याकरण, वाक्य कैसे बनाए जाते हैं, या दुनिया के बारे में सामान्य तथ्य (जैसे, "पेरिस फ्रांस में है")। सभी इस रसोई का उपयोग करते हैं।
- व्यक्तिगत लॉकर (द सिंक्स): यह नया आविष्कार है। सूचना के प्रत्येक विशिष्ट स्रोत (जैसे विकिपीडिया का एक एकल लेख या एक विशिष्ट पुस्तक) के लिए, AI को "लॉकरों" (न्यूरॉन्स) का एक अनूठा सेट दिया जाता है जिसका उपयोग केवल वही स्रोत कर सकता है।
जब AI एक ऐसा तथ्य सीखता है जो एक लेख के लिए विशिष्ट है (जैसे किसी समाचार कहानी में एक विशिष्ट व्हिसलब्लोअर का नाम), तो वह स्वाभाविक रूप से उस तथ्य को उस लेख के व्यक्तिगत लॉकर में संग्रहीत करता है। जब वह एक सामान्य तथ्य सीखता है (जैसे "व्हिसलब्लोअर्स महत्वपूर्ण होते हैं"), तो वह साझा रसोई में जाता है।
2. जादुई स्विच (अनलर्निंग)
मानक AI में, यदि आप कुछ भूलना चाहते हैं, तो आपको पूरे मस्तिष्क को फिर से प्रशिक्षित करना होगा या वेट्स (weights) को सर्जिकल तरीके से हटाने की कोशिश करनी होगी, जो अक्सर अन्य चीजों को खराब कर देता है।
NULLs के साथ, "अनलर्निंग" (भूलना) केवल एक लाइट स्विच बंद करने जितना सरल है।
- यदि कोई प्रकाशक कहता है, "हमारे मॉडल से वह विशिष्ट लेख हटा दें," तो आपको फिर से प्रशिक्षण देने की आवश्यकता नहीं है। आप बस उस लेख के लिए निर्धारित "व्यक्तिगत लॉकर" को अक्षम कर देते हैं।
- AI तुरंत उस लेख के अद्वितीय तथ्यों को भूल जाता है क्योंकि उसका लॉकर लॉक है।
- हालाँकि, साझा रसोई खुली रहती है। AI अभी भी उस विषय के बारे में सामान्य तथ्य जानता है क्योंकि वे सामान्य क्षेत्र में संग्रहीत हैं, न कि विशिष्ट लॉकर में।
यह ऐसा है जैसे आपके पास एक घर हो जिसमें मेहमानों के लिए एक साझा लिविंग रूम और हर मेहमान के लिए एक अलग बेडरूम हो। यदि कोई मेहमान जाता है, तो आप बस उनके बेडरूम का दरवाजा लॉक कर देते हैं। लिविंग रूम (जहाँ सभी मिलते हैं) बिल्कुल वैसा ही रहता है, और घर बिखरता नहीं है।
3. शोधकर्ताओं ने क्या पाया
शोधकर्ताओं ने इस विचार का परीक्षण दो मुख्य तरीकों से किया:
- विकिपीडिया टेस्ट (फाइन-ग्रेन्ड): उन्होंने एक मॉडल को 6 मिलियन विकिपीडिया लेखों पर प्रशिक्षित किया। वे देखना चाहते थे कि क्या वे समान लेखों में पाए जाने वाले सामान्य ज्ञान को हटाए बिना केवल एक लेख को हटा सकते हैं।
- परिणाम: जब उन्होंने एक लेख के लिए लॉकर को "लॉक" किया, तो मॉडल ने उस लेख के अद्वितीय विवरणों को भुला दिया लेकिन अन्य लेखों द्वारा साझा किए गए सामान्य ज्ञान को बनाए रखा। यह लगभग उतना ही प्रभावी था जितना कि यदि उन्होंने लेख को फेंक दिया होता और मॉडल को शुरू से फिर से प्रशिक्षित किया होता (जो आमतौर पर बहुत महंगा होता है)।
- हैरी पॉटर टेस्ट (कोर्स-ग्रेन्ड): उन्होंने पूरे हैरी पॉटर बुक सीरीज़ पर एक मॉडल को प्रशिक्षित किया और फिर सारा हैरी पॉटर ज्ञान हटाने की कोशिश की।
- परिणाम: जब उन्होंने "हैरी पॉटर लॉकर" को बंद कर दिया, तो मॉडल जादूगरों के बारे में बात करना बंद कर गया और हैरी पॉटर वाक्यों के साथ सामान्य चीजों (जैसे सिटी काउंसिल मीटिंग) के बारे में बात करने लगा।
- बोनस: उन्होंने मॉडल को हैरी पॉटर को फिर से याद करने के लिए "एडवर्सरियल" प्रॉम्प्ट्स या थोड़ा फिर से सिखाने की कोशिश करके चकमा देने का प्रयास किया। मानक AI मॉडल विफल रहे और जल्दी से किताबें याद कर लीं। NULLs मॉडल ने, "अनलर्न" रहना बनाए रखा और इन चालों का विरोध किया।
4. क्या इससे AI कम बुद्धिमान हो जाता है?
एक बड़ी चिंता यह है कि यदि आप यादों को अलग करते हैं, तो AI सामान्य कार्यों में खराब हो सकता है। शोधकर्ताओं ने मानक भाषा बेंचमार्क (जैसे विज्ञान के प्रश्नों का उत्तर देना या तर्क पहेलियाँ हल करना) पर इसका परीक्षण किया।
- परिणाम: NULLs मॉडल ने एक मानक, गैर-विशेषज्ञ AI की तरह ही प्रदर्शन किया। उसने अपनी सामान्य बुद्धिमत्ता नहीं खोई।
सारांश
यह पेपर तर्क देता है कि हमें डेटा को डिलीट करने का तरीका यह सोचने के लिए कि AI को प्रशिक्षित किया गया है, उसका इंतज़ार नहीं करना चाहिए। इसके बजाय, हमें "डिलीट बटन" को सीधे आर्किटेक्चर में बनाना चाहिए। हर डेटा स्रोत को उसके अपने समर्पित "लॉकर" देते हुए और एक सामान्य "रसोई" साझा करते हुए, हम शेष मॉडल को तोड़े बिना या सब कुछ शुरू से फिर से प्रशिक्षित किए बिना विशिष्ट जानकारी को सर्जिकल तरीके से हटा सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।