Layer-Targeted Multilingual Knowledge Erasure in Large Language Models
यह शोध पत्र इंटरवेंशन डेप्थ (हस्तक्षेप की गहराई) को लार्ज लैंग्वेज मॉडल्स में बहुभाषी ज्ञान अनलर्निंग (knowledge unlearning) की विफलता के पीछे महत्वपूर्ण कारक के रूप में पहचानता है और MUTE का प्रस्ताव करता है, जो एक ऐसा फ्रेमवर्क है जो मॉडल उपयोगिता को बनाए रखते हुए सुदृढ़ क्रॉस-लिंगुअल इरेज़र (cross-lingual erasure) प्राप्त करने के लिए मध्यवर्ती, भाषा-अज्ञेय (language-agnostic) परतों को लक्षित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक विशाल, बहुभाषी पुस्तकालय (AI मॉडल) है जो दुनिया के बारे में सब कुछ जानता है, जैसे कि केक कैसे बनाया जाए से लेकर बम कैसे बनाया जाए तक। कभी-कभी, हमें इस पुस्तकालय से कुछ विशिष्ट खतरनाक किताबों को हटाना पड़ता है ताकि कोई उन्हें पढ़ न सके। इस प्रक्रिया को "अनलर्निंग" (unlearning) कहा जाता है।
हालाँकि, एक बड़ी समस्या है: यदि आप अंग्रेजी में लिखी गई किसी खतरनाक किताब को हटाते हैं, तो AI अक्सर अभी भी जानता है कि अगर आप स्पेनिश, फ्रेंच या हिंदी में पूछें तो बम कैसे बनाया जाए। यह ऐसा है जैसे आपने अंग्रेजी संस्करण के पन्ने तो फाड़ दिए हों, लेकिन अन्य भाषाओं के संस्करणों में आरेख (diagrams) और निर्देश बरकरार छोड़ दिए हों।
"लेयर-टारगेटेड मल्टीलिंगुअल नॉलेज इरेज़र" (Layer-Targeted Multilingual Knowledge Erasure) नामक यह शोध पत्र इस पहेली को सुलझाता है कि AI के मस्तिष्क के भीतर कहाँ पर "सर्जरी" करनी है।
समस्या: गलत गहराई (The Wrong Depth)
शोधकर्ताओं ने पाया कि AI मॉडल एक बहुमंजिला इमारत की तरह बने होते हैं, और आप कहाँ हस्तक्षेप करते हैं, यह बहुत मायने रखता है:
- बेसमेंट (उथले स्तर/Shallow Layers): यदि आप यहाँ ज्ञान मिटाने की कोशिश करते हैं, तो आप नींव को ही हिला देते हैं। AI उस खतरनाक जानकारी को तो भूल जाता है, लेकिन वह यह भी भूल जाता है कि किसी भी भाषा को ठीक से कैसे बोला जाए। यह एक विशिष्ट पुस्तक को हटाने के लिए पूरी लाइब्रेरी को जलाने जैसा है। खतरनाक जानकारी तो चली जाती है, लेकिन उसके साथ सब कुछ भी चला जाता है।
- पेंटहाउस (गहरे स्तर/Deep Layers): यदि आप सबसे ऊपरी मंजिल पर ज्ञान मिटाने की कोशिश करते हैं, तो आप बहुत देर कर चुके होते हैं। जब तक जानकारी ऊपरी मंजिल तक पहुँचती है, AI उसे विशिष्ट भाषाई निर्देशों में अनुवाद कर चुका होता है (जैसे "स्पेनिश में 'बोंबा' शब्द लिखना")। यदि आप यहाँ निर्देश को हटा देते हैं, तो AI इसे कहने का कोई दूसरा तरीका ढूंढ लेता है। वह खतरनाक ज्ञान निचली मंजिलों में छिपा रहता है, जिसका उपयोग करने के लिए तैयार रहता है।
परिणाम: या तो आप AI की बोलने की क्षमता को तोड़ देते हैं, या आप खतरनाक ज्ञान को हटाने में विफल रहते हैं।
समाधान: "भाषा-अज्ञेयवादी" गलियारा (The "Language-Agnostic" Hallway)
शोधकर्ताओं को इमारत के बीच में एक "स्वीट स्पॉट" मिला। वे इसे लैंग्वेज-अग्नोस्टिक रीजन (Language-Agnostic Region) कहते हैं।
AI की प्रोसेसिंग को एक अनुवाद पाइपलाइन के रूप में सोचें:
- नीचे: "मैं अंग्रेजी में एक शब्द देखता हूँ।"
- मध्य: "मैं बम की अवधारणा (concept) को समझता हूँ।" (यह वही अवधारणा है चाहे आप "bomba" कहें या "bombe")।
- ऊपर: "अब मैं फ्रेंच में 'bombe' शब्द लिखूँगा।"
खतरनाक ज्ञान मध्य में एक शुद्ध अवधारणा के रूप में मौजूद होता है। यदि आप यहाँ अवधारणा को मिटा देते हैं, तो यह हर भाषा के लिए एक साथ गायब हो जाता है क्योंकि सभी भाषाएँ अपने विशिष्ट शब्दों में विभाजित होने से पहले इसी एक विचार पर आकर मिलती हैं।
उन्होंने यह कैसे किया (MUTE फ्रेमवर्क)
टीम ने MUTE (Multilingual Unlearning via Targeted Erasure) नामक एक टूल बनाया। यह एक सरल उपमा का उपयोग करते हुए कैसे काम करता है, यहाँ दिया गया है:
- नक्शा (CKA और LRDS): कल्पना कीजिए कि AI एक विशाल शहर है। MUTE एक विशेष मानचित्र (गणितीय उपकरण जिन्हें CKA और LRDS कहा जाता है) का उपयोग करके उस सटीक "ज़िले" को खोजता है जहाँ सभी भाषाएँ मिलती हैं। यह देखता है कि वह स्थान कहाँ है जहाँ शहर का लेआउट अंग्रेजी बोलने वालों, स्पेनिश बोलने वालों और हिंदी बोलने वालों के लिए बिल्कुल समान है।
- सर्जरी: एक बार जब वे इस विशिष्ट जिले (AI के एक विशिष्ट लेयर) को खोज लेते हैं, तो वे केवल वहीं अनलर्निंग करते हैं। वे बेसमेंट या पेंटहाउस को नहीं छूते।
- परिणाम: क्योंकि उन्होंने साझा जिले में मूल अवधारणा को हटा दिया है, इसलिए खतरनाक ज्ञान पूरी इमारत से गायब हो जाता है। AI अब किसी भी भाषा में बम के बारे में सवालों के जवाब नहीं दे सकता, लेकिन वह अभी भी कविता लिख सकता है, गणित की समस्याओं को हल कर सकता है और उन सभी भाषाओं में खुशी-खुशी चैट कर सकता है।
यह क्यों महत्वपूर्ण है
इससे पहले, लोग सोचते थे कि आपको AI को हर एक भाषा (अंग्रेजी, स्पेनिश, फ्रेंच, आदि) में भूलना सिखाना होगा, जो धीमा और महंगा है।
मुख्य निष्कर्ष: आपको AI को 100 भाषाओं में भूलना सिखाने की आवश्यकता नहीं है। आपको बस उस एक "साझा गलियारे" को खोजने की आवश्यकता है जहाँ 100 भाषाएँ मिलती हैं, वहां ज्ञान को हटा दें, और वह एक साथ हर जगह से गायब हो जाएगा।
सारांश उपमा
एक खिलौना बनाने वाली फैक्ट्री की कल्पना करें।
- पुराना तरीका: आप फैक्ट्री के कर्मचारियों को उत्पादन लाइन के बिल्कुल अंत में चिल्लाकर (Deep Layers) एक विशिष्ट खतरनाक खिलौना बनाने से रोकने की कोशिश करते हैं। वे बस आपकी बात अनसुनी कर देते हैं और उसे बना ही लेते हैं। या, आप पूरी फैक्ट्री की बिजली काटकर (Shallow Layers) उसे रोकने की कोशिश करते हैं। अब, कोई भी खिलौना नहीं बन पाता, जिसमें सुरक्षित खिलौने भी शामिल हैं।
- MUTE तरीका: आप फैक्ट्री के बीच में उस विशिष्ट मशीन को ढूंढते हैं जहाँ कच्चे प्लास्टिक को खिलौने के आकार में ढाला जाता है। आप उस विशिष्ट मशीन को तोड़ देते हैं। अब, वह खतरनाक खिलौना आकार कभी नहीं बन पाएगा, चाहे अंतिम पेंट जॉब लाल, नीला या हरा ही क्यों न हो। फैक्ट्री अन्य सभी सुरक्षित खिलौनों के लिए सुचारू रूप से चलती रहती है।
यह शोध पत्र यह सिद्ध करता है कि AI के मस्तिष्क के सही "लेयर" को लक्षित करके, हम संचार करने की AI की क्षमता को तोड़े बिना सभी भाषाओं में हानिकारक ज्ञान को सुरक्षित रूप से हटा सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।