← नवीनतम पेपर
💬 NLP

Don't Forget Your Embeddings: Robust Knowledge Erasure via Precise Editing of Embeddings

यह शोध पत्र EMBER को प्रस्तुत करता है, जो एक प्लग-एंड-प्ले मॉड्यूल है जो स्पार्स मैट्रिक्स फैक्टराइजेशन के माध्यम से टोकन एम्बेडिंग्स से अवधारणा-संबंधी विशेषताओं को सटीक रूप से हटाकर भाषा मॉडलों में सुदृढ़ ज्ञान विलोपन (knowledge erasure) को बढ़ाता है, जिससे पुन: सीखने के प्रति प्रतिरोध को महत्वपूर्ण रूप से सुधारते हुए सुसंगतता हानि को न्यूनतम किया जाता है।

मूल लेखक: Clara Haya Suslik, Or Shafran, Mor Geva

प्रकाशित 2026-06-03
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Clara Haya Suslik, Or Shafran, Mor Geva

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़े भाषा मॉडल (LLM) की कल्पना करें जो एक विशाल, अत्यंत बुद्धिमान लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह है जिसने दुनिया की लगभग हर किताब पढ़ ली है। कभी-कभी, हमें इस लाइब्रेरियन को कुछ विशिष्ट चीजें "भुलवाने" की आवश्यकता होती—शायद किसी ऐसी किताब के पात्र के बारे में जो अभी तक प्रकाशित नहीं हुई है, किसी खतरनाक रसायन की रेसिपी, या किसी सेलिब्रिटी की निजी जानकारी। इस प्रक्रिया को नॉलेज इरेज़र (Knowledge Erasure) कहा जाता है।

लंबे समय तक, वैज्ञानिकों ने लाइब्रेरियन को भूलने के लिए उनके मस्तिष्क के अंदर मौजूद "निर्देश नियमावली" (विशेष रूप से, MLP लेयर नामक हिस्सा) को फिर से लिखने की कोशिश की। वे जाกัน और वर्जित विषय से संबंधित नोट्स को मिटा देते थे।

समस्या: छिपी हुई नोटबुक
पेपर का तर्क है कि पिछले प्रयास अक्सर विफल हो जाते हैं। क्यों? क्योंकि लाइब्रेरियन के पास एक दूसरी, छिपी हुई नोटबुक है: एम्बेडिंग लेयर (Embedding Layer)

एम्बेडिंग लेयर को लाइब्रेरियन के इंडेक्स कार्ड की तरह समझें। उनके द्वारा जाने जाने वाले हर शब्द (जैसे "हैरी," "पोटर," या "जादुई छड़ी") के पास एक विशिष्ट कार्ड होता है। यदि आप हैरी पॉटर से संबंधित निर्देश नियमावली के नोट्स जला भी देते हैं, तो भी उन शब्दों के इंडेक्स कार्ड में वह रहस्य बना रहता है। यदि कोई पूछता है, "हैरी कौन है?", तो लाइब्रेरियन अभी भी वह कार्ड निकाल सकता है, संबंध देख सकता है, और अनजाने में वर्जित ज्ञान को बहुत तेज़ी से "पुनः सीख" सकता है।

समाधान: एम्बर (EMBER)
लेखक एक नया टूल पेश करते हैं जिसे एम्बर (EMBER - Embedding ERasure) कहा जाता है। केवल निर्देश नियमावली को जलाने के बजाय, EMBER सीधे इंडेक्स कार्डों पर प्रहार करता है।

यहाँ बताया गया है कि EMBER एक सरल उपमा का उपयोग करके कैसे काम करता है:

  1. मिश्रण (The Mix): कल्पना करें कि "हैरी" शब्द का इंडेक्स कार्ड वास्तव में कई अलग-अलग सामग्रियों (फीचर्स) से बना एक स्मूदी है। कुछ सामग्रियां सामान्य हैं (जैसे "एक व्यक्ति का नाम है") और कुछ वर्जित विषय के लिए विशिष्ट हैं (जैसे "जादूगर," "हॉगवर्ट्स," "जादू")।
  2. पृथक्करण (The Separation): EMBER स्पार्स मैट्रिक्स फैक्टराइजेशन (Sparse Matrix Factorization) नामक एक गणितीय ट्रिक का उपयोग करता है। इसे एक हाई-टेक ब्लेंडर के रूप में सोचें जो कार्ड पर मौजूद "जादूगर" की सामग्री को "व्यक्ति" की सामग्री से पूरी तरह अलग कर सकता है।
  3. सर्जरी (The Surgery): एक बार अलग होने के बाद, EMBER सावधानीपूर्वक "हैरी" कार्ड से केवल "जादूगर" वाली सामग्री को निकाल देता है। यह "व्यक्ति" वाली सामग्रियों को वैसे ही छोड़ देता है।
  4. परिणाम (The Result): अब, जब लाइब्रेरियन "हैरी" शब्द को देखता है, तो वह कार्ड अब "जादूगर" वाले संबंध को सक्रिय नहीं करता है। लाइब्रेरियन अभी भी प्रिंस हैरी (वास्तविक व्यक्ति) के बारे में पूरी तरह से बात कर सकता है, लेकिन वह हैरी पॉटर के बारे में पूरी तरह से खाली (blank) रहेगा।

यह एक बड़ी बात क्यों है
पेपर ने दो लोकप्रिय AI मॉडलों (Gemma और Llama) पर 18 विभिन्न विषयों पर इसका परीक्षण किया, जिसमें "हैरी पॉटर" से लेकर "द्वितीय विश्व युद्ध" तक शामिल थे।

  • धोखा देना कठिन है: पिछली विधियाँ एक किताब पर "पढ़ना मना है" का साइन लगाने जैसी थीं। लाइब्रेरियन अभी भी झाँक सकता था और याद रख सकता था। EMBER शेल्फ से ही किताब को हटाने जैसा है। भले ही कोई लाइब्रेरियन को कुछ नए नोट्स के साथ "रिट्रेन" करने की कोशिश करे, लाइब्रेरियन वर्जित विषय को याद नहीं रख पाएगा क्योंकि उसका आधार (इंडेक्स कार्ड) ही गायब है।
  • यह सब कुछ खराब नहीं करता है: एक सामान्य डर यह है कि यदि आप लाइब्रेरियन के मस्तिष्क को संपादित करते हैं, तो वे अजीब तरह से बोलना शुरू कर सकते हैं या अन्य चीजों के बारे में भूल सकते हैं। पेपर ने पाया कि EMBER अविश्वसनीय रूप से सटीक है। यह शब्दकोश के केवल एक बहुत छोटे हिस्से (0.14% से कम) को संपादित करता है। यदि आप "हैरी पॉटर" को मिटाते हैं, तो लाइब्रेरियन "हैरी स्टाइल्स" या "प्रिंस हैरी" के बारे में बिना अटके बात कर सकता है।
  • यह पुरानी विधियों के साथ काम करता है: EMBER पुरानी विधियों का विकल्प नहीं है; यह एक बूस्टर है। जब आप पुरानी निर्देश-नियमावली संपादन विधियों के साथ EMBER का उपयोग करते हैं, तो परिणाम बहुत अधिक मजबूत होते हैं। "भूलना" स्थायी और सुदृढ़ हो जाता है।

सारांश में
पेपर का दावा है कि AI को वास्तव में कुछ भुलाने के लिए, आप केवल उसके उच्च-स्तरीय निर्देशों को संपादित नहीं कर सकते; आपको उसके बुनियादी शब्दावली कार्डों को भी साफ करना होगा। इन कार्डों पर एक सटीक गणितीय "सर्जरी" का उपयोग करके, EMBER यह सुनिश्चित करता है कि AI विशिष्ट अवधारणा को भूल जाए बिना अपनी बोलने की क्षमता या अन्य चीजों को याद रखने की क्षमता खोए बिना। यह इसे लगभग असंभव बना देता है कि AI अनजाने में वर्जित विषय को फिर से याद कर ले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →