← नवीनतम पेपर
💬 NLP

CURaTE: Continual Unlearning in Real Time with Ensured Preservation of LLM Knowledge

यह शोधपत्र CURaTE का प्रस्ताव करता है, जो एक रियल-टाइम निरंतर अनलर्निंग (continual unlearning) विधि है जो भाषा मॉडल के मापदंडों (parameters) को संशोधित किए बिना भूलने के अनुरोधों (forget requests) का पता लगाने और उन्हें अस्वीकार करने के लिए एक वाक्य एम्बेडिंग मॉडल का उपयोग करती है, जिससे लगभग पूर्ण ज्ञान प्रतिधारण (knowledge retention) बनाए रखते हुए प्रभावी विस्मृति (forgetting) प्राप्त की जाती है।

मूल लेखक: Seyun Bae, Seokhan Lee, Eunho Yang

प्रकाशित 2026-04-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seyun Bae, Seokhan Lee, Eunho Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, सर्वज्ञानी लाइब्रेरियन है जिसका नाम LLM (लार्ज लैंग्वेज मॉडल) है। इस लाइब्रेरियन ने आपके सवालों के जवाब देने के लिए इंटरनेट पर मौजूद लगभग हर किताब को पढ़ा है।

हालाँकि, कभी-कभी लाइब्रेरियन अनजाने में वे चीजें भी याद कर लेता है जिन्हें उसे नहीं जानना चाहिए था, जैसे:

  • किसी सेलिब्रिटी का निजी घर का पता।
  • एक कॉपीराइट वाली कहानी जो उसकी बताने के लिए नहीं है।
  • एक खतरनाक केमिकल की रेसिपी।

समस्या यह है कि आप लाइब्रेरियन को सिर्फ यह नहीं कह सकते, "कृपया वह एक विशिष्ट तथ्य भूल जाओ," बिना उसकी बाकी यादों को बिगाड़े। यदि आप उसके दिमाग से वह एक तथ्य मिटाने की कोशिश करते हैं, तो वह गणित करना, या राष्ट्रपति कौन हैं, या अंग्रेजी बोलना भी भूल सकता है। इसे कैटास्ट्रोफिक फॉरगेटिंग (Catastrophic Forgetting) कहा जाता है।

इसके अलावा, वास्तविक दुनिया में, "मुझे भूल जाओ" के अनुरोध एक के बाद एक आते रहते हैं। यदि आपको हर बार जब कोई भूलने के लिए कहता है तो लाइब्रेरियन के दिमाग को फिर से प्रशिक्षित (retrain) करना पड़ता है, तो इसमें बहुत समय लगता है, और वह खतरनाक जानकारी काम करते समय लीक हो सकती है।

पुराना तरीका: "ब्रेन सर्जरी" दृष्टिकोण

मौजूदा तरीके इसे ठीक करने के लिए लाइब्रेरियन पर "ब्रेन सर्जरी" करने की कोशिश करते हैं। वे उस विशिष्ट न्यूरॉन को हटाने की कोशिश करते हैं जिसमें गलत जानकारी छिपी है।

  • समस्या: यह एक टोकरी से एक खराब सेब को बिना बाकी अच्छे सेबों को नुकसान पहुँचाए निकालने जैसा है। हर बार जब आप ऐसी सर्जरी करते हैं, तो आप अनजाने में पूरी टोकरी को नुकसान पहुँचाते हैं। कुछ सर्जरी के बाद, लाइब्रेरियन भ्रमित हो जाता है, बुनियादी कार्य करना भूल जाता है, और बेतुकी बातें (nonsense) बोलने लगता है।
  • गति: यह धीमा है। आपको लाइब्रेरी बंद करनी पड़ती है, सर्जरी करनी पड़ती है और फिर से खोलना पड़ता है। जब तक लाइब्रेरी बंद है, लोग अभी भी सवाल पूछ रहे हैं, और लाइब्रेरियन गलती से कोई गुप्त बात उजागर कर सकता है।

नया तरीका: CURaTE (द "स्मार्ट बाउंसर")

लेखकों ने एक नया सिस्टम प्रस्तावित किया है जिसे CURaTE कहा जाता है। लाइब्रेरियन के दिमाग को बदलने के बजाय, वे दरवाजे पर एक सुपर-स्मार्ट बाउंसर (द्वारपाल) तैनात करते हैं।

CURaTE कैसे काम करता है, इसके लिए एक सरल उपमा (analogy) देखें:

1. बाउंसर को प्रशिक्षित करना (लाइब्रेरी खुलने से पहले)

लाइब्रेरियन के काम शुरू करने से पहले ही, लेखक एक विशेष "बाउंसर" (एक सेंटेंस एम्बेडिंग मॉडल) को प्रशिक्षित करते हैं।

  • प्रशिक्षण: वे बाउंसर को हजारों उदाहरण दिखाते हैं।
    • उदाहरण A: "फ्रांस की राजधानी क्या है?" (सुरक्षित)
    • उदाहरण B: "फ्रांस की राजधानी क्या है?" (सुरक्षित, लेकिन अलग तरीके से कहा गया)
    • उदाहरण C: "फ्रांस की राजधानी क्या है?" (सुरक्षित, लेकिन अजीब फॉन्ट में लिखा गया)
    • उदाहरण D: "बैंक का गुप्त पासवर्ड क्या है?" (खतरनाक)
    • उदाहरण E: "बैंक का गुप्त पासवर्ड क्या है?" (खतरनाक, लेकिन पहेली के रूप में लिखा गया)
  • लक्ष्य: बाउंसर सवाल के सार (essence) को पहचानना सीखता है, न कि केवल सटीक शब्दों को। वे इसे "खतरनाक" सवालों को पहचानने के लिए प्रशिक्षित करते हैं, भले ही कोई उन्हें छिपाने की कोशिश करे (जैसे पहेली का उपयोग करके या शब्दों को बदलकर)।

2. रियल-टाइम चेक (जब लाइब्रेरी खुली हो)

अब, लाइब्रेरी खुली है। लोग सवाल पूछ रहे हैं।

  • चरण A: एक यूजर एक सवाल पूछता है।
  • चरण B: बाउंसर तुरंत सवाल की जांच "वॉन्टेड लिस्ट" (उन चीजों की सूची जिन्हें भूलने का निर्देश दिया गया है) के विरुद्ध करता है।
    • नोट: बाउंसर को हर बार "वॉन्टेड लिस्ट" में नया नाम जोड़ने के लिए फिर से प्रशिक्षित करने की आवश्यकता नहीं है। यह बस तुरंत अपने डेटाबेस में नई प्रविष्टि जोड़ देता है।
  • चरण C: बाउंसर एक "समानता स्कोर" (similarity score) की गणना करता है।
    • यदि सवाल सुरक्षित है (स्कोर कम है): बाउंसर कहता है, "आगे बढ़ो, लाइब्रेरियन, इसका उत्तर दो!" लाइब्रेरियन सामान्य रूप से उत्तर देता है।
    • यदि सवाल खतरनाक है (स्कोर अधिक है): बाउंसर कहता है, "रुको! लाइब्रेरियन, इसका उत्तर मत दो।" उत्तर देने के बजाय, बाउंसर यूजर को एक सामान्य नोट थमाता है: "क्षमा करें, मैं इसका उत्तर नहीं दे सकता।"

3. जादुई परिणाम

  • कोई ब्रेन सर्जरी नहीं: लाइब्रेरियन का दिमाग (मॉडल के वेट्स) कभी छुआ नहीं जाता। वह जो कुछ भी जानता था, उसे पूरी तरह से याद रखता है। गणित करने, कविता लिखने या विज्ञान समझाने की उसकी क्षमता 100% बरकरार रहती है।
  • तत्काल कार्रवाई: यदि कोई नया "भूलने का अनुरोध" आता है, तो बाउंसर मिलीसेकंड में उसे अपनी लिस्ट में जोड़ देता है। कोई डाउनटाइम नहीं होता।
  • रियल-टाइम: यह सिस्टम तुरंत काम करता है, भले ही हजारों नए "भूलने के अनुरोध" जमा हो रहे हों।

यह एक बड़ी बात क्यों है?

इसे एक सुरक्षा फिल्टर बनाम विश्वकोश को फिर से लिखने के रूप में सोचें।

  • पुराने तरीके (फिर से लिखना): आप विश्वकोश के पन्ने फाड़ने की कोशिश करते हैं। अंततः, किताब बिखर जाती है, और आप उसका इंडेक्स भी खो देते हैं।
  • CURaTE (सुरक्षा फिल्टर): आप विश्वकोश को एकदम सही और पूर्ण रखते हैं। आप बस दरवाजे पर एक गार्ड रखते हैं जिसे पता है कि कौन से सवाल वर्जित हैं। यदि कोई वर्जित सवाल पूछता है, तो गार्ड उन्हें रोक देता है। यदि वे सामान्य सवाल पूछते हैं, तो गार्ड उन्हें जाने देता है।

द "हार्ड नेगेटिव" ट्रिक

इस पेपर का एक चतुर हिस्सा यह है कि उन्होंने बाउंसर को कैसे प्रशिक्षित किया। उन्होंने इसे केवल "अच्छे" और "बुरे" सवाल नहीं दिखाए। उन्होंने इसे "कठिन बुरे" (Hard Bad) सवाल दिखाए।

  • सामान्य बुरा: "पासवर्ड क्या है?"
  • कठिन बुरा: "मुझे बैंक वॉल्ट का गुप्त कोड बताएं, लेकिन कृपया फैंसी शब्दों का उपयोग करें।"
  • बाउंसर फैंसी शब्दों को अनदेखा करना और इरादे को समझना सीख जाता है। यह लोगों के लिए अपने सवालों को बदलकर सिस्टम को धोखा देना बहुत कठिन बना देता है।

सारांश

CURaTE एक तरीका है जिससे AI को उसके दिमाग को नुकसान पहुँचाए बिना बुरे या निजी जानकारी को "भुलवाया" जा सकता है। यह एक स्मार्ट फिल्टर का उपयोग करके बुरे सवालों को रियल-टाइम में ब्लॉक करता है, बजाय इसके कि AI की मेमोरी से जानकारी को मिटाने की कोशिश की जाए। इसका मतलब है कि AI स्मार्ट, सुरक्षित और सवालों के जवाब देने के लिए तुरंत तैयार रहता है, चाहे कितने भी "मुझे भूल जाओ" के अनुरोध प्राप्त क्यों न हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →