← नवीनतम पेपर
💬 NLP

Wisdom is Knowing What not to Say: Hallucination-Free LLMs Unlearning via Attention Shifting

यह शोध पत्र अटेंशन-शिफ्टिंग (AS) फ्रेमवर्क प्रस्तुत करता है, जो एक नवीन मशीन अनलर्निंग दृष्टिकोण है जो संदर्भ-संरक्षण दमन (context-preserving suppression) और मतिभ्रम-प्रतिरोधी प्रतिक्रिया आकार (hallucination-resistant response shaping) को नियोजित करके उपयोगिता संरक्षण और मतिभ्रम रोकथाम के बीच संतुलन बनाता है, ताकि बड़े भाषा मॉडलों के सामान्य प्रदर्शन से समझौता किए बिना संवेदनशील ज्ञान को चुनिंदा रूप से हटाया जा सके।

मूल लेखक: Chenchen Tan, Youyang Qu, Xinghao Li, Hui Zhang, Shujie Cui, Cunjian Chen, Longxiang Gao

प्रकाशित 2026-04-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenchen Tan, Youyang Qu, Xinghao Li, Hui Zhang, Shujie Cui, Cunjian Chen, Longxiang Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान, विश्वकोश के समान ज्ञान रखने वाला एक पुस्तकालयाध्यक्ष (Librarian) है जिसका नाम LLM (लार्ज लैंग्वेज मॉडल) है। इस पुस्तकालयाध्यक्ष ने दुनिया की लगभग हर किताब पढ़ ली है और वह किसी भी प्रश्न का उत्तर तुरंत दे सकता है। हालाँकि, एक समस्या है: पुस्तकालयाध्यक्ष ने कुछ विशिष्ट लोगों के बारे में कुछ गुप्त, निजी जानकारी (जैसे उनका घर का पता या पारिवारिक विवरण) याद कर ली है जिसे उसे साझा नहीं करना चाहिए।

आपको पुस्तकालयाध्यक्ष को तुरंत उस निजी जानकारी को भूलने के लिए कहना होगा (शायद इसलिए क्योंकि उस व्यक्ति ने कानून के तहत "भूल जाने" का अनुरोध किया है), लेकिन आपको उसकी कहानियाँ लिखने, गणित की समस्याओं को हल करने और इतिहास के बारे में बात करने की क्षमता को बनाए रखना होगा।

दुविधा: "ब्रूट फोर्स" बनाम "फेक आउट"

भुलवाने के वर्तमान तरीके दो अनाड़ी दृष्टिकोणों की तरह हैं:

  1. ब्रूट फोर्स (आक्रामक विस्मरण/Aggressive Unlearning): कल्पना कीजिए कि आप पुस्तकालयाध्यक्ष की याददाश्त पर हथौड़े से प्रहार कर रहे हैं। आप इतनी ज़ोर से चिल्लाते हैं, "वह नाम भूल जाओ!" कि पुस्तकालयाध्यक्ष का मस्तिष्क ही गड़बड़ा जाता है। अब, वह गुप्त जानकारी तो भूल जाता है, लेकिन वह ठीक से बोलना, गणित करना या कहानी सुनाना भी भूल जाता है। वह भ्रमित और बेकार हो जाता है।

  2. फेक आउट (रूढ़िवादी विस्मरण/Conservative Unlearning): कल्पना कीजिए कि आप पुस्तकालयाध्यक्ष को कहते हैं, "यदि कोई उस गुप्त बात के बारे में पूछे, तो बस एक नकली उत्तर दे देना।" पुस्तकालयाध्यक्ष कहता है, "ओह, मुझे नहीं पता," या "वह व्यक्ति वास्तव में एक बेकर था, डॉक्टर नहीं।" समस्या यह है कि पुस्तकालयाध्यक्ष अब भ्रमित (Hallucinating) हो रहा है। वह आत्मविश्वास के साथ झूठ बोल रहा है। अस्पताल या अदालत में, आत्मविश्वास के साथ बोला गया झूठ खतरनाक होता है।

समाधान: "अटेंशन शिफ्टिंग" (एक स्मार्ट पुस्तकालयाध्यक्ष)

यह शोध पत्र एक नई विधि पेश करता है जिसे अटेंशन शिफ्टिंग (AS) कहा जाता है। पुस्तकालयाध्यक्ष को याददाश्त मिटाने या उसे झूठ बोलने के लिए कहने के बजाय, यह विधि पुस्तकालयाध्यक्ष को यह सिखाती है कि उन विशिष्ट शब्दों पर ध्यान देना कैसे बंद किया जाए जो गुप्त जानकारी को ट्रिगर करते हैं।

यह कैसे काम करता है, इसके लिए एक सरल उपमा (Analogy) यहाँ दी गई है:

"स्पॉटलाइट" की उपमा

कल्पना कीजिए कि पुस्तकालयाध्यक्ष का मस्तिष्क एक अंधेरा कमरा है, और उसका ध्यान (Attention) एक स्पॉटलाइट है।

  • जब कोई प्रश्न पूछा जाता है, तो स्पॉटलाइट उत्तर बनाने के लिए सबसे महत्वपूर्ण शब्दों (Tokens) पर चमकती है।
  • यदि प्रश्न है "चुकवू के पिता का पेशा क्या है?", तो स्पॉटलाइट आमतौर रूप से "चुकवू," "पिता," और "हेयरड्रेसर" (गुप्त तथ्य) पर चमकती है।

पुराना तरीका: पूरे किताब को नष्ट करने के लिए "हेयरड्रेसर" शब्द को मिटाने की कोशिश करना। इससे पूरी किताब ही खराब हो जाती है।
अटेंशन शिफ्टिंग का तरीका: आप किताब को मिटाते नहीं हैं। इसके बजाय, आप स्पॉटलाइट को धीरे से घुमा देते हैं

  • जब पुस्तकालयाध्यक्ष उस प्रश्न को देखता है, तो आप उसे गुप्त शब्द ("हेयरड्रेसर") पर रोशनी को धीमा करने के लिए प्रशिक्षित करते हैं।
  • आप इसके बजाय तटस्थ शब्दों जैसे "है," "एक," या "का" पर रोशनी चमकाते हैं।
  • क्योंकि स्पॉटलाइट गुप्त तथ्य पर नहीं है, इसलिए पुस्तकालयाध्यक्ष उस उत्तर को "देख" नहीं पाता और उसे उत्पन्न (Generate) नहीं कर पाता। वह बस कहता है, "मुझे नहीं पता," या एक अस्पष्ट उत्तर देता है।

यह व्यवहार में कैसे काम करता है

शोधकर्ताओं ने एक छोटा, हल्का "एडॉप्टर" (जैसे कि स्मार्ट चश्मा) बनाया है जिसे पुस्तकालयाध्यक्ष पहनता है। ये चश्मे दो चीजें एक साथ करते हैं:

  1. "भूलने वाले" चश्मे (Suppression): जब पुस्तकालयाध्यक्ष उस गुप्त डेटा को पढ़ता है जिसे उसे भूलना है, तो चश्मे स्पॉटलाइट को बताते हैं: "विशिष्ट तथ्यों पर ध्यान मत दो! इसके बजाय उबाऊ व्याकरण वाले शब्दों पर ध्यान केंद्रित करो।" यह पुस्तकालयाध्यक्ष की बोलने की क्षमता को तोड़े बिना, गुप्त तथ्य से संबंध को तोड़ देता है।
  2. "याद रखने वाले" चश्मे (Retention): जब पुस्ततालयाध्यक्ष अन्य महत्वपूर्ण जानकारी (जैसे इतिहास या विज्ञान) पढ़ता है, तो चश्मे कहते हैं: "हे, इन महत्वपूर्ण शब्दों पर रोशनी चमकाते रहो!" यह सुनिश्चित करता है कि पुस्तकालयाध्यक्ष बाकी सब चीजों के लिए स्मार्ट और सहायक बना रहे।

यह एक बड़ी बात क्यों है

शोधकर्ताओं ने इस पद्धति का परीक्षण दो प्रमुख चुनौतियों पर किया:

  1. ToFU: एक परीक्षण जहाँ पुस्तकालयाध्यक्ष को नकली लेखक के नाम भूलने थे।
  2. TDEC: एक परीक्षण जहाँ पुस्ततालयाध्यक्ष को विशाल प्रशिक्षण पुस्तकों में छिपे डेटा को भूलना था।

परिणाम:

  • झूठ का अंत: अन्य तरीकों के विपरीत जो पुस्ततालयाध्यक्ष को गलत उत्तर आत्मविश्वास के साथ अनुमान लगाने के लिए मजबूर करते हैं (Hallucination), यह विधि उसे यह स्वीकार करने में मदद करती है कि वह नहीं जानता।
  • अभी भी स्मार्ट: पुस्ततालयाध्यक्ष ने लिखने या तर्क करने की अपनी क्षमता नहीं खोई। वह सामान्य प्रश्नों पर अन्य तरीकों की तुलना में 15% अधिक सटीक रहा।
  • गोपनीयता सुरक्षित: गुप्त जानकारी को प्रभावी ढंग से पुस्ततालयाध्यक्ष की "आत्मविश्वासपूर्ण भविष्यवाणियों" से हटा दिया गया था। भले ही आपने अजीब तरह से तैयार किए गए प्रश्नों के साथ पुस्ततालयाध्यक्ष को चकमा देने की कोशिश की, फिर भी वह गुप्त जानकारी प्रकट नहीं कर सका।

निचोड़ (Bottom Line)

अटेंशन शिफ्टिंग को एक बच्चे को उस विशिष्ट खिलौने को अनदेखा करना सिखाने के रूप में देखें जिससे उसे खेलने की अनुमति नहीं है, बजाय इसके कि खिलौने को फेंक दिया जाए या बच्चे को यह नाटक करने के लिए मजबूर किया जाए कि वह कोई दूसरा खिलौना है।

बच्चा (AI) वर्जित खिलौने (गुप्त डेटा) से नज़र हटाना और अन्य खिलौनों (सामान्य ज्ञान) पर ध्यान केंद्रित करना सीख जाता है। वे सुरक्षित, अधिक विश्वसनीय और अभी भी खेलने में मजेदार बनते हैं, और वह भी बिना अपने पूरे मस्तिष्क को फिर से बनाए बिना।

संक्षेप में: यह याददाश्त को मिटाने के बारे में नहीं है; यह ध्यान को पुनर्निर्देशित (Redirecting Focus) करने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →