← नवीनतम पेपर
🤖 machine learning

SAUL: Sharpness-Aware Augmented-Lagrangian Unlearning

यह शोध पत्र SAUL का प्रस्ताव करता है, जो लार्ज लैंग्वेज मॉडल्स के लिए एक नवीन मशीन अनलर्निंग फ्रेमवर्क है, जो विस्मरण (forgetting) को एक अनुकूलनशील ऑगमेंटेड-लैग्रेंजियन कंट्रोलर और शार्पनेस-अवेयर अपडेट्स का उपयोग करते हुए एक स्पष्ट प्रतिबंधित न्यूनीकरण समस्या के रूप में सूत्रबद्ध करता है ताकि ज्ञान के विलोपन और सामान्य उपयोगिता के संरक्षण के बीच प्रभावी ढंग से संतुलन बनाया जा सके।

मूल लेखक: Jaewan Choi, Junyoung Yang, Sangdon Park

प्रकाशित 2026-08-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jaewan Choi, Junyoung Yang, Sangdon Park

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

लार्ज लैंग्वेज मॉडल्स (LLMs) आज के कई सबसे उन्नत आर्टिफिशियल इंटेलिजेंस टूल्स के पीछे के इंजन हैं। उन्हें टेक्स्ट के विशाल महासागरों पर प्रशिक्षित किया जाता है, जिससे वे एक वाक्य में अगले शब्द की भविष्यवाणी करने में उल्लेखनीय सटीकता के साथ सक्षम होते हैं। हालाँकि, इस प्रशिक्षण में अक्सर संवेदनशील जानकारी शामिल होती है, जैसे कि निजी डेटा, कॉपीराइट सामग्री, या हानिकारक निर्देश जिन्हें समाज यह चाहेगा कि ये मॉडल कभी न सीखें। चुनौती यह है कि मॉडल को इस विशिष्ट बुरी या निजी जानकारी को "भूलने" के लिए कैसे तैयार किया जाए, बिना उसकी सामान्य प्रश्नों के उत्तर देने या उपयोगी कार्य करने की क्षमता को तोड़े। यदि आप मॉडल को शुरू से फिर से प्रशिक्षित करके बुरे डेटा को मिटाने की कोशिश करते हैं, तो यह अविश्वसनीय रूप से महंगा और धीमा होता है। यदि आप ज्ञान को सर्जिकल तरीके से हटाने की कोशिश करते हैं, तो आप अक्सर मॉडल की सामान्य बुद्धिमत्ता को नुकसान पहुँचा देते हैं, जिससे वह उन हानिरहित प्रश्नों पर लड़खड़ाने लगता है जिनका उत्तर वह पहले पूरी तरह से दे पाता था। यह एक कठिन संतुलन बनाता है: आप केवल इतना कैसे हटाएँ कि सुरक्षित रहें, लेकिन इतना भी नहीं कि मॉडल बेकार हो जाए?

दक्षिण कोरिया के POSTECH के शोधकर्ताओं ने इस नाजुक समस्या को हल करने के लिए एक नया दृष्टिकोण प्रस्तावित किया है, जिसे उन्होंने SAUL नाम दिया है। सूचना को हटाने को एक अस्पष्ट लक्ष्य के रूप में देखने के बजाय, जहाँ मॉडल विशिष्ट कार्यों में "कम अच्छा" होने और दूसरों में "अच्छा" बने रहने की कोशिश करता है, उन्होंने इसे एक सख्त नियम के रूप में प्रस्तुत किया है। कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है जिसे कहा गया है, "आपको एक गुप्त विषय के बारे में इन तीन विशिष्ट प्रश्नों पर शून्य स्कोर प्राप्त करना चाहिए, लेकिन आपको अन्य सभी प्रश्नों पर अपना स्कोर यथासंभव उच्च रखना चाहिए।" पिछले तरीकों ने अक्सर इन दोनों लक्ष्यों को एक ही निर्देश के साथ मिलाकर इसे प्राप्त करने की कोशिश की, जिससे यह जानना कठिन हो गया कि गुप्त विषय वास्तव में कब भुला दिया गया था या मॉडल को बहुत अधिक भूलने के लिए कब मजबूर किया जा रहा था। नया तरीका, SAUL, एक स्पष्ट, कठोर रेखा निर्धारित करता है: मॉडल को भूलने के एक विशिष्ट स्तर तक पहुँचना होगा, और जैसे ही वह उस रेखा को पार करता है, भूलने का दबाव तुरंत रुक जाता है।

इस नई प्रणाली का मूल एक स्मार्ट कंट्रोलर है जो वास्तविक समय में मॉडल की प्रगति पर नज़र रखता है। यह लगातार जाँचता रहता है कि क्या मॉडल ने लक्षित जानकारी को सफलतापूर्वक भुला दिया है। यदि मॉडल अभी भी बहुत अधिक याद रख रहा है, तो कंट्रोलर भूलने में मदद करने के लिए दबाव डालता है। लेकिन जिस क्षण मॉडल भूलने के आवश्यक स्तर पर पहुँच जाता है, कंट्रोलर दबाव को पूरी तरह से बंद कर देता है। यह मॉडल को आवश्यकता से अधिक भूलने के लिए मजबूर होने से रोकता है, जो अक्सर उसके सामान्य ज्ञान को खोने का कारण बनता है। शोधकर्ताओं ने पाया कि भूलने की प्रक्रिया को ठीक उसी समय रोकने से, जब लक्ष्य पूरा हो जाता है, मॉडल अपनी उपयोगी क्षमताओं को पहले की तुलना में बहुत अधिक बनाए रखता है। इस प्रक्रिया को और अधिक स्थिर बनाने के लिए, उन्होंने एक ऐसी तकनीक जोड़ी है जो यह सुनिश्चित करती है कि मॉडल का ज्ञान अचानक या अप्रत्याशित रूप से न बदले, और उन्होंने भूलने और याद रखने के कार्यों के लिए दो अलग-अलग "मेमोरी ट्रैक्स" का उपयोग किया ताकि वे एक-दूसरे में हस्तक्षेप न करें।

जब टीम ने विभिन्न बेंचमार्क पर इस पद्धति का परीक्षण किया, तो परिणाम स्पष्ट थे। ToFU नामक एक डेटासेट पर, जो काल्पनिक लेखकों को भूलने की मॉडल की क्षमता का परीक्षण करता है, नए तरीके ने भूलने और सामान्य ज्ञान बनाए रखने के बीच सबसे अच्छा संतुलन हासिल किया। इसने लक्षित जानकारी को सफलतापूर्वक मिटा दिया जबकि मॉडल के समग्र प्रदर्शन को उच्च बनाए रखा। जैविक हथियारों या साइबर हमलों के निर्माण के निर्देशों जैसे खतरनाक ज्ञान से जुड़े परीक्षणों में, इस पद्धति ने उन प्रश्नों का उत्तर देने की मॉडल की क्षमता को रैंडम गेसिंग (यादृच्छिक अनुमान) के स्तर तक कम कर दिया, जबकि इसे सामान्य विज्ञान और इतिहास के प्रश्नों का सही उत्तर देने की अनुमति दी। शोधकर्ताओं ने यह भी दिखाया कि इस "काम होने पर रुकने वाले" कंट्रोलर को अन्य मौजूदा तरीकों में सुधार के लिए जोड़ा जा सकता है, जो यह सुझाव देता है कि भूलने की एक स्पष्ट सीमा निर्धारित करने का विचार व्यापक रूप से मूल्यवान है।

यह अध्ययन इस बात पर प्रकाश डालता है कि प्रभावी अनलर्निंग (unlearning) की कुंजी केवल भूलने की अधिक कोशिश करना नहीं है, बल्कि यह जानना है कि कब रुकना है। भूलने को एक स्पष्ट फिनिश लाइन वाले प्रतिबंध के रूप में मानकर, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो अधिक सटीक और मॉडल की समग्र बुद्धिमत्ता के लिए कम विनाशकारी है। हालांकि इस पद्धति के लिए "फॉरगेटिंग थ्रेशोल्ड" (भूलने की दहलीज)—वह विशिष्ट बिंदु जिस पर मॉडल को पर्याप्त रूप से भूल गया माना जाता है—का सावधानीपूर्वक चयन आवश्यक है, लेकिन यह सुरक्षा और उपयोगिता के बीच के संतुलन को प्रबंधित करने का एक व्यावहारिक तरीका प्रदान करता है। यह कार्य सुझाव देता है कि भविष्य में, हम बड़े भाषा मॉडलों को एक हथौड़े की अंधाधुंध शक्ति के बजाय एक सर्जन की सटीकता के साथ संपादित करने में सक्षम हो सकते हैं, जिससे शेष मॉडल के ज्ञान को बरकरार रखते हुए हानिकारक डेटा को हटाया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →