← नवीनतम पेपर
💻 computer science

DualOptim+: Bridging Shared and Decoupled Optimizer States for Better Machine Unlearning in Large Language Models

यह शोध पत्र DualOptim+ का प्रस्ताव करता है, जो एक नया अनुकूलन ढांचा (optimization framework) है जो बड़े भाषा मॉडलों (large language models) के लिए मशीन अनलर्निंग (machine unlearning) में बेहतर तालमेल प्राप्त करने हेतु साझा (shared) और विच्छेदित (decoupled) ऑप्टिमाइज़र अवस्थाओं को जोड़ता है, साथ ही इसमें DualOptim+ 8bit नामक एक मेमोरी-कुशल क्वांटाइज्ड संस्करण भी शामिल है।

मूल लेखक: Xuyang Zhong, Qizhang Li, Yiwen Guo, Chen Liu

प्रकाशित 2026-05-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xuyang Zhong, Qizhang Li, Yiwen Guo, Chen Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ DualOptim+ पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।

बड़ी समस्या: "इरेज़र" (Eraser) की दुविधा

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान विश्वकोश (एक Large Language Model) है जिसने इंटरनेट पर लगभग सब कुछ पढ़ लिया है। कभी-कभी, आपको इसके कुछ विशिष्ट पन्नों को हटाने की आवश्यकता होती है—शायद इसलिए क्योंकि उनमें निजी जानकारी, पुराना तथ्य, या हानिकारक निर्देश हैं। इस प्रक्रिया को मशीन अनलर्निंग (Machine Unlearning) कहा जाता है।

समस्या पेचीदा है: आप बुरे या निजी पन्नों को इस तरह मिटाना चाहते हैं कि विश्वकोश के बाकी ज्ञान को गलती से डिलीट न कर दें। यदि आप बुरी जानकारी को बहुत ज़ोर से मिटाने की कोशिश करते हैं, तो मॉडल कविता लिखना, गणित की समस्या हल करना, या यहाँ तक कि "नमस्ते" कहना भी भूल सकता है।

पुराने तरीके: दो दोषपूर्ण दृष्टिकोण

इस पेपर से पहले, शोधकर्ताओं ने इसे ठीक करने के दो मुख्य तरीके आज़माए थे:

  1. "मिक्स-एंड-मैश" दृष्टिकोण (Joint Updating): कल्पना कीजिए कि आप एक ही कपड़े का उपयोग करके एक साथ एक कीचड़ वाले जूते को साफ करने और एक हीरे को पॉलिश करने की कोशिश कर रहे हैं। आप "सफाई" और "पॉलिशिंग" के निर्देशों को आपस में मिला देते हैं। परिणाम? जूता गंदा ही रहता है, या हीरा खरोंच जाता है। मॉडल बहुत सारी उपयोगी जानकारी भूल जाता है।
  2. "स्विच-बैक" दृष्टिकोण (Alternate Updating): कल्पना कीजिए कि आप एक मिनट के लिए जूता साफ करते हैं, फिर अगले एक मिनट के लिए हीरे को पॉलिश करते हैं, और दोनों के बीच स्विच करते रहते हैं। यह बेहतर है, लेकिन यदि आप दोनों कार्यों के लिए एक ही कपड़े का उपयोग करते हैं, तो जूते की गंदगी अंततः हीरे पर लग जाती है, और हीरे का पॉलिश जूते को फिसलन भरा बना देता है। कपड़े की "याददाश्त" भ्रमित हो जाती है।

नया समाधान: DualOptim+

लेखक एक नया फ्रेमवर्क प्रस्तावित करते हैं जिसे DualOptim+ कहा जाता है। इसे मॉडल को दो विशिष्ट क्लीनिंग किट्स (cleaning kits) देने के रूप में सोचें जो एक साथ पूरी तरह से काम करते हैं।

1. "शेयर्ड बेस" (The Shared Base - साझा आधार)

कल्पना कीजिए कि मॉडल के पास एक Shared Base State है। यह एक सामान्य आधार या "सामान्य ज्ञान" के डिब्बे की तरह है।

  • जब मॉडल कुछ भूलना सीखता है और जब वह कुछ याद रखना सीखता है, तो वे दोनों इस डिब्बे को अपडेट करते हैं।
  • क्यों? क्योंकि भूलने और याद रखने में अक्सर कुछ बुनियादी मस्तिष्क संरचनाएं साझा होती हैं। यह डिब्बा उस चीज़ को कैप्चर करता है जिसे मॉडल को किसी भी विशिष्ट कार्य के बावजूद बनाए रखने की आवश्यकता है।

2. "डेल्टा स्टेट्स" (The Delta States - विशिष्ट उपकरण)

फिर, Delta States (या संक्षेप में "डेल्टा") हैं। इन्हें विशिष्ट कार्यों के लिए विशेष, अलग टूलकिट के रूप में समझें।

  • Delta-F: केवल "भूलने" (Forgetting) के लिए एक टूलकिट। यह उस अंतर को रखता है जो मिटाए जाने वाले हिस्से और सामान्य आधार के बीच होता है।
  • Delta-R: केवल "याद रखने" (Retaining) के लिए एक टूलकिट। यह उस अंतर को रखता है जो बचाए जाने वाले हिस्से और सामान्य आधार के बीच होता है।

यह मिलकर कैसे काम करता है

एक भ्रमित कपड़े या दो पूरी तरह से अलग कपड़ों का उपयोग करने के बजाय, जो एक-दूसरे से कभी बात नहीं करते, DualOptim+ यह करता है:

  • यह Shared Base को भूलने और याद रखने दोनों निर्देशों के साथ अपडेट करता है।
  • यह Delta टूल्स को निर्देशों के केवल अद्वितीय हिस्सों (residuals) के साथ अपडेट करता है।
  • जब मॉडल वास्तव में अपने पैरामीटर्स (parameters) को बदलता है, तो वह Shared Base + सही Delta Tool को जोड़ देता है।

जादू: यदि "भूलने" और "याद रखने" के निर्देश आपस में लड़ रहे हैं (टकराव हो रहा है), तो Delta टूल्स संघर्ष को संभालने के लिए आगे आते हैं। यदि वे सहमत हैं, तो Shared Base काम को कुशलतापूर्वक संभालता है। यह एक स्मार्ट मैनेजर की तरह है जो जानता है कि कब साझा टीम संसाधन का उपयोग करना है और कब एक विशेषज्ञ को नियुक्त करना है।

"8-बिट" ट्रिक: जगह बचाना

आमतौर पर, इन अतिरिक्त टूलकिट्स (Delta states) को रखने के लिए बहुत अधिक कंप्यूटर मेमोरी (RAM) की आवश्यकता होती है, जो महंगी है।

  • लेखकों ने DualOptim+ 8-bit संस्करण बनाया है।
  • उपमा: कल्पना कीजिए कि आपके टूलकिट आमतौर पर भारी, ठोस सोने (32-bit precision) से बने होते हैं। 8-bit संस्करण उन्हें हल्के, हाई-टेक फोम में कंप्रेस कर देता है। वे वजन में बहुत कम हैं (मेमोरी बचाते हैं) लेकिन प्रदर्शन में लगभग कोई कमी किए बिना बिल्कुल वही काम करते हैं।

उन्होंने क्या साबित किया?

पेपर ने कई परीक्षण किए यह देखने के लिए कि क्या यह नया तरीका काम करता है:

  • नकली परिदृश्य (Fake Scenarios): उन्होंने काल्पनिक डेटा (जैसे काल्पनिक लेखक) पर परीक्षण किया कि क्या मॉडल विशिष्ट नामों को भूलने के साथ-साथ लिखने की अपनी क्षमता को बनाए रख सकता है।
  • वास्तविक परिदृश्य (Real Scenarios): उन्होंने वास्तविक दुनिया के डेटा पर परीक्षण किया, जैसे मॉडल से किसी व्यक्ति की निजी जानकारी हटाना।
  • सुरक्षा (Safety): उन्होंने परीक्षण किया कि क्या यह "हानिकारक" निर्देशों (जैसे बम कैसे बनाएं) को हटा सकता है बिना मॉडल को किसी भी प्रश्न का उत्तर देने से रोकने के (एक सामान्य दुष्प्रभाव जिसे "ओवर-रिफ्यूज़ल" कहा जाता है)।
  • मल्टी-टास्किंग: उन्होंने यह भी परीक्षण किया कि क्या यह मॉडल को एक साथ तीन अलग-अलग कौशल (कोडिंग, विज्ञान और गणित) सिखाने में मदद करता है ताकि "Shared Base" विभिन्न कार्यों को संतुलित कर सके।

परिणाम: लगभग हर परीक्षण में, DualOptim+ पुराने तरीकों की तुलना में अच्छी चीजों को बरकरार रखते हुए बुरी चीजों को मिटाने में बेहतर था। इसने भूलने और याद रखने के बीच का "स्वीट स्पॉट" (सही संतुलन) ढूंढ लिया।

सारांश

DualOptim+ एआई मॉडल्स को चीजें "अनलर्न" (unlearn) करने के लिए प्रशिक्षित करने का एक स्मार्ट तरीका है। एक भ्रमित मिश्रण या दो पूरी तरह से अलग प्रणालियों के बजाय, यह एक हाइब्रिड सिस्टम का उपयोग करता है: सामान्य समझ के लिए एक साझा आधार और विशिष्ट कार्यों के लिए विशेष उपकरण। यह सुनिश्चित करता है कि एआई ठीक वही भूले जो उसे भूलना चाहिए, बिना अपनी सामान्य बुद्धिमत्ता खोए। इसके अलावा, उन्होंने यह भी पता लगाया कि इसे सस्ते कंप्यूटरों पर चलाने के लिए इसे कैसे कंप्रेस किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →