← नवीनतम पेपर
🤖 machine learning

SHRED: Retain-Set-Free Unlearning via Self-Distillation with Logit Demotion

SHRED एक नवीन, रिटेन-सेट-मुक्त (retain-set-free) मशीन अनलर्निंग विधि है जो बड़े भाषा मॉडलों के लिए, सेल्फ-डिस्टिलेशन के माध्यम से उच्च-सूचना वाले टोकनों की पहचान और उन्हें डिमोट करके याद किए गए कंटेंट को चुनिलेक्टिव रूप से हटाती है, जिससे बिना किसी क्यूरेटेड रिटेन सेट की आवश्यकता के, भूलने की प्रभावकारिता और मॉडल उपयोगिता के बीच श्रेष्ठ संतुलन प्राप्त किया जाता है।

मूल लेखक: Zizhao Hu, Ameya Godbole, Johnny Tian-Zheng Wei, Mohammad Rostami, Jesse Thomason, Robin Jia

प्रकाशित 2026-05-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zizhao Hu, Ameya Godbole, Johnny Tian-Zheng Wei, Mohammad Rostami, Jesse Thomason, Robin Jia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ SHRED पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "अनलर्निंग" (Unlearning) की दुविधा

एक बड़े लैंग्वेज मॉडल (LLM) की कल्पना एक ऐसे सुपर-फोटोग्राफिक छात्र के रूप में करें जिसने पूरे इंटरनेट को पढ़ रखा है। कभी-कभी, यह छात्र ऐसी चीजें याद कर लेता है जो उसे नहीं याद रखनी चाहिए थीं, जैसे किसी सेलिब्रिटी का निजी पता, कोई कॉपीराइट वाली किताब, या बम बनाने के खतरनाक निर्देश।

इसे ठीक करने के लिए, हमें आमतौर पर उस विशिष्ट जानकारी को "अनलर्न" (भूलना) करने की आवश्यकता होती है। हालाँकि, इसमें एक पेंच है:

  • पुराना तरीका: छात्र को बुरी जानकारी भूलने के लिए (बिना यह भुलाए कि वह अंग्रेजी बोलना या गणित करना कैसे जानता है) हमें उसे कुछ "अच्छे उदाहरणों" का एक "स्टडी गाइड" देना पड़ता है ताकि वह अभ्यास कर सके।
  • समस्या: वास्तविक दुनिया में, हमारे पास अक्सर वह सटीक "स्टडी गाइड" नहीं होता। इसे बनाना कठिन, महंगा है और यह अनजाने में छात्र के ज्ञान को पक्षपाती (bias) बना सकता है। इसके बिना, छात्र को भुलाने की कोशिश करने से उसका "दिमाग टूट सकता है", जिससे वह ठीक से बोलना भूल जाता है या हानिरहित सवालों के जवाब देने से भी मना कर देता है।

समाधान: SHRED

लेखकों ने SHRED (Self-distillation via High-surprisal-only Retain-free Entropy Demotion) नामक एक नई विधि प्रस्तावित की है। यह नाम काफी कठिन है, तो चलिए एक उपमा के माध्यम से इसे समझते।

मुख्य अंतर्दृष्टि: सभी शब्द समान नहीं होते

कल्पना करें कि छात्र उस विशिष्ट घटना के बारे में एक कहानी सुना रहा है जिसे उसने याद किया है:

"जुलाई 4 को, जॉन स्मिथ ने लाल फेरारी के साथ ग्रैंड कैन्यन की यात्रा की।"

पेपर ने इस बारे में एक दिलचस्प खोज की कि मॉडल इस वाक्य के बारे में कैसे "सोचता" है:

  1. "बोरिंग" शब्द: "On", "the", "to", और "a" जैसे शब्द बहुत आम हैं। मॉडल इनके बारे में बहुत आश्वस्त (confident) है। वे एक इमारत के मचान (scaffolding) की तरह हैं।
  2. "याद किए गए" शब्द: "July 4th", "John Smith", "red Ferrari", और "Grand Canyon" जैसे शब्द विशिष्ट तथ्य हैं। इन विशिष्ट विवरणों के बारे में मॉडल वास्तव में "बोरिंग" शब्दों की तुलना में कम आश्वस्त है, क्योंकि वे उस विशेष कहानी के लिए अद्वितीय हैं।

SHRED का बड़ा विचार: आपको पूरा वाक्य मिटाने की ज़रूरत नहीं है। आपको बस विशिष्ट, उच्च-मूल्य वाले तथ्यों (मचान/scaffolding) को लक्षित करने की आवश्यकता है और सामान्य भाषा की संरचना को वैसे ही छोड़ने की आवश्यकता है।

SHRED कैसे काम करता है (2-चरणीय प्रक्रिया)

SHRED एक "रिटेन-सेट-फ्री" (retain-set-free) विधि है, जिसका अर्थ है कि इसे किसी बाहरी स्टडी गाइड की आवश्यकता नहीं है। यह मॉडल के अपने मस्तिष्क का उपयोग एक शिक्षक के रूप में करता है।

चरण 1: जासूसी कार्य (चयन - Selection)
मॉडल उस वाक्य को पढ़ता है जिसे उसे भूलना है। वह हर शब्द को देखता है और पूछता है: "इस शब्द से मुझे कितनी हैरानी (surprise) हो रही है?"

  • यदि मॉडल हैरान नहीं है (उच्च संभावना/high probability), तो यह एक सामान्य शब्द है (जैसे "the")। SHRED इन्हें अनदेखा कर देता है।
  • यदि मॉडल हैरान है (कम संभावना/low probability), तो यह एक विशिष्ट तथ्य है (जैसे "John Smith")। SHRED इन्हें भूलने के लक्ष्यों के रूप में चिह्नित करता है।

चरण 2: सर्जरी (डेमोशन - Demotion)
इसके बाद मॉडल को एक साथ दो चीजें करने के लिए प्रशिक्षित किया जाता है:

  1. लक्ष्यों को भूलना: इसे विशिष्ट तथ्यों (जैसे "John Smith") पर अपना विश्वास कम करने के लिए मजबूर किया जाता है।
  2. मचान (Scaffolding) को बनाए रखना: इसे सामान्य शब्दों (जैसे "On", "the") पर अपना विश्वास उच्च रखने के लिए कहा जाता है।

ऐसा करके, मॉडल अंग्रेजी बोलने की अपनी क्षमता खोए बिना विशिष्ट रहस्य को "भूलना" सीख जाता है। यह एक कमरे से विशिष्ट फर्नीचर को हटाने जैसा है बिना दीवारों को गिराए।

यह दूसरों से बेहतर क्यों है

पेपर ने चार बेंचमार्क (जैसे "फाइनल एग्जाम") पर कई अन्य विधियों के विरुद्ध SHRED का परीक्षण किया। उन्होंने यह पाया:

  • पारेटो फ्रंटियर (The Pareto Frontier): एक ग्राफ की कल्पना करें जहाँ शीर्ष-बाएँ कोने में "परफेक्ट स्कोर" (कुल विस्मरण + कुल उपयोगिता) है। अधिकांश विधियाँ बीच में या नीचे-दाएँ कोने में फंसी हुई हैं। SHRED एकमात्र विधि है जो बिना किसी स्टडी गाइड (रिटेन सेट) के शीर्ष-बाएँ कोने तक पहुँचती है।
  • "ब्रेन डैमेज" नहीं: अन्य विधियाँ अक्सर मॉडल को सवाल पूछने से मना करने या बड़बड़ाने (gibberish) के लिए मजबूर कर देती हैं। SHRED मॉडल की सामान्य बुद्धिमत्ता को बरकरार रखता है।
  • Hallucination (भ्रम) का समाधान: एक आश्चर्यजनक मोड़ में, SHRED ने वास्तव में मॉडल को वास्तविक दुनिया के बारे में गलत तथ्य बनाने से कम कर दिया। "नकली" याद किए गए कहानियों को हटाकर, मॉडल का प्राकृतिक ज्ञान अधिक स्पष्ट रूप से उभर कर आया।
  • मजबूती (Robustness):
    • पुनः सीखना (Relearning): यदि आप मॉडल को कुछ उदाहरण दिखाकर गुप्त जानकारी को फिर से याद करने के लिए छलने की कोशिश करते हैं, तो SHRED वाला मॉडल दूसरों की तुलना में बहुत कठिन होता है।
    • गोपनीयता (Privacy): हैकर्स के लिए यह बताना बहुत कठिन है कि क्या मॉडल अभी भी उस गुप्त डेटा को "याद" कर रहा है।
    • स्थिरता (Stability): आप इसे टूटने के डर के बिना लंबे समय तक प्रशिक्षित कर सकते हैं।

"नॉब्स" (Knobs) और सेटिंग्स

लेखकों ने पाया कि SHRED को ट्यून करने के दो मुख्य तरीके हैं:

  1. "कितना" वाला नॉब (P): आप केवल सबसे विशिष्ट शब्दों के शीर्ष 50% को भूलने या 100% को भूलने का चुनाव कर सकते हैं। भूलने और मॉडल को स्मार्ट बनाए रखने के बीच संतुलन बनाने के लिए 50% सबसे अच्छा है।
  2. "बैच साइज" का आश्चर्य: आमतौर पर, AI प्रशिक्षण में, डेटा के बड़े समूहों का उपयोग करना बेहतर होता है। SHRED बहुत छोटे बैचों (यहाँ तक कि एक समय में केवल एक उदाहरण) के साथ सबसे अच्छा काम करता है। यह एक नया कौशल सीखने जैसा है—पूरे वर्कआउट के बजाय एक बार में एक विशिष्ट चाल का अभ्यास करना; यह मॉडल को अधिक सर्जिकल तरीके से "अनलर्न" करने में मदद करता है।

सारांश

SHRED एक चतुर तरीका है जिससे AI को बिना किसी मैन्युअल गाइड के विशिष्ट रहस्यों को भूलने के लिए बनाया जा सकता है। यह उन विशिष्ट, अद्वितीय शब्दों की पहचान करके और उनके महत्व को धीरे से कम करके काम करता है जो रहस्य को थामे हुए हैं, जबकि सामान्य भाषा की संरचना को अछूता छोड़ देता है। परिणाम एक ऐसा मॉडल है जिसने सफलतापूर्वक बुरे डेटा को भुला दिया है लेकिन वह अभी भी स्मार्ट, सहायक और सुरक्षित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →