← नवीनतम पेपर
💬 NLP

Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning

यह शोध पत्र ReRULE को पेश करता है, जो सुदृढीकरण शिक्षण (reinforcement learning) आधारित LLM अनलर्निंग के लिए एक ऑफ-पॉलिसी रिप्ले तंत्र है, जो बाउंड्री मामलों पर अभिसरण (convergence) में सुधार करने और अतिरिक्त प्रशिक्षण समय को कम करते हुए गुणवत्ता बनाए रखने के लिए कम-इनाम वाले कठिन मामलों के रोलआउट्स को संग्रहीत और पुन: उपयोग करता है।

मूल लेखक: Zirui Pang, Chenlong Zhang, Haosheng Tan, Zhuoran Jin, Jiaheng Wei, Zixin Zhong

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zirui Pang, Chenlong Zhang, Haosheng Tan, Zhuoran Jin, Jiaheng Wei, Zixin Zhong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, विद्वान लाइब्रेरियन (AI) है जिसने लाखों किताबें याद कर रखी हैं। हालाँकि, उन किताबों में से कुछ में ऐसे रहस्य हैं जिन्हें भुला दिया जाना चाहिए—शायद वे कॉपीराइट वाली कहानियाँ या निजी जानकारी हों। लक्ष्य यह है कि लाइब्रेरियन को उन विशिष्ट रहस्यों के बारे में पूछे जाने पर "मुझे यह नहीं पता" कहना सिखाया जाए, बिना उसे बाकी सब कुछ भुलाए बिना जो वह जानता है।

यह AI अनलर्निंग (Unlearning) की समस्या है।

पुराना तरीका: "ऑन-पॉलिसी" (On-Policy) का संघर्ष

यह पेपर एक विधि के बारे में चर्चा करता है जिसे RULE कहा जाता है, जो लाइब्रेरियन को "ट्रायल-एंड-एरर" (प्रयास और त्रुटि) दृष्टिकोण (रीइन्फोर्समेंट लर्निंग) का उपयोग करके इन विशिष्ट प्रश्नों को मना करना सिखाने की कोशिश करता है।

इसे एक छात्र द्वारा अभ्यास टेस्ट देने की तरह समझें।

  • आसान प्रश्न: छात्र पहले से ही इनके उत्तर जानता है। वे इन्हें तुरंत सही बताते हैं।
  • कठिन प्रश्न: ये वे पेचीदा प्रश्न हैं जो ठीक उस सीमा पर हैं जहाँ उसे जानना चाहिए और जहाँ उसे भूल जाना चाहिए। छात्र बार-बार गलतियाँ करता है या हिचकिचाता रहता है।

पुराने तरीके (RULE) में, शिक्षक बार-बार छात्र को उन्हीं प्रश्नों का एक सेट पूछता रहता है।

  • समस्या: शिक्षक आसान प्रश्नों को पूछने में बहुत समय बर्बाद करता है। छात्र उन्हें हर बार पूरी तरह से सही बताता है, लेकिन इससे उसे कुछ नया सीखने में मदद नहीं मिलती। यह बास्केटबॉल के खाली घेरे में निशाना लगाने का अभ्यास करने जैसा है जिसमें गेंद पहले से ही जा चुकी है; आप बेहतर नहीं हो रहे हैं।
  • छूटा हुआ अवसर: इस बीच, कठिन प्रश्न (जिनके लिए छात्र संघर्ष करता है) केवल एक बार पूछे जाते हैं। यदि छात्र गलत होता है, तो उस विशिष्ट प्रयास को फेंक दिया जाता है, और शिक्षक आगे बढ़ जाता है। छात्र को अपनी उस विशिष्ट गलती को सुधारने का दूसरा मौका कभी नहीं मिलता।

नया तरीका: ReRULE (एक "रिप्ले" सिस्टम)

लेखकों ने ReRULE नामक एक नई विधि प्रस्तावित की है। उन्होंने महसूस किया कि "कठिन प्रश्न" सीखने के लिए सबसे मूल्यवान हैं, लेकिन पुराना सिस्टम उनके साथ कचरे जैसा व्यवहार कर रहा था।

यहाँ ReRULE कैसे काम करता है, एक वीडियो गेम एनालॉजी का उपयोग करते हुए:

  1. रिप्ले बफ़र (The "Highlight Reel"):
    प्रशिक्षण के शुरुआती चरणों के दौरान, ReRULE एक स्पोर्ट्स कोच की तरह काम करता है जिसके पास वीडियो कैमरा है। जब छात्र (AI) किसी प्रश्न के साथ संघर्ष करता है और कम स्कोर प्राप्त करता है, तो कोच उस प्रयास को केवल फेंक नहीं देता। इसके बजाय, वह उस विशिष्ट संघर्ष को रिकॉर्ड करता है और उसे एक "रिप्ले बफ़र" (कठिन मामलों के एक विशेष फोल्डर) में सहेज लेता है।

  2. हाइब्रिड ट्रेनिंग (The "Drill Session"):
    बाद के प्रशिक्षण के दौरान, केवल नए प्रश्न पूछने के बजाय, कोच उन सहेजे गए "संघर्ष वाले वीडियो" को रिप्ले बफ़र से निकालता है।

  • वे छात्र को वही कठिन प्रश्न फिर से दिखाते हैं।
  • क्योंकि छात्र इसे पहले देख चुका है, वह इसे फिर से हल करने का प्रयास कर सकता है, लेकिन इस बार एक थोड़ी अलग रणनीति के साथ।
  • यह एक कोच के कहने जैसा है, "याद है जब तुमने वह शॉट मिस किया था? चलो इसे फिर से आजमाते हैं, लेकिन इस बार अपनी कोहनी पर ध्यान केंद्रित करो।"
  1. परिणाम:
    कंप्यूटर उन आसान चीजों का अभ्यास करने में समय बर्बाद करना बंद कर देता है जिन्हें वह पहले से जानता है। इसके बजाय, यह अपनी ऊर्जा उन "कठिन मामलों" पर केंद्रित करता है जो भूलने की सीमा के पास अटके हुए हैं। यह उन कठिन उदाहरणों का पुन: उपयोग करता है जब तक कि छात्र अंततः उनमें महारत हासिल न कर ले।

यह क्यों महत्वपूर्ण है (परिणाम)

पेपर ने तीन अलग-अलग "लाइब्रेरी" (डेटासेट) पर इसका परीक्षण किया:

  • वास्तविक दुनिया का ज्ञान: मशहूर हस्तियों के बारे में तथ्य।
  • कॉपीराइट पुस्तकें: विशेष रूप से, हैरी पॉटर
  • काल्पनिक लेखक: काल्पनिक जीवनियाँ।

निष्कर्ष:

  • बेहतर मेमोरी रिटेंशन (स्मृति प्रतिधारण): हैरी पॉटर परीक्षण में, नई विधि (ReRULE) सामान्य ज्ञान को बरकरार रखने में बहुत बेहतर थी (क्वालिटी स्कोर पर 46.3 से 56.2 तक सुधार) जबकि यह विशिष्ट पुस्तक विवरणों को सफलतापूर्वक भुलाने में भी सफल रही।
  • दक्षता: इसे प्रशिक्षित करने में बहुत अधिक समय नहीं लगा (केवल लगभग 5-11% अधिक समय)। इसने बस उस अतिरिक्त समय का अधिक समझदारी से उपयोग किया।
  • "आसान" अपवाद: एक बहुत ही सरल डेटासेट (TOFU) पर, नई विधि ने ज्यादा मदद नहीं की। यह समझ में आता है: यदि सभी प्रश्न आसान हैं, तो कोई "संघर्ष वाले वीडियो" दोबारा चलाने के लिए नहीं होते, इसलिए सिस्टम पुराने वाले की तरह ही व्यवहार करता है। यह साबित करता है कि यह विधि विशेष रूप से उन स्थितियों के लिए डिज़ाइन की गई है जहाँ कुछ प्रश्न वास्तव में कठिन होते हैं।

संक्षेप में

ReRULE एक स्मार्ट ट्यूटर की तरह है जो यह समझता है कि आसान अभ्यास को दोहराना समय की बर्बादी है। इसके बजाय, यह छात्र की सबसे कठिन गलतियों की एक लाइब्रेरी बनाता है और उसे उन विशिष्ट समस्याओं का बार-बार अभ्यास करने के लिए मजबूर करता है जब तक कि वे ठीक न हो जाएं। यह "अनलर्निंग" की प्रक्रिया को तेज़, स्मार्ट और AI की सामान्य बुद्धिमत्ता को सुरक्षित रखने में बेहतर बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →