← नवीनतम पेपर
🤖 machine learning

Beyond Hard Writes and Rigid Preservation: Soft Recursive Least-Squares for Lifelong LLM Editing

यह शोधपत्र RLSEdit को पेश करता है, जो लाइफलॉन्ग एलएलएम (LLM) एडिटिंग के लिए एक रिकर्सिव लीस्ट-स्क्वायर्स फ्रेमवर्क है, जो अपडेट को सॉफ्ट कंस्ट्रेंट्स के साथ एक ऑनलाइन क्वाड्रेटिक ऑप्टिमाइज़ेशन के रूप में फॉर्म्युलेट करता है ताकि प्लास्टिसिटी-स्टेबिलिटी द्वंद्व को प्रभावी ढंग से संतुलित किया जा सके, जिससे सामान्य क्षमताओं को सुरक्षित रखते हुए 10,000 तथ्यों तक की स्थिर अनुक्रमिक एडिटिंग सक्षम होती है।

मूल लेखक: Xinyu Wang, Sicheng Lyu, Yu Gu, Jerry Huang, Peng Lu, Yufei Cui, Xiao-Wen Chang

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinyu Wang, Sicheng Lyu, Yu Gu, Jerry Huang, Peng Lu, Yufei Cui, Xiao-Wen Chang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान और विद्वान लाइब्रेरियन (एक Large Language Model) है जिसने तथ्यों का एक विशाल पुस्तकालय याद कर रखा है। एक दिन, आपको एहसास होता है कि कुछ किताबों में जानकारी पुरानी हो गई है। आपको पूरे पुस्तकालय को फेंककर उसे फिर से बनाने के बिना, उन किताबों को अपडेट करने की आवश्यकता है—क्योंकि ऐसा करना बहुत महंगा और धीमा होगा।

यह मॉडल एडिटिंग (Model Editing) की समस्या है: किसी AI को उसके पूरे स्वरूप को पुन: प्रशिक्षित (retraining) किए बिना विशिष्ट तथ्यों को अपडेट करना।

समस्या: "ओवरराइट" बनाम "स्टिफनेस" (Overwrite vs. Stiffness) का द्वंद्व

यह शोध पत्र तर्क देता है कि इन लाइब्रेरियन को अपडेट करने के वर्तमान तरीके या तो हथौड़े चलाने जैसे हैं या एक कठोर पिंजरे की तरह, और दोनों ही काम नहीं करते जब आपको समय के साथ हजारों अपडेट करने हों।

  1. "हार्ड राइट" (The Hard Write - हथौड़ा): कुछ तरीके पुराने तथ्य को बस कुचल देते हैं और नया लिख देते हैं।
    • उपमा: कल्पना कीजिए कि आप एक नोटबुक में लिख रहे हैं। हर बार जब आपको कोई नया तथ्य मिलता है, तो आप पुराने तथ्य के ऊपर घिसकर लिख देते हैं। यदि आप ऐसा 10,000 बार करते हैं, तो आपकी नोटबुक एक उलझे हुए स्क्रिबल (scribble) जैसी बन जाएगी। नए तथ्य अनजाने में उन पुराने, असंबंधित तथ्यों को मिटा सकते हैं जिन्हें आप छूना भी नहीं चाहते थे। लाइब्रेरियन उन चीजों को भूलने लगेगा जो वह कल तक बखूबी जानता था।
  2. "रिजिड प्रिजर्वेशन" (The Rigid Preservation - कठोर पिंजरा): अन्य तरीके बहुत सावधान रहने की कोशिश करते हैं, जिससे वे केवल बहुत विशिष्ट, पूर्व-अनुमोदित दिशाओं में ही बदलाव की अनुमति देते हैं।
    • उपमा: कल्पना कीजिए कि लाइब्रेरियन एक पिंजरे में बंद है जो केवल विशिष्ट अपडेट के लिए खुलता है। हालांकि यह कुछ चीजों की रक्षा करता है, लेकिन यह पिंजरा बहुत कठोर है। यह लाइब्रेरियन को स्वाभाविक रूप से नई चीजें सीखने से रोक सकता है, या यह "बुरे" बदलावों को उन अंतरालों से अंदर आने दे सकता है क्योंकि पिंजरा हर संभावित नए तथ्य के लिए डिज़ाइन नहीं किया गया था।

समाधान: RLSEdit (द "सॉफ्ट, रिकर्सिव" अप्रोच)

लेखक RLSEdit नामक एक नई विधि प्रस्तावित करते हैं। हथौड़े या पिंजरे के बजाय, वे एडिटिंग प्रक्रिया को तराजू संतुलित करने या रेडियो ट्यून करने की तरह मानते हैं।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "सॉफ्ट" कंस्ट्रेंट (The Soft Constraint - इलास्टिक बैंड)

लाइब्रेरियन को ठीक इसी तरह बदलने के लिए मजबूर करने या बिल्कुल न बदलने के बजाय, RLSEdt "सॉफ्ट" नियमों का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि लाइब्रेरियन अपने मूल स्वरूप से एक मजबूत, खिंचने वाले इलास्टिक बैंड द्वारा बंधा हुआ है। जब आप उसे एक नया तथ्य सीखने के लिए कहते हैं, तो वह उसे छूने के लिए खिंच सकता है, लेकिन बैंड उसे धीरे से वापस खींचता है ताकि वह अपने मूल स्वरूप से बहुत दूर न भटक जाए। यह उसे अपने मूल व्यक्तित्व या सामान्य ज्ञान को भूलने से रोकता है।

2. "एंकर" (The Anchor - ध्रुव तारा)

यह विधि एक विशिष्ट "एंकर" (तथ्यों का एक सेट जिसे लाइब्रेरियन को निश्चित रूप से सही रखना चाहिए) का भी उपयोग करती है।

  • उपमा: कल्पना कीजिए कि लाइब्रेरियन के पास एक दिशा-सूचक यंत्र (Compass) है जो हमेशा "उत्तर" (मूल, सही तथ्यों) की ओर संकेत करता है। भले ही वह नई चीजें सीखने के लिए खिंचता रहे, लेकिन वह दिशा-सूचक यंत्र यह सुनिश्चित करता है कि वह रास्ता न भटके या गोल-गोल न घूमने लगे।

3. "रिकर्सिव" मैजिक (The Recursive Magic - जादुई कैलकुलेटर)

सबसे बड़ा नवाचार यह है कि वे गणित कैसे करते हैं। आमतौर पर, यदि आप एक मॉडल को 10,000 बार अपडेट करते हैं, तो कंप्यूटर को अगले निर्णय के लिए पिछले 10,000 अपडेटों को देखना पड़ता है। यह धीमा होता जाता है, जैसे एक लाइब्रेरियन किसी भी प्रश्न का उत्तर देने से पहले अपने द्वारा की गई हर एक बातचीत को याद करने की कोशिश कर रहा हो।

  • उपमा: RLSEdit एक "जादुई कैलकुलेटर" (जो Woodbury identity पर आधारित है) का उपयोग करता है। पूरी इतिहास की किताब को बार-बार पढ़ने के बजाय, यह केवल वर्तमान अपडेट और अतीत के एक छोटे से सारांश को देखता है।
  • परिणाम: चाहे आप 10वां अपडेट कर रहे हों या 10,000वां, इसमें उतना ही समय लगता है। यह एक ऐसे लाइब्रेरियन की तरह है जो पुस्तकालय बढ़ने के साथ धीमा हुए बिना तुरंत अपने ज्ञान आधार को अपडेट कर सकता है।

उन्होंने क्या पाया?

शोधकर्ताओं ने इसका परीक्षण दो लोकप्रिय AI मॉडल्स (Llama-3 और Qwen2.5) पर किया और उन्हें एक क्रम में 10,000 नए तथ्य सिखाए।

  • सफलता दर (Success Rate): RLSEdit अन्य तरीकों की तुलना में सिखाए गए नए तथ्यों को याद रखने में बहुत बेहतर था।
  • कोई "कैटास्ट्रोफिक फॉरगेटिंग" नहीं (No Catastrophic Forgetting): जबकि अन्य तरीके कुछ हज़ार अपडेट के बाद पुराने तथ्यों को भूलने लगे या बुनियादी तर्क (जैसे गणित या कोडिंग) में भ्रमित होने लगे, RLSEdit स्थिर रहा।
  • सामान्य बुद्धिमत्ता (General Smarts): 10,000 बदलावों के बाद भी लाइब्रेरियन ने कविता लिखने, गणित की समस्याओं को हल करने या कोड समझने की अपनी क्षमता नहीं खोई। अन्य तरीकों ने समय के साथ लाइब्रेरियन को इन सामान्य क्षेत्रों में "कम बुद्धिमान" बना दिया।

संक्षेप में

RLSEdit को एक स्मार्ट, लचीली मेमोरी सिस्टम के रूप में सोचें। यह एक AI को निरंतर रूप से नई चीजें सीखने की अनुमति देता है बिना:

  1. अपनी पुरानी यादों को मिटाए (जैसा कि एक हथौड़ा मिटा देगा)।
  2. फंस जाने या कठोर होने के (जैसा कि एक पिंजरा बना देगा)।
  3. जैसे-जैसे वह अधिक सीखता है, धीमा होते जाने के (जैसा कि जीवन का हर विवरण याद करने की कोशिश करने वाला इंसान होता है)।

यह AI को लंबे समय तक निरंतर सीखने के लिए तेज, स्थिर और तैयार रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →