← नवीनतम पेपर
🤖 AI

Do Self-Evolving Agents Forget? Capability Degradation and Preservation in Lifelong LLM Agent Adaptation

यह शोधपत्र स्व-विकसित (self-evolving) LLM एजेंटों में "क्षमता क्षरण" (capability erosion) की घटना की पहचान करता है, जहाँ नए कार्यों के अनुकूल होने से वर्कफ़्लो, कौशल, मॉडल और मेमोरी आयामों में पहले से सीखे गए कौशल का ह्रास होता है, और इस विनाशकारी विचलन (destructive drift) को स्पष्ट रूप से रोकने के लिए दीर्घकालिक अनुकूलन को स्थिर करने हेतु एक "क्षमता-संरक्षण विकास" (Capability-Preserving Evolution - CPE) ढांचे का प्रस्ताव करता है।

मूल लेखक: Ye Yu, Xiaopeng Yuan, Haibo Jin, Heming Liu, Yaoning Yu, Haohan Wang

प्रकाशित 2026-05-12
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ye Yu, Xiaopeng Yuan, Haibo Jin, Heming Liu, Yaoning Yu, Haohan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Do Self-Evolving Agents Forget?" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

मुख्य विचार: "अति-उत्साही इंटर्न" की समस्या

कल्पना कीजिए कि आपने अपने ऑफिस को संभालने के लिए एक प्रतिभाशाली, स्वयं-सुधार करने वाले (self-improving) इंटर्न को काम पर रखा है। यह इंटर्न कमाल का है: वह अपने काम के निर्देशों को फिर से लिख सकता है, नए टूल्स सीख सकता है, अपने दिमाग को अपडेट कर सकता है, और जो कुछ भी उसने किया है उसका एक चलता-फिरता डायरी रिकॉर्ड रख सकता है।

यह पेपर एक सरल प्रश्न पूछता है: यदि यह इंटर्न अपना सारा समय आज सामने आने वाली नई, कठिन समस्याओं को हल करना सीखने में बिता देता है, तो क्या वह उन सरल, नियमित कार्यों को भूल जाएगा जिन्हें उसने कल तक महारत हासिल कर ली थी?

लेखक कहते हैं: हाँ, वे भूल जाएंगे।

वे इस घटना को "कैपेबिलिटी इरोजन" (Capability Erosion - क्षमता का क्षरण) कहते हैं। ठीक वैसे ही जैसे एक नदी का किनारा धीरे-धीरे कटकर बह जाता है, एजेंट की पुरानी कार्यों को करने की क्षमता भी क्षीण होती जाती है क्योंकि वह लगातार नई चीजों के अनुकूल होने की कोशिश करता रहता है। यह पेपर सिद्ध करता है कि यह चार विशिष्ट तरीकों से होता है:

  1. वर्कफ्लो (Workflow): चरण-दर-चरण निर्देश अव्यवस्थित और बोझिल हो जाते हैं।
  2. स्किल्स (Skills): टूलबॉक्स नए गैजेट्स से भर जाता है, जिससे पुराने और भरोसेमंद टूल्स बाहर निकल जाते हैं।
  3. मॉडल (Model): एजेंट का "दिमाग" (उसका आंतरिक कोड) ओवरराइट हो जाता है, जिससे पुराना ज्ञान खो जाता है।
  4. मेमोरी (Memory): एजेंट की डायरी नई टिप्पणियों के साथ ओवरराइट हो जाती है, जिससे पुरानी सलाह ढूँढना कठिन हो जाता है।

चार तरीके जिनसे एजेंट "भूलते" हैं

शोधकर्ताओं ने देखा कि एजेंट खुद को कैसे बदलते हैं और पाया कि "अनकन्स्ट्रेंड" इवोल्यूशन (एजेंट को जो चाहे बदलने देना) चार प्रकार का नुकसान पहुँचाता है:

1. वर्कफ्लो ड्रिफ्ट (The "Over-Engineered Recipe" - अत्यधिक जटिल रेसिपी)

  • उपमा: कल्पना कीजिए कि एक शेफ एक बेहतरीन सैंडविच बनाता है। फिर, उसे एक जटिल 'गॉरमेट बर्गर' बनाने का अनुरोध मिलता है। बर्गर को हल करने के लिए, वह अतिरिक्त चरण जोड़ देता है: "ब्रेड का तापमान जांचें," "लेट्यूस की ताजगी सत्यापित करें," "बन (bun) को दोबारा चेक करें।" वह ये सुरक्षा जाँचें जोड़ता जाता है।
  • समस्या: जब वह वापस साधारण सैंडविच बनाने जाता है, तो वह अभी भी बर्गर की रेसिपी का उपयोग करता है। सैंडविच बनाने में दोगुना समय लगता है और इसमें अनावश्यक चरण जुड़ जाते हैं। एजेंट "अति-रक्षात्मक" हो गया है, जिससे सरल कार्य जटिल और विफल होने के प्रति संवेदनशील हो गए हैं।

2. स्किल स्वैप (The "Full Backpack" - भरा हुआ बैकपैक)

  • उपमा: कल्पना कीजिए कि एक हाइकर के पास एक बैकपैक है जिसमें केवल 30 चीजें आ सकती हैं। वह पहाड़ चढ़ना (नया कौशल) सीखता है और एक रस्सी जोड़ता है। लेकिन बैकपैक भर चुका है, इसलिए उसे जगह बनाने के लिए अपना पुराना नक्शा (पुराना कौशल) फेंकना पड़ता है।
  • समस्या: जैसे-जैसे एजेंट नए, विशिष्ट कौशल सीखता है, वह उन सामान्य, उपयोगी कौशलों को बाहर निकाल देता है जो उसने पहले सीखे थे। वह नए इलाके का मास्टर तो बन जाता है, लेकिन पुराने रास्तों पर खो जाता है।

3. ब्रेन रीराइट (The "Erasing Whiteboard" - व्हाइटबोर्ड मिटाना)

  • उपमा: कल्पना कीजिए कि एक छात्र गणित की परीक्षा के लिए पढ़ाई कर रहा है। वह बीजगणित (algebra) को पूरी तरह सीख लेता है। फिर, वह जीव विज्ञान (biology) पढ़ने लगता है। जीव विज्ञान के तथ्यों को याद करने के लिए, उसे अपने व्हाइटबोर्ड पर लिखे बीजगणित के नोट्स के ऊपर ही लिखना पड़ता है।
  • समस्या: एजेंट अपने आंतरिक "वेट्स" (अपने दिमाग) को अपडेट करता है ताकि चिकित्सा या तकनीकी समस्याओं को हल किया जा सके। ऐसा करते हुए, वह अनजाने में उन विशिष्ट न्यूरल पाथवे (neural pathways) को ओवरराइट कर देता है जो उसे पुराने समस्याओं को हल करने में मदद करते थे। यह "कैटास्ट्रोफिक फॉरगेटिंग" (विनाशकारी विस्मृति) का एक क्लासिक मामला है।

4. मेमोरी ओवरराइट (The "Flooded Diary" - बाढ़ आती डायरी)

  • उपमा: कल्पना कीजिए कि एक डायरी है जहाँ आप हर दिन सीखी गई बातें लिखते हैं। यदि आप बिना पुराने पन्नों को व्यवस्थित किए नई प्रविष्टियाँ (entries) लिखते रहते हैं, तो नई स्याही अंततः पुराने पन्नों को ढक लेती है, या डायरी इतनी भर जाती है कि आपको पहले अध्याय फेंकने पड़ते हैं।
  • समस्या: एजेंट का मेमोरी बैंक नए, विशिष्ट अनुभवों से भर जाता है। पुराने, भरोसेमंद अनुभव बाहर धकेल दिए जाते हैं या उन्हें ढूँढना कठिन हो जाता है, भले ही एजेंट का दिमाग न बदला हो।

समाधान: "कैपेबिलिटी-प्रिजर्विंग इवोल्यूशन" (CPE)

पेपर एक समाधान प्रस्तावित करता है जिसे कैपेबिलिटी-प्रिजर्विंग इवोल्यूशन (CPE) कहा जाता है।

CPE को एक "सेफ्टी गार्ड" या "स्टिकी नोट" सिस्टम के रूप में सोचें। यह एजेंट को नई चीजें सीखने से नहीं रोकता; यह बस एजेंट को बताता है: "आप नया कौशल सीख सकते हैं, लेकिन आपको इसे करते समय पुराने कौशलों को तोड़ना नहीं चाहिए।"

प्रत्येक चार समस्याओं के लिए "सेफ्टी गार्ड" कैसे काम करता है:

  • वर्कफ्लो के लिए: जब एजेंट अपने निर्देशों को फिर से लिखने की कोशिश करता है, तो CPE जाँचता है: "क्या यह नया संस्करण अभी भी सरल कार्यों के लिए काम करता है?" यदि नया संस्करण बहुत बोझिल है या पुराने प्रवाह को तोड़ता है, तो गार्ड कहता है, "नहीं, मूल संरचना को सरल रखें।"
  • स्किल्स के लिए: पुराने कौशलों को जगह बनाने के लिए उन्हें फेंकने के बजाय, CPE उन्हें विलय (merge) करने की कोशिश करता है। यदि एक नया कौशल पुराने के समान है, तो यह दोनों को सुरक्षित रखने के लिए उन्हें मिला देता है। यह "उच्च-मूल्य" वाले पुराने कौशलों को डिलीट होने से बचाता है।
  • दिमाग (Brain) के लिए: यह "इलास्टिक वेट कंसोलिडेशन" (Elastic Weight Consolidation) नामक तकनीक का उपयोग करता है। कल्पना कीजिए कि एजेंट के दिमाग में "महत्वपूर्ण" न्यूरॉन्स और "कम महत्वपूर्ण" न्यूरॉन्स हैं। CPE उन महत्वपूर्ण न्यूरॉन्स पर "छूना मना है" (Do Not Touch) का साइन लगा देता है जो पुराने कार्यों में मदद करते थे। एजेंट अभी भी सीख सकता है, लेकिन केवल उन क्षेत्रों में जो पुराने ज्ञान को नहीं तोड़ते।
  • मेमोरी के लिए: CPE एक लाइब्रेरियन की तरह काम करता है। यदि किसी स्मृति (memory) को अतीत में कई बार उपयोगी साबित किया गया है, तो उसे एक "गोल्ड स्टार" मिलता है और उसे डिलीट होने से बचाया जाता है। केवल कम गुणवत्ता वाली या अप्रमाणित स्मृतियों को ही ओवरराइट करने की अनुमति दी जाती है।

परिणाम: स्थिरता बनाम परिवर्तनशीलता (Stability vs. Plasticity)

पेपर ने वास्तविक AI एजेंटों पर विभिन्न मॉडलों (जैसे GPT-5 और अन्य) का उपयोग करके इसका परीक्षण किया।

  • बिना CPE के (The "Vanilla" Agent): एजेंट नए, कठिन कार्यों में बेहतर हो गया लेकिन पुराने, सरल कार्यों में काफी खराब हो गया। यह एक ऐसे छात्र की तरह था जिसने जीव विज्ञान की परीक्षा में तो टॉप किया लेकिन उस गणित की परीक्षा में फेल हो गया जिसमें वह पहले अच्छा था।
  • CPE के साथ (The "Guarded" Agent): एजेंट ने नए कार्यों को प्रभावी ढंग से सीखा। लेकिन, उसने अपने पुराने कौशलों को लगभग पूरी तरह से बरकरार रखा।

निष्कर्ष:
पेपर निष्कर्ष निकालता है कि एक AI एजेंट के लिए वास्तव में लंबे समय तक "विकसित" (evolve) होने के लिए, वह केवल एक ऐसी मशीन नहीं हो सकता जो लगातार खुद को फिर से लिखती रहती है। उसे एक ऐसे तंत्र की आवश्यकता है जो उसके अतीत की रक्षा करे। यदि आप एक ऐसा एजेंट चाहते हैं जो अनंत काल तक बढ़ सके, तो आपको उसे यह सिखाना होगा कि वह जो जानता है उसे याद रखते हुए वह सीखे जो उसे जानने की आवश्यकता है।

संक्षेप में: स्वयं-विकसित होने वाले एजेंट (Self-evolving agents) भूल जाते हैं, लेकिन हम उन्हें अपने भविष्य का निर्माण करते हुए अपने अतीत को थामे रखना सिखा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →