← नवीनतम पेपर
💻 computer science

ERSkill: Evolving for Skill-Guided Adaptive Memory Retrieval

यह शोध पत्र ERSkill पेश करता है, जो एक रिट्रीवल-केंद्रित फ्रेमवर्क है जो LLM एजेंटों को उनके रिट्रीवल व्यवहारों को निष्पादन योग्य कौशल (executable skills) के रूप में प्रदर्शित करके अपनी मेमोरी एक्सेस रणनीतियों को निरंतर विकसित करने में सक्षम बनाता है और एक स्किल राउटर और स्किल सेट को सह-अनुकूलित (co-optimize) करता है ताकि विषम मेमोरी क्वेरी कार्यों में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Haolong Chen, Liang Zhang, Zhuo Li, Lei Xue, Guanrxu Zhu

प्रकाशित 2026-08-14
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Haolong Chen, Liang Zhang, Zhuo Li, Lei Xue, Guanrxu Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यंत बुद्धिमान रोबोट मित्र से बात कर रहे हैं जो आपकी कही हुई हर बात को याद रखता है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, ये "लार्ज लैंग्वेज मॉडल्स" केवल एक बार के मददगार नहीं, बल्कि दीर्घकालिक सहयोगियों की तरह बनते जा रहे हैं। ऐसा करने के लिए, उन्हें एक मेमोरी बैंक की आवश्यकता है—तथ्यों, प्राथमिकताओं और पिछली बातचीत को संग्रहीत करने के लिए एक स्थान। लेकिन यहाँ पेचीदा हिस्सा यह है: यादों का एक विशाल पुस्तकालय होना बेकार है यदि आपको सही किताब ढूँढना न आता हो। आज के अधिकांश रोबोट अपनी यादों को खोजने के लिए एक स्थिर, 'एक ही आकार सबके लिए' (one-size-fits-all) विधि का उपयोग करते हैं, जैसे कि हर प्रश्न के लिए एक ही सरल कीवर्ड सर्च का उपयोग करना। यदि आप पूछते हैं, "मैंने नाश्ते में क्या खाया था?" तो रोबलेट शायद सिर्फ "नाश्ता" शब्द को खोजेगा। लेकिन यदि आप पूछते हैं, "उस तूफान के बाद मैंने समुद्र तट पर जाना क्यों बंद कर दिया?" तो रोबोट को एक तूफान की घटना को बाद के निर्णय से जोड़ने की आवश्यकता होगी, जिसके लिए बहुत अधिक जटिल खोज रणनीति की आवश्यकता होती है। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या एक रोबोट यह सीख सकता है कि पूछे जाने वाले प्रश्न के आधार पर अपनी स्मृति को कैसे खोजा जाए?

यहीं पर ERSkill नामक एक नया फ्रेमवर्क आता है। ERSkill को एक ऐसे रोबोट के रूप में समझें जिसके पास न केवल एक स्मृति है; बल्कि उसके पास विभिन्न "सर्च स्किल्स" (खोज कौशल) का एक टूलबॉक्स है जिसे वह समय के साथ सीख और अपग्रेड कर सकता है। एक एकल, कठोर खोज विधि का उपयोग करने के बजाय, ERSkill मेमोरी रिट्रीवल (स्मृति पुनर्प्राप्ति) को निष्पादन योग्य रेसिपीज़ (recipes) के एक सेट की तरह मानता है। कुछ रेसिपी सरल हो सकती हैं, जैसे "किसी विशिष्ट नाम को खोजें।" अन्य जटिल हो सकती हैं, जैसे "एक नाम खोजें, फिर देखें कि उसके बाद क्या हुआ, फिर पिछले वर्ष की समान घटनाओं को खोजें।" रोबोट एक स्मार्ट "राउटर" (एक ट्रैफिक डायरेक्टर की तरह) का उपयोग यह तय करने के लिए करता है कि प्रत्येक प्रश्न के लिए किस रेसिपी का उपयोग किया जाए।

जो चीज़ ERSkill को खास बनाती है वह यह है कि यह विकसित (evolve) होता है। यह केवल उन रेसिपीज़ तक सीमित नहीं रहता जो इसके पास शुरुआत में थीं। जैसे-जैसे यह प्रश्नों के उत्तर देने का अभ्यास करता है, इसे एहसास होता है, "हे, यह रेसिपी तथ्यों को खोजने के लिए तो बहुत अच्छी है, लेकिन यह कारण खोजने के लिए बहुत खराब है कि चीजें क्यों हुईं।" इसलिए, यह नई रेसिपी बनाना और पुरानीओं को परिष्कृत करना शुरू कर देता है। यह हर उस खोज पथ (search path) का हिसाब रखने के लिए एक चतुर प्रणाली का उपयोग करता है जिसे इसने कभी आजमाया है (एक "एक्सपीरियंस ट्राई" (experience trie), जो उन सभी सड़कों का एक मानचित्र है जिन पर इसने गाड़ी चलाई है) ताकि यह गोल-गोल घूमने में समय बर्बाद न करे। यह एक "डबल फ्रंटियर" सुरक्षा जाल का भी उपयोग करता है: कौशलों का एक समूह यह परीक्षण करने के लिए टेस्ट किया जाता है कि क्या वे महान होने के योग्य हैं, और दूसरा समूह केवल तभी अंतिम लाइनअप में आने की अनुमति पाता है जब रोबोट का ट्रैफिक डायरेक्टर सही समय पर उन्हें विश्वसनीय रूप से चुन सके।

परिणाम प्रभावशाली हैं। कठिन मेमोरी क्विज़ पर परीक्षण किए जाने पर, ERSkill ने न केवल थोड़ा बेहतर प्रदर्शन किया; बल्कि इसने प्रतियोगिता को पछाड़ दिया। एक शक्तिशाली AI मॉडल, Qwen3-Next-80B-A3B-Instruct का उपयोग करते हुए, ERSkill ने सर्वश्रेष्ठ गैर-विकसित (non-evolving) विधियों की तुलना में अपने समग्र स्कोर में 31.3% का सुधार किया। एक छोटे, तेज़ मॉडल GPT-5.4-nano के साथ भी, इसने प्रदर्शन को 28.1% तक बढ़ाया। यह पेपर दिखाता है कि रोबोट को यह बताने के बजाय कि क्या खोजना है, उसे यह सिखाने से कि कैसे खोजना है, वह एक बहुत अधिक प्रभावी और अनुकूलन योग्य साथी बन जाता है। यह केवल अधिक याद नहीं रख रहा है; यह अधिक समझदारी से याद रख रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →