← नवीनतम पेपर
💻 computer science

HyperSkill: Self-Evolving LLM Agents via Hypergraph-Structured Skill Memory

HyperSkill एक नवीन ढांचा है जो अनुभवजन्य स्मृति को उप-कार्यों और पुन: प्रयोज्य कौशल के हाइपरग्राफ के रूप में प्रस्तुत करके जटिल कार्यों पर LLM एजेंट के प्रदर्शन को बढ़ाता है, जिससे अधिक प्रभावी भंडारण, संबंधात्मक पुनर्प्राप्ति और स्व-विकसित रखरखाव सक्षम होता है जो मौजूदा बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Ruiyao Xu, Tiankai Yang, Wei-Chieh Huang

प्रकाशित 2026-08-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruiyao Xu, Tiankai Yang, Wei-Chieh Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक कंप्यूटर प्रोग्राम की कल्पना करें जिसे एक मानव सहायक की तरह कार्य करने के लिए डिज़ाइन किया गया है, जो इंटरनेट का उपयोग करने, उपकरणों (tools) का उपयोग करने और जटिल, बहु-चरणीय समस्याओं को हल करने में सक्षम हो। ये प्रोग्राम, जिन्हें AI एजेंट कहा जाता है, केवल प्रश्नों के उत्तर नहीं देते; वे कार्य करते हैं, परिणामों का अवलोकन करते हैं, और यदि वे विफल होते हैं तो पुन: प्रयास करते हैं। इन एजेंटों के लिए समय के साथ बेहतर होने के लिए, उन्हें यह याद रखने की आवश्यकता है कि उन्होंने पहले क्या किया है। जिस प्रकार एक मनुष्य अपने पिछले दोष या सफल रणनीति से सीखता है, उसी प्रकार एक एजेंट को अपने अनुभवों को संग्रहीत करने की आवश्यकता होती है ताकि वह उन्हें बाद में पुन: उपयोग कर सके। चुनौती यह है कि इस स्मृति (memory) को कैसे व्यवस्थित किया जाए। यदि एक एजेंट केवल अपने द्वारा किए गए प्रत्येक कार्य की एक लंबी सूची को सहेज लेता है, तो जानकारी शोर का एक अस्त-व्यet ढेर बन जाती है। यदि वह केवल अंतिम उत्तर को सहेजता है, तो वह उस चरण-दर-चरण तर्क को खो देता है जिसने समाधान को सफल बनाया। एक वास्तव में आत्म-सुधार करने वाले एजेंट को बनाने की कुंजी न केवल किसी घटना के कच्चे डेटा को, बल्कि उन छोटे चरणों और उन्हें हल करने के लिए उपयोग किए गए कौशल के बीच के संबंधों को संग्रहीत करने का तरीका खोजने में निहित है।

शोधकर्ता एजेंट मेमोरी के लिए विभिन्न प्रणालियाँ बनाकर इस समस्या को हल करने का प्रयास कर रहे हैं। कुछ प्रणालियाँ पिछले इंटरैक्शन की पूरी कहानियाँ सहेजती हैं, जबकि अन्य उन कहानियों को संक्षिप्त सारांशों या "कौशलों" की सूचियों में बदलने का प्रयास करती हैं। हालाँकि, ये मौजूदा विधियाँ अक्सर प्रत्येक जानकारी के टुकड़े को एक अलग इकाई के रूप में मानती हैं। वे शायद यह याद रख सकें कि एक विशिष्ट कार्य को हल किया गया था, लेकिन वे यह पकड़ने में विफल रहती हैं कि उस कार्य के छोटे कदम उन पुन: प्रयोज्य कौशलों से कैसे जुड़े थे जिन्होंने इसे संभव बनाया। वे अपनी मेमोरी को कुशलतापूर्वक अपडेट करने में भी संघर्ष करती हैं, क्योंकि वे अक्सर पुरानी जानकारी को बेकार घोषित किए बिना या यह जांचे बिना कि क्या दो समान कौशल वास्तव में एक ही चीज़ हैं, केवल नई जानकारी जोड़ देती हैं। यह सीमा एजेंटों को वास्तव में विकसित होने से रोकती है, क्योंकि वे आसानी से उन पैटर्न को नहीं देख पाते जो विभिन्न कार्यों को एक साथ जोड़ते हैं।

इन कमियों को दूर करने के लिए, शोधकर्ताओं की एक टीम ने HYPERSKILL नामक एक नया ढांचा (framework) विकसित किया है। अनुभवों को एक सपाट सूची या कनेक्शन की एक सरल श्रृंखला के रूप में संग्रहीत करने के बजाय, यह प्रणाली एजेंट के अनुभवों को एक जटिल जाल (web) में व्यवस्थित करती है जहाँ एक एकल मेमोरी यूनिट एक साथ कई संबंधित सूचनाओं को जोड़ती है। एक मेमोरी को एक एकल फ़ाइल के रूप में नहीं, बल्कि एक समूह फोटो (group photo) के रूप में सोचें जो एक विशिष्ट यात्रा, उस यात्रा के दौरान लिए गए व्यक्तिगत कदमों और वहां तक पहुँचने के लिए उपयोग किए गए विशिष्ट उपकरणों या रणनीतियों को एक साथ कैप्चर करती है। जब एजेंट के सामने कोई नई समस्या आती है, तो वह केवल एक समान पिछली कहानी की खोज नहीं करता है। इसके बजाय, वह नई समस्या को उसके छोटे हिस्सों में तोड़ देता है और उन पिछली यात्राओं की तलाश करता है जिनमें वे समान हिस्से शामिल हों, चाहे समग्र कहानी सतह पर कितनी भी अलग क्यों न दिखे।

यह प्रणाली दो प्रकार के मेमोरी नोड्स बनाकर कार्य करती है: एक कार्य के विशिष्ट चरणों के लिए और दूसरा पुन: प्रयोज्य कौशलों के लिए जिन्हें कई अलग-अलग कार्यों में लागू किया जा सकता है। ये नोड्स एक विशेष लिंक द्वारा जुड़े होते हैं जो एजेंट द्वारा की गई एक पूर्ण यात्रा का प्रतिनिधित्व करता है। जब कोई नया कार्य आता है, तो एजेंट वर्तमान कार्य के सबसे सहायक अनुभवों को खोजने के लिए 'डुअल-पाथ सर्च' (दोहरे पथ वाली खोज) का उपयोग करता है। पहले, यह उन पिछली यात्राओं की तलाश करता है जो वर्तमान कार्य के समान छोटे चरणों को साझा करती हैं। दूसरा, यह उन यात्राओं की तलाश करता है जो कार्य के समग्र विवरण से मेल खाती हैं। इन दोनों खोजों को मिलाकर, प्रणाली उन प्रासंगिक अनुभवों को खोज सकती है जिन्हें एक सरल खोज मिस कर सकती है। एक बार जब यह पिछली यात्राओं को खोज लेती है, तो यह सफल परिणामों में कितनी बार एक साथ दिखाई देने के आधार पर उपयोग किए गए कौशलों को रैंक करती है। यह एजेंट को केवल शब्दों की समानता के आधार पर अनुमान लगाने के बजाय सबसे विश्वसनीय रणनीतियों को प्राथमिकता देने की अनुमति देता है।

जैसे-जैसे एजेंट काम करना जारी रखता है और अपने अनुभव संचित करता है, यह प्रणाली अपनी मेमोरी को उपयोगी बनाए रखने के लिए इसे स्वचालित रूप से परिष्कृत करती है। यह संग्रहीत जानकारी को हटाने के लिए नियमित रूप से जाँच करती है जो अप्रभावी साबित हुई है या जिसकी अब आवश्यकता नहीं है। यह उन कौशलों को भी देखती है जो अनिवार्य रूप से एक ही हैं और उन्हें एक एकल, मजबूत प्रविष्टि में मिला देती है। यह प्रक्रिया सुनिश्चित करती है कि मेमोरी संक्षिप्त और उच्च गुणवत्ता वाली बनी रहे, जिससे एजेंट को अनावश्यक या कम मूल्य की जानकारी से अभिभूत होने से बचाया जा सके। शोधकर्ताओं ने जटिल वेब नेविगेशन, बहु-चरणीय तर्क और टूल के उपयोग से संबंधित तीन बेंचमार्क पर इस प्रणाली का परीक्षण किया। उन्होंने दो अलग-अलग लार्ज लैंग्वेज मॉडल्स का उपयोग करके दस अन्य मेमोरी सिस्टम्स के मुकाबले HYPERSILL की तुलना की। परिणामों ने दिखाया कि नया ढांचा लगातार दूसरों से बेहतर प्रदर्शन करता है, कठिन कार्यों पर उच्च सफलता दर प्राप्त करता है। उदाहरण के लिए, एक विशिष्ट परीक्षण पर, इसने बिना किसी मेमोरी के होने की तुलना में सफलता दर में ग्यारह प्रतिशत से अधिक सुधार किया, और इसने यह बिना बहुत अधिक कंप्यूटिंग पावर या समय की आवश्यकता के किया।

अध्ययन यह सुझाव देता है कि मेमोरी कैसे संरचित है, यह मेमोरी के स्वयं के होने जितना ही महत्वपूर्ण है। कार्यों, चरणों और कौशलों के बीच संबंधों को संरक्षित करके, और सिस्टम को अपने ज्ञान आधार को विकसित करने की अनुमति देकर, HYPERSKILL एजेंटों को उनके इतिहास से अधिक प्रभावी ढंग से सीखने में सक्षम बनाता है। शोधकर्ताओं ने पाया कि बिना किसी स्मार्ट संगठन या सफाई के केवल अधिक मेमोरी जोड़ना वास्तव में प्रदर्शन को नुकसान पहुँचा सकता है, जिससे भ्रम और त्रुटियाँ पैदा हो सकती हैं। उनका दृष्टिकोण, जो एक संरचित कनेक्शन वेब को परिशोधन (pruning) और विलय (merging) की अनुशासित प्रक्रिया के साथ जोड़ता है, ऐसे एजेंटों के लिए एक मार्ग प्रदान करता है जो वास्तव में अपने प्रत्येक अनुभव के साथ अधिक सक्षम हो सकते हैं। हालांकि वर्तमान में यह प्रणाली कार्यों को तोड़ने और सबक निकालने के लिए एजेंट पर निर्भर करती है, जो इसके संचालन में एक छोटा सा खर्च जोड़ता है, लेकिन सटीकता और दक्षता में लाभ यह संकेत देते हैं कि ज्ञान को व्यवस्थित करने का यह तरीका स्वायत्त प्रणालियों (autonomous systems) के लिए एक महत्वपूर्ण कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →