← नवीनतम पेपर
💬 NLP

AlignEvoSkill: Towards Knowledge-Aware and Task-Aligned Agent Skill Evolution

AlignEvoSkill एक नवीन ढांचा है जो ज्ञान कवरेज और कार्य संरेखण के संयुक्त अनुकूलन के माध्यम से पुन: प्रयोज्य कौशल विकसित करके LLM-आधारित एजेंट के प्रदर्शन को बढ़ाता है, जिससे कम कम्प्यूटेशनल लागत के साथ अत्याधुनिक परिणाम प्राप्त होते हैं।

मूल लेखक: Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che, Yang Deng

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che, Yang Deng

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट सहायक को जटिल काम करना सिखा रहे हैं, जैसे कि मीटिंग की योजना बनाना या कविता लिखना। हर एक निर्देश को हार्ड-कोड करने के बजाय, आप रोबोट को पुन: प्रयोज्य कौशलों (reusable skills) का एक "टूलबॉक्स" देते हैं (जैसे कि "ईमेल से तारीखें निकालना" या "राइम स्कीम की जांच करना")।

समस्या यह है कि जब रोबोट किसी कार्य में विफल होता है, तो उसके टूलबॉक्स को ठीक करने के पुराने तरीके अक्सर स्थिति को और बिगाड़ देते हैं। वे ये गलतियाँ कर सकते हैं:

  1. मुख्य बात को भूल जाना: वे एक ऐसा कौशल चुन लेते हैं जो लगभग सही है लेकिन उसमें ज्ञान का एक महत्वपूर्ण हिस्सा छूट जाता है (जैसे कि यह जांचना भूल जाना कि क्या कोई वास्तव में खाली/फ्री है)।
  2. बहुत अधिक विशिष्ट हो जाना: वे एक ऐसा कौशल बना देते हैं जो केवल उस एक विशिष्ट गलती के लिए काम करता है, न कि भविष्य के लिए एक सामान्य नियम सिखाने के लिए।

यह पेपर ALIGNEVOSKILL पेश करता है, जो रोबोट के टूलबॉक्स को अपग्रेड करने का एक नया तरीका है। इसे रोबोट के कौशल को दो विशिष्ट तरीकों से ठीक करने वाला एक स्मार्ट, डबल-चेकिंग एडिटर समझें।

दो-चरणीय "स्मार्ट एडिटर" प्रक्रिया

चरण 1: "नॉलेज टैग" जासूस (क्या गायब है, उसे ठीक करना)
कल्पना कीजिए कि रोबोट के टूलबॉक्स में मौजूद हर कौशल पर स्टिकी नोट्स (टैग्स) लगे हैं जो यह बताते हैं कि वह क्या करता है।

  • पुराना तरीका: जब रोबot विफल होता है, तो पुराने तरीके केवल सबसे मिलते-जुलते दिखने वाले कौशल को पकड़ लेते हैं या दो कौशलों को बेतरतीब ढंग से मिला देते हैं। यह एक लीक होते पाइप को ठीक करने के लिए उस पर रिंच (wrench) चिपकाने जैसा है—यह देखने में संबंधित लग सकता है, लेकिन यह वास्तव में छेद को ठीक नहीं करता है।
  • ALIGNEVOSKILL का तरीका: पहले, यह विफल कार्य को देखता है और पूछता है, "यहाँ कौन सा विशिष्ट ज्ञान गायब था?" यह "आवश्यक टैग्स" की एक सूची बनाता है (जैसे, "उपलब्धता की जांच करें," "टाइम ज़ोन संभालें")।
  • फिर, यह टूलबॉक्स को स्कैन करता है ताकि ऐसे कौशल मिल सकें जिनमें मैचिंग टैग्स हों। यदि किसी कौशल में कोई टैग (जैसे "टाइम ज़ोन") गायब है, तो सिस्टम को पता चल जाता है कि किस कमी को भरने की आवश्यकता है। फिर यह एक नया कौशल बनाता है जो पुराने कौशलों के उपयोगी हिस्सों को जोड़ता है लेकिन विशेष रूप से उस गायब ज्ञान को भी शामिल करता है।

चरण 2: "प्रासंगिकता" फ़िल्टर (क्या अप्रासंगिक है, उसे ठीक करना)
एक नया संभावित कौशल बनाने के बाद, सिस्टम को यह तय करना होता है: "क्या यह वास्तव में काम के लिए अच्छा है?"

  • पुराना तरीका: कुछ तरीके केवल रोबोट के विफल प्रयास को देखते हैं और कहते हैं, "ठीक है, चलिए एक ऐसा कौशल बनाते हैं जो उस विशिष्ट त्रुटि से बच सके।" यह एक छात्र द्वारा एक विशिष्ट गणित की समस्या का उत्तर रटने जैसा है लेकिन सूत्र को न समझना। यदि संख्याएं बदल जाती हैं, तो वे फिर से विफल हो जाते हैं।
  • ALIGNEVOSKILL का तरीका: यह एक "प्रासंगिकता परीक्षण" (relevance test) का उपयोग करता है। यह AI से पूछता है, "यदि आपको केवल कार्य का विवरण दिया जाए, तो इस विशिष्ट कौशल को उत्पन्न करने की कितनी संभावना होगी?"
    • यदि कौशल केवल रोबोट की पिछली विफलता का एक अजीब विवरण है, तो स्कोर कम होगा।
    • यदि कौशल उस कार्य के लिए एक आदर्श, सामान्य मार्गदर्शिका है, तो स्कोर उच्च होगा।
  • सिस्टम केवल उन कौशलों को रखता है जो इस परीक्षण में उच्च स्कोर करते हैं, और बाकी "शोर वाले" या अप्रासंगिक कौशलों को हटा देता है।

परिणाम: कम प्रयास में एक बेहतर टूलबॉक्स

शोधकर्ताओं ने चार अलग-अलग प्रकार के रोबोट दिमागों (LLMs) का उपयोग करके तीन अलग-अलग "परीक्षा" सेटों (benchmarks) पर इसका परीक्षण किया।

  • बड़ी जीत: नए तरीके ने कौशलों को विकसित किए बिना काम करने की तुलना में रोबोट के प्रदर्शन में 34.7% का सुधार किया।
  • प्रतिस्पर्धा को पछाड़ना: इसने पिछले सर्वश्रेष्ठ तरीकों को एक बड़े अंतर से पछाड़ दिया, और एक नया "गोल्ड स्टैंडर्ड" (SOTA) स्थापित किया।
  • सस्ता: आश्चर्यजनक रूप से, इसने अन्य तरीकों की तुलना में कम कंप्यूटिंग पावर और समय का उपयोग करते हुए यह सब हासिल किया। इसने केवल सफलता के लिए ब्रूट-फोर्स का उपयोग नहीं किया; यह अधिक कुशल था क्योंकि इसने खराब विचारों पर समय बर्बाद करना जल्दी ही बंद कर दिया।

निचोड़ (The Bottom Line)

ALIGNEVOSKILL एक कुशल शिल्पकार की तरह है जो केवल समस्या के लिए अधिक औज़ार नहीं फेंकता। इसके बजाय, वे:

  1. पहचानते हैं कि कौन सा औज़ार गायब है ("नॉलेज टैग्स" का उपयोग करके)।
  2. एक नया औज़ार बनाते हैं जो पुराने औजारों को जोड़ता है लेकिन उस कमी को भी भरता है।
  3. नए औज़ार का परीक्षण करते हैं ताकि यह सुनिश्चित हो सके कि वह वास्तव में काम के लिए उपयोगी है, न कि केवल पिछली गलती की एक प्रति।

परिणामस्वरूप, एक ऐसा रोबोट मिलता है जो अपनी विफलताओं से बहुत तेज़ी से सीखता है, कम गलतियाँ करता है, और भारी मात्रा में अतिरिक्त कंप्यूटिंग पावर की आवश्यकता के बिना अपने काम में बेहतर होता जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →