← नवीनतम पेपर
💬 NLP

SkillCAT: Contrastive Assessment and Topology-Aware Skill Self-Evolution for LLM Agents

SkillCAT एक प्रशिक्षण-मुक्त ढांचा है जो पुन: प्रयोज्य कौशलों को उत्पन्न करने, मान्य करने और कुशलतापूर्वक तैनात करने के लिए कॉन्ट्रास्टिव कॉज़ल एक्सट्रैक्शन (Contrastive Causal Extraction), असेसमेंट-ऑगमेंटेड इवोल्यूशन (Assessment-Augmented Evolution) और टोपोलॉजी-अवेयर टास्क एक्जीक्यूशन (Topology-Aware Task Execution) का उपयोग करके LLM एजेंटों को बढ़ाता है, जिससे विभिन्न बेंचमार्क में बेसलाइनों की तुलना में 40.40% तक प्रदर्शन सुधार प्राप्त होता है।

मूल लेखक: Kunfeng Chen, Qihuang Zhong, Juhua Liu, Bo Du

प्रकाशित 2026-06-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kunfeng Chen, Qihuang Zhong, Juhua Liu, Bo Du

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट सहायक को जटिल कार्य करना सिखा रहे हैं, जैसे कि स्प्रेडशीट प्रबंधित करना या किसी दस्तावेज़ से प्रश्नों के उत्तर देना। रोबोट पहले से ही बुद्धिमान है, लेकिन उसे सफल होने के लिए एक "चीट शीट" (निर्देशों या कौशलों का एक सेट) की आवश्यकता है।

पुरानी विधियों के साथ समस्या यह है कि वे रोबोट को एक बार कोई कार्य करते हुए देखकर उसकी चीट शीट लिखने की कोशिश करती हैं। यदि वह सफल होता है, तो वे लिखते हैं कि उसने क्या किया। यदि वह विफल होता है, तो वे अनुमान लगा सकते हैं कि क्या गलत हुआ। फिर, वे इन सभी नोट्स को एक विशाल, अव्यवस्थित मैनुअल में ढेर कर देते हैं। जब रोबोट एक नया कार्य करता है, तो उसे पूरा मैनुअल पढ़ना पड़ता है, भले ही उसका अधिकांश हिस्सा अप्रासंगिक हो, जिससे वह भ्रमित हो जाता है और धीमा हो जाता है।

SkillCAT चीट शीट बनाने का एक नया, स्मार्ट तरीका है। इसे रोबोट को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; यह केवल सीखने की प्रक्रिया को तीन अलग-अलग चरणों में व्यवस्थित करता है, जैसे कि एक तीन-चरणीय कुकिंग प्रतियोगिता।

1. "तुलना और विषमता" चरण (कंट्रास्टिव कॉज़ल एक्सट्रैक्शन - Contrastive Causal Extraction)

पुराना तरीका: शेफ (रोबोट) एक बार केक बनाने की कोशिश करता है। केक जल जाता है। cookbook लेखक लिखता है, "केक न जलाएं," बिना यह जाने कि क्यों जला।

SkillCAT का तरीका: शेफ थोड़ी अलग सामग्री के साथ पाँच बार केक बनाने की कोशिश करता है।

  • एक प्रयास में, केक एकदम सही होता है।
  • दूसरे प्रयास में, यह जल जाता है।
  • SkillCAT परफेक्ट केक और जले हुए केक को अगल-बगल देखता है। यह पूछता है: "तबाही से ठीक पहले शेफ ने वह एक विशिष्ट चीज़ क्या अलग की थी?"
  • यह बेकिंग की पूरी प्रक्रिया को अनदेखा कर देता है और केवल उस महत्वपूर्ण क्षण पर ध्यान केंद्रित करता है जहाँ सफलता और विफलता एक दूसरे से अलग हुई थी। यह सुनिश्चित करता है कि सबक समस्या के वास्तविक कारण के बारे में हो, न कि केवल रैंडम शोर के बारे में।

2. "टेस्ट ड्राइव" चरण (असेसमेंट-ऑगमेंटेड इवोल्यूशन - Assessment-Augmented Evolution)

पुराना तरीका: Cookbook लेखक एक नया सुझाव (जैसे "अधिक चीनी डालें") लेता है और उसे तुरंत मास्टर cookbook में जोड़ देता है, इस उम्मीद में कि यह मदद करेगा। कभी-कभी, यह नया सुझाव उस रेसिपी को खराब कर देता है जो पहले से ही काम कर रही थी।

SkillCAT का तरीका: नए सुझाव को मास्टर cookbook में जोड़ने से पहले, SkillCAT उसे एक टेस्ट किचन में डालता है।

  • यह नए सुझाव को लेता है और उसे ठीक उसी केक रेसिपी पर आजमाता है जो शेफ ने पहले ही बना ली हैं।
  • स्कोरकार्ड:
    • यदि कोई सुझाव एक विफल केक को सफलता में बदल देता है, तो उसे गोल्ड स्टार मिलता है (हाई स्कोर)।
    • यदि कोई सुझाव एक सफल केक को सफल बनाए रखता है, तो उसे सिल्वर स्टार मिलता है (गुड स्कोर)।
    • यदि कोई सुझाव एक सफल केक को विफलता में बदल देता है, तो उसे रेड कार्ड मिलता है (रिजेक्टेड)।
  • केवल वे सुझाव जो इस टेस्ट ड्राइव में पास होते हैं, अंतिम किताब में शामिल किए जाते हैं। यह रोबोट को ऐसी बुरी आदतें सीखने से रोकता है जो उन चीजों को बिगाड़ सकती हैं जिन्हें वह पहले से ही करना जानता है।

3. "स्मार्ट इंडेक्स" चरण (टोपोलॉजी-अवेयर टास्क एक्जीक्यूशन - Topology-Aware Task Execution)

पुराना तरीका: जब रोबोट को केक बनाना होता है, तो उसे 500 पन्नों की पूरी cookbook पढ़ने के लिए मजबूर किया जाता है, जिसमें जले हुए पिज्जा को कैसे ठीक करें या सूफ़ले (soufflé) कैसे बनाएं, जैसे अध्याय भी शामिल होते हैं, भले ही वह सिर्फ केक बना रहा हो। यह बहुत अधिक और भ्रामक है।

SkillCAT का तरीका: SkillCAT आपकी cookbook को एक स्मार्ट, क्लिक करने योग्य मेनू में व्यवस्थित करता है।

  • यह सभी कौशलों का एक मानचित्र (टोपोलॉजी) बनाता है।
  • जब रोबोट को केक बनाने के लिए कहा जाता है, तो सिस्टम मेनू को देखता है और कहता है, "ठीक है, हमें केवल 'केक' अध्याय और 'मिक्सिंग' अनुभाग की आवश्यकता है।"
  • यह केवल उन विशिष्ट पृष्ठों को रोबोट के दिमाग में लोड करता है। यह पिज्जा और सूफ़ले के अध्यायों को पूरी तरह से अनदेखा कर देता है। यह रोबोट को केंद्रित, तेज़ और कम भ्रमित रखता है।

परिणाम

शोधकर्ताओं ने स्प्रेडशीट ठीक करने, तालिकाओं से प्रश्नों के उत्तर देने और दस्तावेज़ों को पढ़ने जैसे कार्यों पर इस प्रणाली का परीक्षण किया।

  • बेहतर स्कोर: इस तीन-चरणीय प्रक्रिया का उपयोग करके, रोबोट ने पुरानी विधियों की तुलना में अपने औसत स्कोर में 40% तक सुधार किया।
  • क्रॉस-मॉडल सफलता: भले ही एक अलग रोबोट (एक अलग AI मॉडल) द्वारा पहले रोबोट द्वारा बनाई गई चीट शीट का उपयोग किया जाए, फिर भी वह पहले की तुलना में बहुत बेहतर प्रदर्शन करता है।
  • कोई प्रशिक्षण आवश्यक नहीं: सबसे अच्छी बात यह है कि उन्हें रोबोट को शुरू से फिर से सिखाने की आवश्यकता नहीं थी। उन्होंने बस उनके पिछले अनुभवों को बेहतर ढंग से व्यवस्थित किया।

संक्षेप में, SkillCAT रोबोट को अनुमान लगाने से रोकता है, उसके नए विचारों को नियम बनने से पहले परखता है, और यह सुनिश्चित करता है कि वह केवल वही निर्देश पढ़े जिनकी उसे उस समय वास्तव में आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →