SkillRevise: Improving LLM-Authored Agent Skills via Trace-Conditioned Skill Revision
SkillRevise एक निष्पादन-आधारित (execution-grounded) ढांचा है जो निष्पादन ट्रैसेस (execution traces) से दोषों का निदान करके, मरम्मत सिद्धांतों को पुनर्प्राप्त करके और इष्टतम संस्करणों को अनुभवजन्य रूप से चुनकर अपूर्ण प्रारंभिक एजेंट कौशल को पुनरावृत्ति के माध्यम से परिष्कृत करता है, जिससे यह वन-शॉट जनरेशन विधियों की तुलना में एजेंट की सफलता दर और क्रॉस-मॉडल हस्तांतरणीयता में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ SKILLREVISE पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।
बड़ी तस्वीर: एक रोबोट को अपनी "गलतियों से सीखना" सिखाना
कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान लेकिन अनुभवहीन इंटर्न (जिसे AI Agent कहा जाता है) को एक जटिल काम करने के लिए रखा है, जैसे कि एक विशाल गोदाम को व्यवस्थित करना या कंप्यूटर प्रोग्राम को डीबग करना।
आमतौर पर, आप इंटर्न को एक मैनुअल (जिसे "Skill" कहा जाता है) देते हैं।
- समस्या: यदि मैनुअल किसी मानव विशेषज्ञ द्वारा लिखा गया है, तो यह महंगा हो सकता है और शायद यह उस तरीके से मेल न खाए जिससे इंटर्न वास्तव में सोचता है। यदि आप इंटर्न से एक बार में अपना खुद का मैनुअल लिखने के लिए कहते हैं, तो वह कुछ ऐसा लिख सकता है जो कागज़ पर तो एकदम सही दिखता है, लेकिन जब वह काम करने की कोशिश करता है तो बिखर जाता है।
- पुराना तरीका: पिछले तरीकों ने मैनुal को सुधारने के लिए इंटर्न को बहुत अभ्यास करने और निर्देशों को धीरे-धीरे "विकसित" करने की कोशिश की। लेकिन इसमें बहुत समय लगता है और यदि आप एक खराब मैनुअल से शुरुआत करते हैं (जिसे "cold start" समस्या कहा जाता है), तो यह अच्छी तरह से काम नहीं करता है।
SKILLREVISE एक नया सिस्टम है जो एक सख्त लेकिन मददगार कोच की तरह काम करता है। मैनुअल को महीनों तक विकसित होने का इंतज़ार करने के बजाय, यह एक कच्चे ड्राफ्ट (rough draft) को लेता है, इंटर्न को उसे आज़माने देता है, देखता है कि वे ठीक कहाँ विफल हुए, और फिर उस विशिष्ट विफलता के आधार पर तुरंत मैनुअल को एडिट (संशोधित) करता है।
यह कैसे काम करता है: "कोच का लूप" (The Coach's Loop)
पेपर एक चार-चरणीय चक्र का वर्णन करता है जो मैनुअल को बेहतर बनाने के लिए बार-बार (आमतौर पर तीन बार) होता है:
1. परीक्षण रन (Execution)
इंटर्न वर्तमान मैनुअल के संस्करण का उपयोग करके कार्य करने का प्रयास करता है।
- उदाहरण: इंटर्न एक बुकशेल्फ़ बनाने की कोशिश करता है। वह निर्देशों का पालन करता है, लेकिन शेल्फ़ डगमगाती है और गिर जाती है।
2. पोस्टमार्टम (Diagnosis)
सिस्टम केवल यह नहीं कहता कि "तुम विफल रहे।" यह एक जासूस की तरह काम करता है। यह सबूतों (डगमगाती शेल्फ़) को देखता है और पूछता है:
- क्या गलत हुआ? (क्या हमने गलत पेंच इस्तेमाल किए?)
- क्या सही रहा? (लकड़ी को काटा गया था, इसलिए उस हिस्से को न बदलें।)
- उदाहरण: कोच कहता है, "आपने लकड़ी को गलत नहीं मापा, लेकिन आपने फर्श के समतल होने की जाँच करने वाला कदम छोड़ दिया। साथ ही, लकड़ी को सैंडिंग (घिसने) वाले भाग को बनाए रखें; वह अच्छा था।"
3. ज्ञान का पुस्तकालय (Principle Memory)
सिस्टम सामान्य मरम्मत नियमों के एक "पुस्तकालय" की जाँच करता है। यह इस विशिष्ट बुकशेल्फ़ के उत्तर को नहीं खोजता; बल्कि यह इस नियम को खोजता है कि सामान्य रूप से डगमगाती शेल्फ को कैसे ठीक किया जाए।
- उदाहरण: कोच ताश के पत्तों के एक डेक से एक कार्ड निकालता है जिस पर लिखा है: "नियम #4: फ्रेम बनाने से पहले हमेशा नींव की जाँच करें।"
4. पुनलेखन (Revision)
सिस्टम जासूस की रिपोर्ट और सामान्य नियम को मिलाकर मैनुअल को फिर से लिखता है। महत्वपूर्ण बात यह है कि यह "एंकर्स" (Anchors) जोड़ता है।
- एंकर क्या हैं? ये विशिष्ट चेकपॉइंट्स हैं। "सावधानी से बनाएँ" कहने के बजाय, नया मैनुअल कहता है, "यहाँ रुकें, फर्श के स्तर की जाँच करें, और यदि यह असमान है, तो रुक जाएँ।"
- उदाहरण: अब नए मैनुअल में एक लाल स्टिकी नोट है: "फर्श को कील लगाने से पहले रुकें और स्तर की जाँच करें।"
5. अंतिम निर्णय (Utility Gate)
इंटर्न नए मैनुअल को आज़माता है।
- यदि नया मैनुअल बेहतर काम करता है, तो सिस्टम इसे रखता है।
- यदि नया मैनुअल चीज़ों को और खराब कर देता है, तो सिस्टम इसे फेंक देता है और पिछले संस्करण पर वापस चला जाता है।
- उदाहरण: कोच नए निर्देशों को आज़माता है। यदि शेल्फ़ अभी भी डगमगा रही है, तो वे कहते हैं, "ठीक है, वह नया विचार बुरा था। चलिए पुराने निर्देशों पर वापस चलते हैं और अगली बार दूसरा सुधार करने की कोशिश करते हैं।"
यह क्यों विशेष है?
पेपर इस दृष्टिकोण के तीन मुख्य कारण बताता है कि यह हमारे पास मौजूद चीज़ों से बेहतर क्यों है:
- यह छोटी शुरुआत के अनुकूल है (Cold-Start Friendly): आपको शुरू करने के लिए 1,000 परफेक्ट मैनुअल्स के पुस्तकालय की आवश्यकता नहीं है। आपको बस एक अपूर्ण मैनुअल की आवश्यकता है, और SKILLREVISE इसे जल्दी से ठीक कर सकता है।
- यह केवल "अधिक अभ्यास" नहीं है: पुराने तरीके AI को सीखने के लिए हजारों बार अभ्यास करने देते हैं। SKILLREVISE एक लक्षित सर्जरी की तरह है। यह निर्देशों में विशिष्ट दोष को ढूंढता है और उसे ठीक करता है, बजाय इसके कि यह उम्मीद की जाए कि AI गलती से खुद ही सीख जाएगा।
- यह केवल ट्रिक्स नहीं, बल्कि सामान्य नियम सीखता है: सिस्टम यह सुनिश्चित करने के लिए सावधान है कि AI को इस विशिष्ट टेस्ट के लिए नकल करना न सिखाया जाए। यह AI को समस्याओं के प्रकारों को कैसे संभालना है, यह सिखाता है।
- खराब स्किल: "यदि टेस्ट लाल बटन के लिए कहता है, तो लाल बटन दबाएं।" (यह केवल उस एक टेस्ट के लिए काम करता है)।
- अच्छी स्किल (SKILLREVISE): "बटन दबाने से पहले डायग्राम के विरुद्ध रंग का सत्यापन हमेशा करें।" (यह किसी भी टेस्ट के लिए काम करता है)।
परिणाम: क्या यह काम करता है?
लेखकों ने इसे अलग-अलग AI मॉडल (जैसे GPT-5.5, Qwen, और DeepSeek) के साथ तीन अलग-अलग "परीक्षा कक्षों" (benchmarks) पर परखा।
- स्कोर: बिना किसी मदद के, AI ने लगभग 36% कार्यों को सही किया। एक वन-शॉट मैनुअल (एक बार लिखा गया और कभी सुधारा नहीं गया) के साथ, इसने लगभग 39% कार्य सही किए।
- SKILLREVISE स्कोर: इस "कोच के लूप" के मात्र तीन राउंड के बाद, AI ने 61% कार्यों को सही किया।
- निष्कर्ष: सिस्टम ने एक औसत दर्जे के मैनुअल को बहुत जल्दी एक अत्यधिक प्रभावी मैनुअल में बदल दिया। इसने यह भी दिखाया कि इन बेहतर मैनुअल्स का उपयोग अलग-अलग AI मॉडल्स द्वारा किया जा सकता है, न कि केवल उसी मॉडल द्वारा जिसने उन्हें लिखा था, जो यह साबित करता है कि कौशल वास्तव में सामान्य ज्ञान थे, न कि केवल विशिष्ट ट्रिक्स।
सारांश में
SKILLREVISE एक ऐसा ढांचा है जो AI "स्किल" को स्थिर निर्देशों के रूप में नहीं, बल्कि जीवित दस्तावेजों के रूप में मानता है। यह कोशिश निदान सामान्य नियम प्राप्त करना पुनलेखन परीक्षण के चक्र का उपयोग करके एक खराब निर्देशों के सेट को एक बेहतरीन मैनुअल में बदल देता है, यह सुनिश्चित करता है कि AI केवल उत्तरों को याद न करे बल्कि वास्तव में काम को सही ढंग से कैसे करना है, यह सीखे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।