← नवीनतम पेपर
💻 computer science

From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills

यह शोध पत्र शेड्यूलिंग-स्ट्रक्चरल-लॉजिकल (SSL) प्रतिनिधित्व प्रस्तुत करता है, जो एजेंट कौशल के लिए एक नवीन संरचित ढांचा है जो शेड्यूलिंग, निष्पादन और तार्किक साक्ष्य को अलग करता है ताकि स्किल डिस्कवरी और रिस्क असेसमेंट कार्यों में टेक्स्ट-ओनली बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Qiliang Liang, Hansi Wang, Zhong Liang, Yang Liu

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qiliang Liang, Hansi Wang, Zhong Liang, Yang Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास AI एजेंटों के लिए "रेसिपी" (नुस्खों) का एक विशाल पुस्तकालय है। ये केवल सामग्री की सूचियाँ नहीं हैं; ये जटिल, बहु-चरणीय निर्देश हैं जो एक AI को टूल का उपयोग करने, फाइलों तक पहुँचने और कार्य करने के तरीके बताते हैं। वर्तमान में, ये रेसिपी लंबे, अव्यवस्थित पैराग्राफ के रूप में लिखी जाती हैं (जैसे कि एक SKILL.md फ़ाइल)।

समस्या क्या है? मनुष्य इन पैराग्राफों को आसानी से पढ़ सकते हैं, लेकिन कंप्यूटर विशिष्ट चरणों, संचालन के क्रम या टेक्स्ट के भीतर छिपे संभावित खतरों को समझने में संघर्ष करते हैं। यह एक उपन्यास में विशिष्ट सामग्री खोजने जैसा है; जानकारी वहां मौजूद है, लेकिन वह कहानी के भीतर दबी हुई है।

यह पेपर इन रेसिपीज़ को व्यवस्थित करने का एक नया तरीका पेश करता है जिसे SSL (Scheduling-Structural-Logical) कहा जाता है। SSL को उस अव्यवस्थित उपन्यास को एक स्पष्ट, तीन-भाग वाले फ्लोचार्ट में बदलने के रूप में समझें जो एक कंप्यूटर तुरंत स्कैन कर सकता है।

यहाँ बताया गया है कि SSL एक स्किल (कौशल) को कैसे विभाजित करता है, सरल उपमाओं का उपयोग करते हुए:

1. द शेड्यूलिंग लेयर (The Scheduling Layer): "मेन्यू कार्ड"

यह क्या है: यह शीर्ष-स्तरीय सारांश है। यह आपको बताता है कि स्किल क्या करती है, कब उपयोग करनी चाहिए, और इसे शुरू करने के लिए इसकी क्या आवश्यकता है।
उपमा: कल्पना कीजिए कि आप एक रेस्तरां में जा रहे हैं। आपको "स्पाइसी नूडल्स" के लिए यह जानने की ज़रूरत नहीं है कि शेफ का पूरा जीवन परिचय या रसोई का इतिहास क्या है। आप बस मेन्यू कार्ड देखते हैं। इसमें व्यंजन का नाम, उसकी कीमत (इनपुट) और बदले में आपको क्या मिलेगा (आउटपुट) सूचीबद्ध होता है।
पेपर में: यह लेयर "लक्ष्य" (Goal), "टैग्स" (Tags), और "इनपुट/आउटपुट" (Inputs/Outputs) को निकालती है ताकि AI जल्दी से निर्णय ले सके, "हाँ, यह स्किल मेरी रिक्वेस्ट के लिए उपयुक्त है," बिना पूरे दस्तावेज़ को पढ़े।

2. द स्ट्रक्चरल लेयर (The Structural Layer): "मूवी स्क्रिप्ट"

यह क्या है: यह स्किल को प्रमुख दृश्यों या चरणों में तोड़ता है।
उपमा: एक फिल्म के बारे में सोचें। यह केवल एक साथ घटित नहीं होती; इसका एक प्लॉट स्ट्रक्चर (कथानक संरचना) होता है: एक्ट 1 (तैयारी), एक्ट 2 (यात्रा), एक्ट 3 (चरम सीमा/क्लाइमेक्स), और एक्ट 4 (समाधान)
पेपर में: टेक्स्ट की एक दीवार के बजाय, SSL स्किल को "तैयारी" (Prepare), "प्राप्त करना" (Acquire), "कार्य करना" (Act), और "सत्यापन" (Verify) जैसे दृश्यों में व्यवस्थित करता है। इससे कंप्यूटर को कार्य के प्रवाह को समझने में मदद मिलती है। वह जानता है कि "कार्य करने" से पहले आपको "तैयारी" करनी होगी।

3. द लॉजिकल लेयर (The Logical Layer): "एक्शन लिस्ट"

यह क्या है: यह वह सूक्ष्म विवरण है कि प्रत्येक दृश्य में वास्तव में क्या होता है। यह विशिष्ट कार्यों और उन संसाधनों (जैसे फाइलें या पासवर्ड) को सूचीबद्ध करता है जिन्हें वे छूते हैं।
उपमा: यह एक विशिष्ट दृश्य के लिए शॉट लिस्ट (Shot List) है। यह कहता है: "कैमरा 1: फ़ाइल को पढ़ें," "कैमरा 2: API को कॉल करें," "कैमरा 3: डेटाबेस में लिखें।" यह यह भी नोट करता है कि क्या कैमरा किसी "खतरे के क्षेत्र" (जैसे पासवर्ड फ़ाइल) को छू रहा है।
पेपर में: यह लेयर परमाणु क्रियाओं (जैसे "READ" या "WRITE") की पहचान करती है और यह भी बताती है कि कौन से संसाधन शामिल हैं। यह जोखिमों को पहचानने के लिए महत्वपूर्ण है, जैसे कि "ओह, यह स्किल एक पासवर्ड फ़ाइल को पढ़ने वाली है और उसे इंटरनेट पर भेजने वाली है।"


उन्होंने यह क्यों किया? (प्रयोग)

शोधकर्ताओं ने इस नए "फ्लोचार्ट" सिस्टम का परीक्षण पुराने "अव्यवस्थित टेक्स्ट" सिस्टम के विरुद्ध दो मुख्य तरीकों से किया:

1. सही रेसिपी खोजना (Skill Discovery)

  • परीक्षण: उन्होंने कंप्यूटर से पूछा, "मुझे अपनी राइटिंग ठीक करने के लिए एक स्किल चाहिए," और देखा कि 6,000 स्किल्स के पुस्तकालय में सही स्किल खोजने में उसे कितनी तेजी से सफलता मिली।
  • परिणाम: जब कंप्यूटर ने SSL फ्लोचार्ट का उपयोग किया, तो उसने सही स्किल बहुत तेज़ी से और अधिक सटीकता से खोजी। यह हर किताब के कवर को शुरू से अंत तक पढ़ने के बजाय एक सटीक, व्यवस्थित कार्ड कैटलॉग का उपयोग करने जैसा था।
  • जीत: सफलता दर काफी बढ़ गई (0.573 से 0.707)।

2. खतरनाक रेसिपीओं को पहचानना (Risk Assessment)

  • परीक्षण: उन्होंने कंप्यूटर को 500 स्किल्स देखने के लिए कहा और पूछा, "क्या यह खतरनाक है? क्या यह डेटा चुराता है या फाइलें डिलीट करता है?"
  • परिणाम: जब कंप्यूटर के पास टेक्स्ट के साथ SSL फ्लोचार्ट था, तो वह "डेटा एक्सफिल्ट्रेशन" (डेटा चोरी करना) या "विनाशकारी व्यवहार" (फाइलें हटाना) जैसे विशिष्ट खतरों को पहचानने में बहुत बेहतर था। क्रियाओं की संरचित सूची ने जोखिमों को मानचित्र पर लाल झंडों की तरह स्पष्ट कर दिया।
  • जीत: जोखिमों को पहचानने की सटीकता में सुधार हुआ (0.744 से 0.787)।

मुख्य निष्कर्ष

पेपर का तर्क है कि SSL का उद्देश्य मूल टेक्स्ट को बदलना नहीं है। आपको पूरी कहानी, उदाहरणों और मानवीय संदर्भ के लिए मूल "उपन्यास" (SKILL.md फ़ाइल) की अभी भी आवश्यकता है।

इसके बजाय, SSL एक "अनुवादक" (Translator) है जो उस उपन्यास को एक संरचित, मशीन-पठनीय मानचित्र में बदल देता है।

  • यह कंप्यूटर को सही टूल जल्दी खोजने में मदद करता है।
  • यह कंप्यूटर को जोखिमों को स्पष्ट रूप से देखने में मदद करता है।
  • यह मूल टेक्स्ट को "सत्य के स्रोत" (Source of Truth) के रूप में सुरक्षित रखता है, जबकि मशीन को काम करने के लिए एक स्वच्छ, व्यवस्थित दृश्य प्रदान करता है।

संक्षेप में, पेपर दिखाता है कि यदि आप चाहते हैं कि AI एजेंट सुरक्षित और स्मार्ट हों, तो आपको उन्हें केवल अधिक टेक्स्ट नहीं देना चाहिए; आपको उन्हें उस टेक्स्ट के वास्तविक कार्यों का एक संरचित मानचित्र देना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →