← नवीनतम पेपर
🤖 AI

Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents

यह शोध पत्र "फॉर्मल स्किल" (Formal Skill) को प्रस्तुत करता है, जो एक रनटाइम-नेटिव एब्स्ट्रैक्शन है जो एलएलएम (LLM) एजेंटों की दक्षता, सटीकता और प्रवर्तनीयता को बढ़ाने के लिए अनौपचारिक प्राकृतिक-भाषा निर्देशों के स्थान पर निष्पादन योग्य स्टेट मशीनों और JSON स्कीमा का उपयोग करता है, जैसा कि हार्मनेस-बेंच (Harness-Bench) पर ओपन-सोर्स फेयरीक्लॉ (FairyClaw) फ्रेमवर्क के उत्कृष्ट प्रदर्शन द्वारा प्रदर्शित किया गया है।

मूल लेखक: Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने कार्यालय की एक जटिल समस्या को हल करने के लिए, जैसे कि किसी टूटे हुए सॉफ़्टवेयर की मरम्मत करने के लिए, एक बहुत ही बुद्धिमान, बहुत तेज़ इंटर्न (AI एजेंट) को काम पर रख रहे हैं।

पुराना तरीका: "वॉल ऑफ टेक्स्ट" मैनुअल

वर्तमान में, अधिकांश AI एजेंट इस तरह काम करते हैं: आप उन्हें एक विशाल, विस्तृत निर्देश पुस्तिका देते हैं जो साधारण अंग्रेजी में लिखी होती है (एक "प्रॉम्प्ट स्किल")। यह कुछ ऐसा कहता है जैसे, "पहले, एरर लॉग देखें। फिर, कोड को ठीक करने का प्रयास करें। सुनिश्चित करें कि आप टेस्ट फाइलों को डिलीट न करें। यदि आप विफल होते हैं, तो फिर से प्रयास करें। एक बार जब आप समाप्त कर लें, तो एक रिपोर्ट लिखें।"

इस दस्तावेज़ को "इनफॉर्मल स्किल" (अनौपचारिक कौशल) कहा जाता है। इसकी तीन बड़ी समस्याएँ हैं:

  1. यह महंगा है: AI को हर एक कदम उठाने के लिए इस विशाल मैनुअल को हर बार पढ़ना पड़ता है। इससे बहुत अधिक "टोकन" (AI कंप्यूटिंग शक्ति की मुद्रा) खर्च होते हैं।
  2. यह अस्पष्ट है: AI को यह अनुमान लगाने के लिए मजबूर होना पड़ता है कि "फिर से प्रयास करें" या "डिलीट न करें" का वास्तव में क्या अर्थ है। यह एक इंसान को यह बताने जैसा है कि "सावधान रहें," बिना यह परिभाषित किए कि "सावधान" रहने का वास्तव में क्या मतलब है।
  3. यह नाजुक है: यदि AI कोई गलती करता है, तो उसे यह याद रखने के लिए पूरी बातचीत के इतिहास को फिर से देखना पड़ता है कि वह कहाँ था। इसके पास यह जानने के लिए कोई अंतर्निहित "चेकलिस्ट" नहीं है कि वह समाप्त हो गया है या उसे एक कदम पीछे जाने की आवश्यकता है।

नया तरीका: "फॉर्मल स्किल" (औपचारिक कौशल)

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे "फॉर्मल स्किल" कहा जाता है। AI को एक लंबे टेक्स्ट मैनुअल देने के बजाय, वे उसे एक प्रोग्रामेबल टूलकिट देते हैं।

इसे एक शेफ को 50 पन्नों की रेसिपी बुक देने के बजाय, उन्हें बिल्ट-इन सुरक्षा सुविधाओं वाले एक स्मार्ट किचन देने के रूप में समझें:

  • रेसिपी टेक्स्ट नहीं, बल्कि कोड है: पैराग्राफ पढ़ने के बजाय, AI विशिष्ट बटनों (टूल्स) के साथ इंटरैक्ट करता है और एक सख्त फ्लोचार्ट (स्टेट मशीन) का पालन करता है।
  • "हुक" सिस्टम: एक क्लब के बाउंसर ( "हुक") की कल्पना करें। काम के किस चरण में AI है, इसके आधार पर बाउंसर तय करता है कि कौन से दरवाजे खुले हैं।
    • चरण 1 (जांच): बाउंसर केवल "सर्च टूल्स" का दरवाजा खोलता है। "डिलीट" वाला दरवाजा बंद रहता है।
    • चरण 2 (मरम्मत): बाउंसर "पैच टूल" को खोल देता है लेकिन "डिलीट" दरवाजे को फिर से लॉक कर देता है।
    • चरण 3 (सत्यापन): AI टेस्टिंग मशीन से "पास" सर्टिफिकेट दिखाए बिना कमरा नहीं छोड़ पाएगा।
  • स्टेट मशीन: AI को पूरी कहानी याद रखने की ज़रूरत नहीं है। उसके पास बस एक छोटा डिजिटल बैज होता है जिस पर लिखा होता है, "मैं वर्तमान में 'मरम्मत' चरण में हूँ।" यदि वह "मरम्मत" पूरा होने से पहले "रिपोर्टिंग" पर जाने की कोशिश करता है, तो सिस्टम उसे स्वचालित रूप से रोक देता है।

"फेयरीक्लॉ" (FairyClaw) इंजन

इसे काम करने के लिए, लेखकों ने FairyClaw नामक एक नया इंजन बनाया है। आप FairyClaw को उस स्मार्ट मैनेजर के रूप में देख सकते हैं जो शो चलाता है।

  • यह केवल AI के साथ चैट नहीं करता; यह सक्रिय रूप से AI के टूल्स और नियमों को प्रबंधित करता है।
  • यह बड़े कार्यों को छोटे उप-कार्यों में तोड़ता है और प्रत्येक के लिए सही "फॉर्मल स्किल" असाइन करता है।
  • यह ठीक से लॉग रखता है कि AI कहाँ है, उसने क्या किया है, और उसे अभी और क्या करना है, ताकि AI कभी भटके नहीं।

परिणाम: तेज़, सस्ता और सुरक्षित

लेखकों ने अन्य लोकप्रिय AI एजेंट सिस्टम के मुकाबले इस सिस्टम (FairyClaya) का परीक्षण एक कठिन टेस्ट Harness-Bench के माध्यम से किया।

  • स्कोर: FairyClaw ने काम को वास्तव में पूरा करने के मामले में अन्य सिस्टम के बराबर या उनसे बेहतर प्रदर्शन किया।
  • लागत: यही सबसे बड़ी जीत है। FairyClow ने अन्य सिस्टमों के औसत की तुलना में 48% कम टोकन (पैसा/कंप्यूटिंग पावर) का उपयोग किया।
    • उपमा: यदि अन्य सिस्टम एक डिलीवरी ट्रक की तरह थे जो शहर में घूमते समय हर मोड़ पर ड्राइवर को एक विशाल नक्शा जोर-जोर से पढ़कर सुना रहा था, तो FairyClaw एक GPS की तरह है जो ड्राइवर को केवल अगला मोड़ दिखाता है और जरूरत पड़ने तक बाकी का नक्शा छिपा कर रखता है।
  • "कोड रिपेयर" टेस्ट: बग वाले कोड को ठीक करने के कार्य में, FairyClow स्पष्ट विजेता रहा। क्योंकि "फॉर्मल स्किल" ने इसे काम पूरा करने से पहले अपने काम को सत्यापित करने के लिए मजबूर किया, इसलिए इसने वे मूर्खतापूर्ण गलतियाँ नहीं कीं जो अन्य एजेंटों ने की थीं।

सारांश

लेखक तर्क देते हैं कि हमें AI कौशल को लंबे, अस्पष्ट निर्देश मैनुअल की तरह मानना बंद कर देना चाहिए और उन्हें सख्त, निष्पादन योग्य सॉफ्टवेयर प्रोटोकॉल की तरह मानना शुरू करना चाहिए। नियमों को "AI द्वारा पढ़े जाने वाले टेक्स्ट" से बदलकर "AI द्वारा चलाए जाने वाले कोड" में ले जाकर, हमें ऐसे एजेंट मिलते हैं जो चलाने में सस्ते, धोखा देने में कठिन और जटिल प्रक्रियाओं का पालन करने में बेहतर होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →