Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents
यह शोध पत्र "फॉर्मल स्किल" (Formal Skill) को प्रस्तुत करता है, जो एक रनटाइम-नेटिव एब्स्ट्रैक्शन है जो एलएलएम (LLM) एजेंटों की दक्षता, सटीकता और प्रवर्तनीयता को बढ़ाने के लिए अनौपचारिक प्राकृतिक-भाषा निर्देशों के स्थान पर निष्पादन योग्य स्टेट मशीनों और JSON स्कीमा का उपयोग करता है, जैसा कि हार्मनेस-बेंच (Harness-Bench) पर ओपन-सोर्स फेयरीक्लॉ (FairyClaw) फ्रेमवर्क के उत्कृष्ट प्रदर्शन द्वारा प्रदर्शित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने कार्यालय की एक जटिल समस्या को हल करने के लिए, जैसे कि किसी टूटे हुए सॉफ़्टवेयर की मरम्मत करने के लिए, एक बहुत ही बुद्धिमान, बहुत तेज़ इंटर्न (AI एजेंट) को काम पर रख रहे हैं।
पुराना तरीका: "वॉल ऑफ टेक्स्ट" मैनुअल
वर्तमान में, अधिकांश AI एजेंट इस तरह काम करते हैं: आप उन्हें एक विशाल, विस्तृत निर्देश पुस्तिका देते हैं जो साधारण अंग्रेजी में लिखी होती है (एक "प्रॉम्प्ट स्किल")। यह कुछ ऐसा कहता है जैसे, "पहले, एरर लॉग देखें। फिर, कोड को ठीक करने का प्रयास करें। सुनिश्चित करें कि आप टेस्ट फाइलों को डिलीट न करें। यदि आप विफल होते हैं, तो फिर से प्रयास करें। एक बार जब आप समाप्त कर लें, तो एक रिपोर्ट लिखें।"
इस दस्तावेज़ को "इनफॉर्मल स्किल" (अनौपचारिक कौशल) कहा जाता है। इसकी तीन बड़ी समस्याएँ हैं:
- यह महंगा है: AI को हर एक कदम उठाने के लिए इस विशाल मैनुअल को हर बार पढ़ना पड़ता है। इससे बहुत अधिक "टोकन" (AI कंप्यूटिंग शक्ति की मुद्रा) खर्च होते हैं।
- यह अस्पष्ट है: AI को यह अनुमान लगाने के लिए मजबूर होना पड़ता है कि "फिर से प्रयास करें" या "डिलीट न करें" का वास्तव में क्या अर्थ है। यह एक इंसान को यह बताने जैसा है कि "सावधान रहें," बिना यह परिभाषित किए कि "सावधान" रहने का वास्तव में क्या मतलब है।
- यह नाजुक है: यदि AI कोई गलती करता है, तो उसे यह याद रखने के लिए पूरी बातचीत के इतिहास को फिर से देखना पड़ता है कि वह कहाँ था। इसके पास यह जानने के लिए कोई अंतर्निहित "चेकलिस्ट" नहीं है कि वह समाप्त हो गया है या उसे एक कदम पीछे जाने की आवश्यकता है।
नया तरीका: "फॉर्मल स्किल" (औपचारिक कौशल)
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे "फॉर्मल स्किल" कहा जाता है। AI को एक लंबे टेक्स्ट मैनुअल देने के बजाय, वे उसे एक प्रोग्रामेबल टूलकिट देते हैं।
इसे एक शेफ को 50 पन्नों की रेसिपी बुक देने के बजाय, उन्हें बिल्ट-इन सुरक्षा सुविधाओं वाले एक स्मार्ट किचन देने के रूप में समझें:
- रेसिपी टेक्स्ट नहीं, बल्कि कोड है: पैराग्राफ पढ़ने के बजाय, AI विशिष्ट बटनों (टूल्स) के साथ इंटरैक्ट करता है और एक सख्त फ्लोचार्ट (स्टेट मशीन) का पालन करता है।
- "हुक" सिस्टम: एक क्लब के बाउंसर ( "हुक") की कल्पना करें। काम के किस चरण में AI है, इसके आधार पर बाउंसर तय करता है कि कौन से दरवाजे खुले हैं।
- चरण 1 (जांच): बाउंसर केवल "सर्च टूल्स" का दरवाजा खोलता है। "डिलीट" वाला दरवाजा बंद रहता है।
- चरण 2 (मरम्मत): बाउंसर "पैच टूल" को खोल देता है लेकिन "डिलीट" दरवाजे को फिर से लॉक कर देता है।
- चरण 3 (सत्यापन): AI टेस्टिंग मशीन से "पास" सर्टिफिकेट दिखाए बिना कमरा नहीं छोड़ पाएगा।
- स्टेट मशीन: AI को पूरी कहानी याद रखने की ज़रूरत नहीं है। उसके पास बस एक छोटा डिजिटल बैज होता है जिस पर लिखा होता है, "मैं वर्तमान में 'मरम्मत' चरण में हूँ।" यदि वह "मरम्मत" पूरा होने से पहले "रिपोर्टिंग" पर जाने की कोशिश करता है, तो सिस्टम उसे स्वचालित रूप से रोक देता है।
"फेयरीक्लॉ" (FairyClaw) इंजन
इसे काम करने के लिए, लेखकों ने FairyClaw नामक एक नया इंजन बनाया है। आप FairyClaw को उस स्मार्ट मैनेजर के रूप में देख सकते हैं जो शो चलाता है।
- यह केवल AI के साथ चैट नहीं करता; यह सक्रिय रूप से AI के टूल्स और नियमों को प्रबंधित करता है।
- यह बड़े कार्यों को छोटे उप-कार्यों में तोड़ता है और प्रत्येक के लिए सही "फॉर्मल स्किल" असाइन करता है।
- यह ठीक से लॉग रखता है कि AI कहाँ है, उसने क्या किया है, और उसे अभी और क्या करना है, ताकि AI कभी भटके नहीं।
परिणाम: तेज़, सस्ता और सुरक्षित
लेखकों ने अन्य लोकप्रिय AI एजेंट सिस्टम के मुकाबले इस सिस्टम (FairyClaya) का परीक्षण एक कठिन टेस्ट Harness-Bench के माध्यम से किया।
- स्कोर: FairyClaw ने काम को वास्तव में पूरा करने के मामले में अन्य सिस्टम के बराबर या उनसे बेहतर प्रदर्शन किया।
- लागत: यही सबसे बड़ी जीत है। FairyClow ने अन्य सिस्टमों के औसत की तुलना में 48% कम टोकन (पैसा/कंप्यूटिंग पावर) का उपयोग किया।
- उपमा: यदि अन्य सिस्टम एक डिलीवरी ट्रक की तरह थे जो शहर में घूमते समय हर मोड़ पर ड्राइवर को एक विशाल नक्शा जोर-जोर से पढ़कर सुना रहा था, तो FairyClaw एक GPS की तरह है जो ड्राइवर को केवल अगला मोड़ दिखाता है और जरूरत पड़ने तक बाकी का नक्शा छिपा कर रखता है।
- "कोड रिपेयर" टेस्ट: बग वाले कोड को ठीक करने के कार्य में, FairyClow स्पष्ट विजेता रहा। क्योंकि "फॉर्मल स्किल" ने इसे काम पूरा करने से पहले अपने काम को सत्यापित करने के लिए मजबूर किया, इसलिए इसने वे मूर्खतापूर्ण गलतियाँ नहीं कीं जो अन्य एजेंटों ने की थीं।
सारांश
लेखक तर्क देते हैं कि हमें AI कौशल को लंबे, अस्पष्ट निर्देश मैनुअल की तरह मानना बंद कर देना चाहिए और उन्हें सख्त, निष्पादन योग्य सॉफ्टवेयर प्रोटोकॉल की तरह मानना शुरू करना चाहिए। नियमों को "AI द्वारा पढ़े जाने वाले टेक्स्ट" से बदलकर "AI द्वारा चलाए जाने वाले कोड" में ले जाकर, हमें ऐसे एजेंट मिलते हैं जो चलाने में सस्ते, धोखा देने में कठिन और जटिल प्रक्रियाओं का पालन करने में बेहतर होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।