Agent-First Tool API: A Semantic Interface Paradigm for Enterprise AI Agent Systems
यह शोध पत्र "एजेंट-फर्स्ट टूल एपीआई" प्रतिमान (पैराडाइम) का प्रस्ताव और सत्यापन करता है, जो पारंपरिक मानव-उन्मुख CRUD इंटरफेस को एक सिमेंटिक छह-वर्ब प्रोटोकॉल और संरचित निर्णय-सहायता मेटाडेटा से बदल देता है ताकि एंटरप्राइज प्रोडक्शन सिस्टम में स्वायत्त एजेंटों की कार्य सफलता दर और त्रुटि सुधार को महत्वपूर्ण रूप से बढ़ाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े शाब्दिक (literal) अर्थ निकालने वाले रोबोट सहायक को एक जटिल निर्देश देने की कोशिश कर रहे हैं।
पुराना तरीका (द "CRUD" समस्या):
अभी, अधिकांश एंटरप्राइज सॉफ्टवेयर (जैसे वे सिस्टम जिनका उपयोग बैंक या स्टोर करते हैं) मनुष्यों के लिए बनाए गए हैं। यदि आप चाहते हैं कि एक मनुष्य "पिछले महीने खुले हुए डाउनटाउन ब्रांच को खोजे," तो वे एक मानचित्र देख सकते हैं, एक साइन पढ़ सकते हैं और इसे समझ सकते हैं।
लेकिन यदि आप एक रोबोट को आज के मानक सॉफ्टवेयर इंटरफेस का उपयोग करके यह करने के लिए कहते हैं, तो यह रोबोट को एक टैक्स फॉर्म भरने के लिए कहने जैसा है जहाँ उसे काम शुरू करने से पहले ही ब्रांच का सटीक 10-अंकों वाला आईडी नंबर पता होना चाहिए। यदि रोबोट आईडी का अनुमान गलत लगाता है, तो सिस्टम बस "Error 404" कहेगा और रुक जाएगा। रोबोट को फिर से अनुमान लगाना होगा, एक और त्रुटि मिलेगी, और अंततः वह हार मान लेगा या मानव से मदद मांगेगा। यह "CRUD" मिसमैच को दर्शाता है: सॉफ्टवेयर सटीक आईडी और सटीक डेटा की अपेक्षा करता है, लेकिन AI एक अस्पष्ट, प्राकृतिक भाषा के लक्ष्य से शुरुआत करता है।
नया तरीका (एजेंट-फर्स्ट टूल एपीआई):
लेखक इन उपकरणों को विशेष रूप से AI एजेंटों के लिए डिजाइन करने का एक नया तरीका प्रस्तावित करते हैं। एक कठोर फॉर्म के बजाय, वे टूल को एक सहायक मानव सहायक की तरह मानते हैं जो अस्पष्टता को संभालने में सक्षम है।
यहाँ उनका "छह-क्रिया" (Six-Verb) सिस्टम काम करता है, जिसे एक ट्रैवल एजेंट के उदाहरण से समझा जा सकता है:
- सिमेंटिक सर्च (The "आप क्या कहना चाहते हैं?" चरण):
- पुराना तरीका: आपको कहना होगा "JFK के लिए उड़ान बुक करें।"
- नया तरीका: आप कहते हैं, "टाइम्स स्क्वायर के पास वाले हवाई अड्डे के लिए उड़ान बुक करें।" टूल घबराता नहीं है; यह अपने डेटाबेस में खोजता है, टाइम्स स्क्वायर के पास तीन हवाई अड्डे पाता है, और कहता है, "मुझे JFK, ला गार्डिया और न्यूवार्क मिले। आपका मतलब किससे था?"
- कैंडिडेट्स को हल करना (The "स्पष्टीकरण" चरण):
- AI सही वाले (JFK) को सूची में से चुनता है। टूल पुष्टि करता है, "समझ गया, JFK।"
- एक्शन का पूर्वावलोकन (The "ड्राई रन" चरण):
- वास्तव में टिकट बुक करने (जिसमें पैसा खर्च होता है) से पहले, टूल एक ड्राफ्ट दिखाता है: "मैं यह करने जा रहा हूँ: JFK के लिए $500 में एक उड़ान बुक करना। क्या यह ठीक है?" यह गलतियों को होने से पहले ही रोकता है।
- एक्शन निष्पादित करना (The "इसे करें" चरण):
- एक बार जब AI (या एक मानव प्रबंधक) "हाँ" कहता है, तो टूल वास्तव में टिकट बुक कर देता है।
- परिणाम का सत्यापन (The "क्या यह काम किया?" चरण):
- टूल तुरंत अपने काम की जांच करता है: "मैंने टिकट बुक कर दिया है। मुझे यह सुनिश्चित करने के लिए डेटाबेस की दोबारा जांच करने दें कि कन्फर्मेशन नंबर असली है।"
- त्रुटि से उबरना (The "प्लान बी" चरण):
- यदि कुछ गलत हो जाता है (जैसे, उड़ान बिक चुकी है), तो टूल केवल क्रैश नहीं होता है। यह कहता है, "वह उड़ान फुल है, लेकिन यहाँ तीन अन्य उड़ानें हैं जो काम करती हैं। हमें इनमें से किसका प्रयास करना चाहिए?"
सुरक्षा जाल (गवर्नेंस):
पेपर एक सख्त "सुरक्षा गार्ड" प्रणाली भी पेश करता है।
- दोहरी-परत अनुमति (Dual-Layer Permissions): यह दो चीजें जांचता है: "क्या इस AI के पास यह करने के लिए जॉब टाइटल है?" (क्षमता/Capability) और "क्या इस AI को इस विशिष्ट स्टोर के डेटा को छूने की अनुमति है?" (स्कोप/Scope)।
- गतिशील जोखिम (Dynamic Risk): यदि AI कुछ छोटा करने की कोशिश करता है (जैसे, एक टिकट की जांच करना), तो यह सीधे आगे बढ़ जाता है। यदि यह कुछ बड़ा करने की कोशिश करता है (जैसे, 500 रिकॉर्ड डिलीट करना या पूरे ब्रांड के लिए कीमतें बदलना), तो सिस्टम स्वचालित रूप से रुक जाता है और आगे बढ़ने से पहले एक मानव प्रबंधक से अनुमोदन मांगता है।
परिणाम:
लेखकों ने इसे 85 विभिन्न उपकरणों (जैसे वर्क ऑर्डर प्रबंधित करना, कर्मचारियों को प्रशिक्षित करना या उपकरण ठीक करना) के साथ एक वास्तविक दुनिया के सिस्टम में परखा।
- सफलता दर: नए सिस्टम ने 88% कार्यों को हल किया, जबकि पुराने सिस्टम ने केवल 64% को।
- कम मानवीय सहायता: नए सिस्टम को केवल 6% समय मानवीय हस्तक्षेप की आवश्यकता थी, जबकि पुराने के लिए यह 22% था।
- कम गलतियाँ: AI ने बहुत कम "हलुसिनेशन" (गलत आईडी का अनुमान लगाना) किया क्योंकि टूल ने उसे पहले सही आईडी खोजने में मदद की।
ट्रेड-ऑफ (समझौता):
यह नया सिस्टम प्रत्येक व्यक्तिगत चरण के लिए थोड़ा अधिक समय लेता है और अधिक "कंप्यूटिंग पावर" (टोकन) का उपयोग करता है क्योंकि यह इन सभी अतिरिक्त जांचों (खोज, पूर्वावलोकन, सत्यापन) को करता है। हालांकि, क्योंकि यह कम बार विफल होता है और अनुमान लगाने के लूप में नहीं फंसता है, इसलिए पूरे काम को पूरा करने में लगने वाला कुल समय वास्तव में तेज़ और बहुत अधिक विश्वसनीय होता है।
सारांश में:
पेपर का तर्क है कि AI एजेंटों को व्यवसायों में वास्तव में उपयोगी बनाने के लिए, हम उन्हें वही उपकरण नहीं दे सकते जिनका उपयोग हम मनुष्यों के लिए करते हैं। हमें उपकरणों को फिर से डिजाइन करने की आवश्यकता है ताकि वे संवादात्मक, आत्म-सुधार करने वाले और सुरक्षा-सचेत हों, जिससे AI एक "अंधा अनुमान लगाने वाला" बनने के बजाय एक "पर्यवेक्षित पेशेवर" बन सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।