← नवीनतम पेपर
🤖 AI

MAVEN: Improving Generalization in Agentic Tool Calling

यह शोध पत्र MAVEN को प्रस्तुत करता है, जो एक हल्का प्रतीकात्मक तर्क ढांचा (symbolic reasoning scaffold) है जो संरचित अपघटन (structured decomposition), अनुकूलन योग्य ऑर्केस्ट्रेशन (adaptive orchestration) और मध्यवर्ती सत्यापन (intermediate verification) को सक्षम करके एजेंटिक टूल कॉलिंग में सामान्यीकरण और एंड-टू-एंड कार्य सफलता में महत्वपूर्ण सुधार करता है, जैसा कि एक नए स्ट्रेस-टेस्ट बेंचमार्क पर एक ओपन-वेट मॉडल के प्रदर्शन को बढ़ाने की इसकी क्षमता द्वारा प्रदर्शित किया गया है, जबकि यह मालिकाना प्रणालियों (proprietary systems) के साथ लागत-प्रतिस्पर्धी बना रहता है।

मूल लेखक: Omkar Ghugarkar, Vishvesh Bhat, Muhammad Ahmed Mohsin, Asad Aali

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Omkar Ghugarkar, Vishvesh Bhat, Muhammad Ahmed Mohsin, Asad Aali

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "MAVEN: Improving Generalization in Agentic Tool Calling" पेपर की व्याख्या सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके दी गई है।

बड़ी समस्या: "होशियार लेकिन भुलक्कड़" सहायक

कल्पना कीजिए कि आपने एक जटिल पहेली सुलझाने के लिए, जैसे कि एक टूटी हुई कार के इंजन को ठीक करने या भौतिक विज्ञान की एक कठिन समस्या को हल करने के लिए, एक बेहद प्रतिभाशाली लेकिन थोड़े बिखरे हुए दिमाग वाले सहायक को काम पर रखा है। आप उन्हें उपकरणों की एक सूची देते हैं (एक रिंच, एक कैलकुलेटर, एक डायग्नोस्टिक स्कैनर)।

वर्तमान AI मॉडल (ये "सहायक") बहुत बुद्धिमान हैं। यदि आप उनसे कोई सरल प्रश्न पूछते हैं, तो वे उसे सही हल कर लेते हैं। लेकिन जब आप उन्हें एक लंबा, बहु-चरणीय कार्य करने के लिए कहते हैं—जैसे कि "इंजन का निदान करें, पुर्जा बदलें, और फिर गति का परीक्षण करें"—तो वे अक्सर लड़खड़ा जाते हैं। वे ऐसा कर सकते हैं:

  • तीन कदम पहले उन्होंने क्या किया था, यह भूल जाते हैं।
  • काम के लिए गलत उपकरण चुन लेते हैं।
  • गणित की एक छोटी सी गलती करते हैं और उस गलती पर आधारित काम को आगे बढ़ाते रहते हैं जब तक कि पूरा उत्तर ही गलत न हो जाए।
  • अपना काम चेक किए बिना ही फिनिश लाइन की ओर दौड़ पड़ते हैं।

लेखक इस समस्या को जनरलाइजेशन (Generalization) की कमी कहते हैं। AI एक विशिष्ट प्रकार की पहेली को तो संभाल सकता है, लेकिन यदि आप नियमों को थोड़ा बदल दें या कार्य को लंबा कर दें, तो वह टूट जाता है।

समाधान: MAVEN (एक "प्रोजेक्ट मैनेजर" ढांचा)

इसे ठीक करने के लिए, शोधकर्ताओं ने MAVEN (Modular Agentic Verification and Execution Network) बनाया।

MAVEN को एक नए 'दिमाग' के रूप में नहीं, बल्कि एक अत्यधिक संगठित प्रोजेक्ट मैनेजर के रूप में समझें जो AI और उपकरणों के बीच बैठता है। यह खुद सोचता नहीं है; इसके बजाय, यह AI को एक सख्त और सुरक्षित वर्कफ़्लो का पालन करने के लिए मजबूर करता है।

MAVEN तीन सरल चरणों में काम करता है, जैसे कि एक फैक्ट्री असेंबली लाइन:

  1. क्लिपबोर्ड (Context Buffering): AI कुछ भी करने से पहले, MAVEN बिखरी हुई बातचीत को लेता है और मुख्य तथ्यों को एक क्लिपबोर्ड पर लिख देता है। यह सुनिश्चित करता है कि AI लक्ष्य और समस्या की वर्तमान स्थिति को याद रखे।
  2. ब्लूप्रिंट (Action Synthesis): AI को अगला कदम क्या उठाना है, इसका अनुमान लगाने देने के बजाय, MAVEN इसे बड़े काम को छोटे, एकल चरणों में तोड़ने के लिए मजबूर करता है। यह पूछता है, "अभी हमें कौन सा एक विशिष्ट काम करना है?" और सुनिश्चित करता है कि आगे बढ़ने से पहले AI के पास सभी आवश्यक उपकरण हों।
  3. सेफ्टी इंस्पेक्टर (Invocation & Verification): यह सबसे महत्वपूर्ण हिस्सा है। किसी टूल (जैसे कैलकुलेटर) का उपयोग करने से पहले, MAVв AI को रुकने और यह कहने के लिए मजबूर करता है, "रुको, क्या मैंने अपनी गणित जाँची? क्या यह सही टूल है?" यदि AI कोई गलती करता है, तो MAVEN उसे तुरंत पकड़ लेता है और कहता है, "फिर से कोशिश करो," बजाय इसके कि गलती को बढ़ते रहने दिया जाए।

परीक्षण: MAVEN-Bench (एक "स्ट्रेस टेस्ट" परीक्षा)

अपने विचार को सिद्ध करने के लिए, टीम ने MAVEN-Bench नामक एक नई परीक्षा बनाई।

मानक AI बेंचमार्क को एक बहुविकल्पीय प्रश्न (multiple-choice quiz) की तरह समझें जहाँ AI को केवल सही अक्षर चुनना होता है। MAVEN-Bench एक लाइव-फायर बाधा दौड़ (obstacle course) की तरह है।

  • कोर्स: इसमें गणित और भौतिकी की कठिन समस्याएं शामिल हैं जिनमें कई चरणों की आवश्यकता होती है।
  • ट्विस्ट: समस्याओं को AI को चकमा देने के लिए डिज़ाइन किया गया है। इनमें "एडवर्सरियल" (adversarial) तत्व शामिल हैं, जैसे शून्य के बहुत करीब वाली संख्याएं (जो कैलकुलेटर को खराब कर सकती हैं) या भ्रमित करने वाले निर्देश।
  • नियम: AI को केवल अंतिम उत्तर के लिए ग्रेड नहीं दिया जाता है। उसे इस आधार पर ग्रेड दिया जाता है कि वह वहां कैसे पहुँचा। क्या उसने अपने काम की जाँच की? क्या उसने सही उपकरणों का उपयोग किया? क्या उसने अपने चरणों का रिकॉर्ड रखा?

परिणाम: छोटा दिमाग, बड़ा सुधार

शोधकर्ताओं ने एक मानक, ओपन-सोर्स AI मॉडल (GPT-OSS-120b) का उपयोग करके MAVEN का परीक्षण किया।

  • MAVEN के बिना: AI लगभग 48% बार सही उत्तर देता था। वह अक्सर समस्या के बीच में ही रास्ता भटक जाता था।
  • MAVEN के साथ: सटीकता बढ़कर 71% हो गई।

उपमा: कल्पना कीजिए कि एक छात्र कठिन गणित की परीक्षा दे रहा है। बिना ट्यूटर के, वह 48% अंक लाता है। ट्यूटर (MAVEN) के साथ, जो उसे हर चरण को लिखने, अपनी गणना की जाँच करने और सही फॉर्मूला का उपयोग करने के लिए मजबूर करता है, वह 71% तक पहुँच जाता है।

लागत: शोधकर्ताओं ने नोट किया कि इस सुधार के लिए किसी अत्यधिक महंगे, विशाल AI मॉडल की आवश्यकता नहीं थी। उन्होंने एक छोटे, ओपन-सोर्स मॉडल का उपयोग किया और बहुत बड़े, प्रोप्राइटरी (पेड) मॉडलों के प्रतिस्पर्धी परिणाम प्राप्त किए, लेकिन लगभग 1/10 लागत पर।

यह क्यों महत्वपूर्ण है

पेपर निष्कर्ष निकालता है कि AI को परखने का वर्तमान तरीका त्रुटिपूर्ण है। हम अक्सर केवल अंतिम उत्तर देखते हैं। यदि AI भाग्य या अनुमान से सही उत्तर प्राप्त कर लेता है, तो हम समझते हैं कि वह स्मार्ट है।

MAVEN दिखाता है कि यदि हम AI को प्रोसेस-अवेयर (process-aware) बनाने के लिए मजबूर करते हैं—यानी अपने काम की जाँच करना, अपने चरणों को याद रखना और अपने उपकरणों को सत्यापित करना—तो वह बहुत अधिक विश्वसनीय हो जाता है। यह AI को कच्चे ज्ञान के मामले में "अधिक स्मार्ट" बनाने के बारे में नहीं है; यह उसे जो पता है उसका उपयोग करने के लिए एक बेहतर सिस्टम देने के बारे में है ताकि वह विफल न हो।

संक्षेप में: MAVEN एक "सुरक्षा हार्नेस" (safety harness) है जो AI सहायकों को तब गिरने से रोकता है जब वे एक लंबे, जटिल पहाड़ पर चढ़ने की कोशिश करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →