LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries
यह शोध पत्र LiveMCP-101 प्रस्तुत करता है, जो 101 वास्तविक दुनिया के प्रश्नों का एक बेंचमार्क है जिसे एक समानांतर मूल्यांकन ढांचे के माध्यम से MCP-सक्षम एजेंटों का स्ट्रेस-टेस्ट करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि उन्नत (फ्रंटियर) LLMs भी जटिल बहु-चरणीय टूल ऑर्केस्ट्रेशन में संघर्ष करते हैं और भविष्य के सुधारों के मार्गदर्शन के लिए सात विशिष्ट विफलता मोड की पहचान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके पेपर LiveMCP-101 की व्याख्या दी गई है।
बड़ी तस्वीर: "लाइव" टेस्ट ड्राइव
कल्पना कीजिए कि आप एक नई सेल्फ-ड्राइविंग कार का परीक्षण कर रहे हैं। पिछले अधिकांश परीक्षण एक वीडियो गेम या बंद पार्किंग लॉट में किए गए थे जहाँ ट्रैफिक लाइट कभी नहीं बदलती और सड़क हमेशा खाली रहती है। कार उस रूट को याद कर सकती थी और एकदम परफेक्ट दिख सकती थी।
लेकिन वास्तविक दुनिया में, ट्रैफिक लाइट बदलती है, पैदल यात्री अचानक सामने आ जाते हैं, और सड़क की स्थितियाँ हर सेकंड बदलती रहती हैं।
यह पेपर LiveMCP-101 पेश करता है, जो AI एजेंटों के लिए एक वास्तविक दुनिया, लाइव ट्रैफिक टेस्ट की तरह है। AI को किसी टेक्स्टबुक से गणित का सवाल हल करने के लिए कहने के बजाय, शोधकर्ता इसे जटिल, बहु-चरणीय (multi-step) समस्याओं को हल करने के लिए डिजिटल उपकरणों के "स्विस आर्मी नाइफ" (swiss army knife) का उपयोग करने के लिए कहते हैं, जो AI के काम करते समय बदलती रहती हैं।
समस्या: "स्टैटिक मैप" बनाम "लाइव GPS"
- पुराना तरीका (Static Tools): कल्पना कीजिए कि एक AI एजेंट को शहर का एक छपा हुआ नक्शा दिया गया है। उसे पता है कि कॉफी शॉप कहाँ है क्योंकि नक्शे में ऐसा लिखा है। लेकिन अगर कॉफी शॉप कल ही कहीं और चली गई, तो AI खो जाएगा। वर्तमान के अधिकांश AI टूल्स इसी तरह काम करते हैं; वे निश्चित निर्देशों पर निर्भर रहते हैं।
- नया तरीका (MCP): यह पेपर Model Context Protocol (MCP) नामक चीज़ का उपयोग करता है। इसे एक लाइव GPS के रूप में समझें। AI के पास कोई पहले से छपा हुआ नक्शा नहीं है; उसे पूछना होगा, "अभी कौन से टूल्स उपलब्ध हैं?" और फिर यह समझना होगा कि उनका उपयोग कैसे किया जाए। समस्या यह है कि "लाइव GPS" का डेटा हर सेकंड बदलता है। AI के सोचने के दौरान फ्लाइट की कीमत बढ़ सकती है, या कोई न्यूज़ हेडलाइन बदल सकती है।
समाधान: "समानांतर दौड़" (The Parallel Race)
आप एक AI को ऐसे टेस्ट पर कैसे ग्रेड देंगे जहाँ उसके टेस्ट देते समय ही उत्तर बदल रहे हों?
शोधकर्ताओं ने एक Parallel Race सिस्टम बनाया है:
- रेफरेंस रनर (The Reference Runner): एक सुपर-स्मार्ट, मानव-निर्देशित रोबोट, AI के साथ ठीक उसी समय और ठीक उसी कार्य को पूरा करता है जिसका परीक्षण किया जा रहा है। यह उस विशेष क्षण के लिए "सही" उत्तर प्राप्त करने हेतु एक सख्त, पूर्व-अनुमोदित योजना का पालन करता है।
- टेस्ट रनर (The Test Runner): जिस AI का परीक्षण किया जा रहा है, वह खुद से योजना बनाने की कोशिश करता है।
- जज (The Judge): फिनिश लाइन पर, एक जज (एक अन्य AI) टेस्ट रनर के परिणाम की तुलना रेफरेंस रनर के परिणाम से करता है।
यह सुनिश्चित करता है कि AI को मौसम बदलने या स्टॉक की कीमत बढ़ने के लिए दंडित न किया जाए; उसे केवल तभी दंडित किया जाता है जब वह उन बदलावों को सही ढंग से नेविगेट करने में विफल रहता है।
परिणाम: "सबसे स्मार्ट" बच्चे भी संघर्ष कर रहे हैं
शोधकर्ताओं ने 18 अलग-अलग AI मॉडल्स का परीक्षण किया (GPT-5 जैसे बहुत स्मार्ट मॉडल्स सहित)।
- स्कोर: यहाँ तक कि सबसे अच्छे AI मॉडल्स भी केवल 58% कार्य सही कर पाए।
- उपमा: कल्पना कीजिए कि पीएचडी छात्रों के एक समूह को एक जटिल स्कैवेंजर हंट (scavenger hunt) में शामिल किया गया है जहाँ उन्हें 5 अलग-अलग लोगों को कॉल करना है, 3 अलग-अलग वेबसाइटों की जाँच करनी है, और एक रिपोर्ट लिखनी है, और यह सब करते हुए सुराग (clues) बदल रहे हैं। यहाँ तक कि सबसे स्मार्ट छात्र भी 40% से अधिक बार असफल रहे।
"सात महापाप" (विफलता के प्रकार - Failure Modes)
पेपर ने विश्लेषण किया कि AI क्यों विफल हुआ और सात सामान्य गलतियाँ पाईं, जिन्हें तीन मुख्य श्रेणियों में बांटा गया है:
1. प्लानिंग की विफलताएं (The "Lost Driver")
- मैप को अनदेखा करना: AI निर्देशों के एक हिस्से को पूरी तरह से मिस कर देता है (जैसे, "दूसरा सबसे लोकप्रिय वीडियो खोजें" लेकिन वह पहला वाला ढूंढ लेता है)।
- अति-आत्मविश्वास (Overconfidence): AI को लगता है कि वह अपनी मेमोरी से उत्तर जानता है और वह टूल्स का उपयोग करने से मना कर देता है, जिससे 'हैलुसिनेशन' (hallucinations - मनगढ़ंत बातें बनाना) होता है।
- बिना चले बात करना (Talking Without Walking): AI अपने "विचारों" में एक परफेक्ट योजना लिखता है लेकिन वास्तव में बटन क्लिक करके उसे निष्पादित (execute) नहीं करता।
- गलत टूल: AI सही टूल चुनता है लेकिन गलत टूल का उपयोग करता है (जैसे, "Search" टूल का उपयोग करना जब उसे "Calculator" की आवश्यकता थी)।
2. पैरामीटर त्रुटियां (The "Typo" Problem)
- सिंटैक्स एरर (Syntax Errors): AI टूल की भाषा ठीक से नहीं बोल पाता। वह "1" (एक शब्द) कहता है जबकि टूल को
1(एक नंबर) चाहिए। टूल तुरंत उसकी रिक्वेस्ट को रिजेक्ट कर देता है। - सिमेंटिक एरर (Semantic Errors): AI भाषा तो सही बोलता है लेकिन उसका अर्थ गलत समझ लेता है। वह "New York में मौसम" पूछता है जबकि उपयोगकर्ता का वास्तव में मतलब "New York City में मौसम" था, या वह ऐसी तारीख मांगता है जो मौजूद ही नहीं है।
3. आउटपुट हैंडलिंग (The "Last Mile" Problem)
- पार्सिंग एरर (Parsing Errors): टूल AI को सही डेटा (जैसे संख्याओं के साथ एक JSON फ़ाइल) देता है, लेकिन AI उसे सही ढंग से पढ़ नहीं पाता। वह औसत (average) गलत निकाल सकता है या किसी मुख्य संख्या को मिस कर सकता है, जिससे अंतिम रिपोर्ट खराब हो जाती है।
निष्कर्ष (The Takeaway)
पेपर निष्कर्ष निकालता है कि हालांकि AI टूल्स के साथ बात करने में बेहतर हो रहा है, लेकिन यह अभी भी जटिल, वास्तविक दुनिया के कामों के लिए पर्याप्त विश्वसनीय नहीं है जहाँ चीजें वास्तविक समय में बदलती रहती हैं।
- क्लोज्ड-सोर्स मॉडल्स (जैसे GPT-5) प्लानिंग में बेहतर हैं लेकिन डेटा को सही ढंग से पढ़ने के "लास्ट माइल" (last mile) में संघर्ष करते हैं।
- ओपन-सोर्स मॉडल्स अक्सर लूप (loops) में फंस जाते हैं, बिना कोई प्रगति किए समय और टोकन बर्बाद करते हैं।
संक्षेप में: हमने AI को टेस्ट करने के लिए एक बहुत ही सख्त, वास्तविक दुनिया का जिम (LiveMCP-101) बनाया है। परिणाम बताते हैं कि हमारे सबसे मजबूत AI एथलीट भी वर्तमान में तब लड़खड़ा रहे हैं जब उनसे एक लाइव, बदलते हुए मैप के साथ मैराथन दौड़ने को कहा जाता है। इससे पहले कि हम उन पर वास्तविक दुनिया में स्वायत्त (autonomously) रूप से काम करने के लिए भरोसा कर सकें, अभी एक लंबा रास्ता तय करना बाकी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।