ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox
यह शोध पत्र ComplexMCP को प्रस्तुत करता है, जो मॉडल कॉन्टेक्स्ट प्रोटोकॉल (Model Context Protocol) पर आधारित एक कठोर बेंचमार्क है जिसमें 300 से अधिक परस्पर निर्भर उपकरण और गतिशील पर्यावरणीय सिमुलेशन शामिल हैं, जो यह प्रकट करता है कि वर्तमान LLM एजेंट जटिल वर्कफ़्लो में मनुष्यों की तुलना में काफी कम प्रदर्शन करते हैं क्योंकि वे टूल रिट्रीवल सैचुरेशन (tool retrieval saturation), अति-आत्मविश्वास और रणनीतिक पराजयवाद (strategic defeatism) जैसी बाधाओं का सामना करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सुशिक्षित रोबोटिक सहायक को काम करने के लिए नियुक्त कर रहे हैं जो एक जटिल व्यवसाय चलाने में आपकी मदद करेगा। आप उसे कार्यों की एक सूची देते हैं, जैसे "कुछ शेयर खरीदें, एक फ्लाइट बुक करें, और एक दोस्त को संदेश भेजें।"
अतीत में, शोधकर्ताओं ने इन रोबोटों का परीक्षण सरल, अलग-थलग कार्यों के साथ किया था, जैसे "2+2 की गणना करें" या "मौसम का पता लगाएं।" वे इसमें बेहतरीन थे। लेकिन वास्तविक दुनिया में, कार्य अव्यवस्थित होते हैं। वे एक-दूसरे पर निर्भर करते हैं (आप फ्लाइट बुक नहीं कर सकते जब तक कि आपको यह न पता हो कि यात्रा कौन कर रहा है), सिस्टम में गड़बड़ी आ सकती है (इंटरनेट धीमा हो सकता है), और काम करते समय वातावरण बदल जाता है (आपका दोस्त आपको ब्लॉक कर सकता है, या आपके शॉपिंग कार्ट में पहले से ही कुछ सामान हो सकता है)।
समस्या: "लास्ट माइल" गैप (अंतिम मील की दूरी का अंतर)
इस पेपर के लेखक, ComplexMCP, तर्क देते हैं कि जबकि हमारे AI एजेंट आसान चीजों में अच्छे हैं, वे "लास्ट माइल" में विफल हो जाते हैं—वास्तविक दुनिया का काम पूरा करने के अंतिम, कठिन चरणों में। वे एक ऐसे ड्राइवर की तरह हैं जो खाली मैदान में तो पूरी तरह से समानांतर पार्किंग (parallel park) कर सकता है, लेकिन व्यस्त शहर की सड़कों पर गड्ढों और अन्य कारों के बीच गाड़ी चलाते समय दुर्घटनाग्रस्त हो जाता है।
समाधान: AI के लिए एक "सिम्युलेटेड सिटी" (एक आभासी शहर)
यह परीक्षण करने के लिए कि ये रोबट अराजकता को कितनी अच्छी तरह संभालते हैं, टीम ने ComplexMCP बनाया। इसे एक साधारण क्विज़ के रूप में नहीं, बल्कि एक विशाल, सिम्युलेटेड वीडियो गेम शहर के रूप में समझें जिसमें 7 अलग-अलग जिले (जैसे सोशल मीडिया टाउन, स्टॉक मार्केट, एक ऑनलाइन स्टोर और एक ट्रैवल एजेंसी) हैं।
- टूल्स (उपकरण): इस शहर के भीतर, 300 से अधिक अलग-अलग "टूल्स" (बटन, लीवर और API) हैं जिनका उपयोग AI कर सकता है।
- अराजकता (Chaos): महत्वपूर्ण रूप से, ये टूल्स परस्पर जुड़े हुए हैं। आप केवल एक बटन नहीं दबा सकते; आपको पहले नेटवर्क ठीक करने की आवश्यकता हो सकती है, अपना बैलेंस चेक करना पड़ सकता है, या किसी उपयोगकर्ता की पहचान सत्यापित करनी पड़ सकती है, इससे पहले कि वह टूल काम भी करे।
- "सीड" (Seed) तंत्र: इस परीक्षण को निष्पक्ष लेकिन यथार्थवादी बनाने के लिए, वे एक "सीड" (जैसे कि रैंडम नंबर जनरेटर) का उपयोग करते हैं। यह सुनिश्चित करता है कि हर बार जब वे परीक्षण चलाते हैं, तो शहर थोड़ा अलग दिखता है (अलग उपयोगकर्ता, अलग कीमतें, अलग नेटवर्क गति), लेकिन नियम वही रहते हैं। यह AI को उत्तर रटने से रोकता है।
बड़ा परीक्षण: रोबोट बनाम इंसान
शोधकर्ताओं ने शीर्ष स्तर के AI मॉडल (जैसे GPT-5, Gemini, और Claude) को इस शहर में डाला और उन्हें 47 जटिल मिशन दिए। उन्होंने वास्तविक मनुष्यों को भी उन्हीं टूल्स का उपयोग करके वही कार्य करने के लिए कहा।
परिणाम: एक कठोर वास्तविकता का सामना
परिणाम आश्चर्यजनक और गंभीर थे:
- इंसानों ने लगभग 94% बार सफलता प्राप्त की।
- सर्वश्रेष्ठ AI (Gemini-3-Flash) केवल लगभग 55% बार सफल हुआ।
- यहाँ तक कि सबसे उन्नत मॉडल भी 60% सफलता दर पार करने के लिए संघर्ष करते रहे।
रोबोट क्यों विफल होते हैं?
पेपर पहचानता है कि ये स्मार्ट एजेंट वास्तविक दुनिया में क्यों लड़खड़ाते हैं:
- "टूल ओवरलोड" (रिट्रीवल सैचुरेशन): कल्पना कीजिए कि एक लाइब्रेरियन है जिसे 3,00,000 किताबों वाली लाइब्रेरी में एक विशिष्ट किताब ढूंढनी है। यदि आप उन्हें बिना कैटलॉग दिए किताब खोजने के लिए कहते हैं, तो वे अभिभूत हो जाते हैं। इसी तरह, जब AI को सैकड़ों टूल्स में से चुनने के लिए कहा जाता है, तो वह अक्सर सही टूल को भूल जाता है या विकल्पों की भारी मात्रा से भ्रमित हो जाता है।
- "क्लीन स्लेट" बायस (अत्यधिक आत्मविश्वास): यह सबसे आम गलती है। AI मान लेता है कि दुनिया खाली और नई है, जैसे कि एक नया गेम लेवल। वास्तव में, "शॉपिंग कार्ट" में पहले से ही सामान हो सकता है, या "नेटवर्क" टूटा हुआ हो सकता है। AI वर्तमान स्थिति की जांच करने के बजाय सीधे कार्य करने की कोशिश करता है, जिससे त्रुटियां होती हैं (जैसे कि वह चीज़ खरीदना जो आपके पास पहले से ही है)। यह एक भरे हुए सूटकेस में जगह की जांच किए बिना उसमें नया सामान डालने की कोशिश करने जैसा है।
- रणनीतिक पराजय (Strategic Defeatism): जब AI को एक छोटी सी त्रुटि मिलती है (जैसे अस्थायी नेटवर्क ग्लिच), तो समस्या को ठीक करने (जैसे "नेटवर्क एक्सेलेरेटर" टूल को कॉल करना) के बजाय, वह अक्सर हार मान लेता है। वह अपनी शानदार भाषाई क्षमताओं का उपयोग समस्या को हल करने के लिए एक अलग रास्ता खोजने के बजाय, विनम्रता से यह कहने के लिए करता है कि "मैं यह नहीं कर सकता।" यह एक ऐसे ड्राइवर की तरह है जो गड्ढा देखते ही कार को घुमाने के बजाय तुरंत गाड़ी मोड़ लेता है।
"रिट्रीवल" (RAG) के बारे में क्या?
शोधकर्ताओं ने यह भी परीक्षण किया कि क्या AI को सही टूल्स खोजने के लिए एक "सर्च इंजन" देना (सभी 300 टूल्स एक साथ दिखाने के बजाय) मदद करेगा। हालांकि इसने मेमोरी बचाई, लेकिन इसने वास्तव में AI को इन जटिल कार्यों में और भी खराब बना दिया। क्यों? क्योंकि सर्च इंजन अगले चरण के लिए आवश्यक "छिपे हुए" टूल्स को नहीं खोज सका। यह एक लाइब्रेरियन से "खाना पकाने के बारे में किताबें" मांगने जैसा है, लेकिन जिस किताब की आपको वास्तव में आवश्यकता है उसका शीर्षक "केक कैसे बेक करें" है, और लाइब्रेरियन ने यह सुझाव नहीं दिया क्योंकि संबंध स्पष्ट नहीं था।
निष्कर्ष
पेपर निष्कर्ष निकालता है कि हालांकि AI स्मार्ट हो रहा है, लेकिन यह अभी भी जटिल, अव्यवस्थित वास्तविक दुनिया के वातावरण में एक पूर्ण स्वायत्त कार्यकर्ता होने के लिए तैयार नहीं है। इसमें दुनिया की वर्तमान स्थिति को समझने, छोटी गलतियों से उबरने और जटिल निर्भरताओं की श्रृंखलाओं को नेविगेट करने की क्षमता की कमी है। ComplexMCP अब AI के लिए एक नया "ड्राइविंग टेस्ट" है, जिसे इसकी कमजोरियों को खोजने के लिए डिज़ाइन किया गया है ताकि अगली पीढ़ी के रोबोट शहर के माध्यम से बिना दुर्घटनाग्रस्त हुए गाड़ी चलाना सीख सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।