ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox
تقدم الورقة البحثية ComplexMCP، وهو معيار مرجعي صارم مبني على بروتوكول سياق النموذج (Model Context Protocol) يضم أكثر من 300 أداة مترابطة ومحاكاة بيئية ديناميكية، والذي يكشف أن وكلاء النماذج اللغوية الكبيرة الحاليين يقل أداؤهم بشكل كبير عن البشر في سير العمل المعقد بسبب اختناقات مثل تشبع استرجاع الأدوات، والثقة المفرطة، والهزيمة الاستراتيجية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك توظف مساعداً آلياً ذكياً جداً ومطلعاً لمساعدتك في إدارة عمل تجاري معقد. أنت تعطيه قائمة من المهام، مثل "اشترِ بعض الأسهم، واحجز رحلة طيران، وأرسل رسالة إلى صديق".
في الماضي، كان الباحثون يختبرون هذه الروبوتات عبر إعطائها مهام بسيطة ومعزولة، مثل "احسب 2+2" أو "ابحث عن حالة الطقس". وكانت الروبوتات بارعة في ذلك. لكن المهام في العالم الحقيقي فوضوية؛ فهي تعتمد على بعضها البعض (لا يمكنك حجز رحلة طيران قبل معرفة من سيسافر)، والأنظمة قد تتعطل (قد يتأخر الإنترنت)، والبيئة تتغير أثناء عملك (قد يكون صديقك قد حظرك، أو قد تحتوي عربة التسوق الخاصة بك بالفعل على عناصر).
المشكلة: فجوة "الميل الأخير"
يرى مؤلفو هذا البحث، ComplexMCP، أنه بينما تبرع وكلاء الذكاء الاصطناعي في المهام السهلة، فإنهم يفشلون في "الميل الأخير"—أي الخطوات النهائية الصعبة لإنجاز العمل الفعلي في العالم الحقيقي. إنهم يشبهون السائق الذي يمكنه ركن السيارة في مكان مخصص للركن ببراعة في ساحة فارغة، ولكنه يصطدم عندما يحاول التنقل في شارع مزدحم بالسيارات وبالحفر.
الحل: "مدينة محاكية" للذكاء الاصطناعي
لاختبار مدى قدرة الروبوتات على التعامل مع هذه الفوضى، قام الفريق ببناء ComplexMCP. فكر في هذا ليس كمجرد اختبار بسيط، بل كـ لعبة فيديو لمدينة ضخمة محاكية تضم 7 مناطق مختلفة (مثل مدينة لوسائل التواصل الاجتماعي، وسوق للأوراق المالية، ومتجر عبر الإنترنت، ووكالة سفر).
- الأدوات: داخل هذه المدينة، توجد أكثر من 300 "أداة" مختلفة (أزرار، روافع، وواجهات برمجة تطبيقات - APIs) يمكن للذكاء الاصطناعي استخدامها.
- الفوضى: والأهم من ذلك، أن هذه الأدوات مترابطة. لا يمكنك مجرد الضغط على زر؛ فقد تحتاج إلى إصلاح الشبكة أولاً، أو التحقق من رصيدك، أو التحقق من هوية المستخدم قبل أن تعمل الأداة.
- آلية "البذرة" (Seed): لجعل الاختبار عادلاً ولكن واقعياً، يستخدمون "بذرة" (مثل مولد الأرقام العشوائية). هذا يضمن أنه في كل مرة يشغلون فيها الاختبار، تبدو المدينة مختلفة قليلاً (مستخدمون مختلفون، أسعار مختلفة، سرعات شبكة مختلفة)، لكن القواعد تظل كما هي. هذا يمنع الذكاء الاصطناعي من مجرد حفظ الإجابات.
الاختبار الكبير: الروبوت مقابل الإنسان
وضع الباحثون نماذج ذكاء اصطناعي رفيعة المستوى (مثل GPT-5، وGemini، وClaude) في هذه المدينة وأعطوهم 4ت 47 مهمة معقدة. كما جعلوا بشرًا حقيقيين يقومون بنفس المهام باستخدام نفس الأدوات تماماً.
النتائج: مواجهة صريحة للواقع
كانت النتائج مفاجئة ومثيرة للقلق:
- البشر نجحوا بنسبة 94% تقريباً من المرات.
- أفضل ذكاء اصطناعي (Gemini-3-Flash) نجح بنسبة 55% تقريباً فقط.
- حتى النماذج الأكثر تقدماً واجهت صعوبة في تجاوز نسبة نجاح 60%.
لماذا تفشل الروبوتات؟
حدد البحث ثلاثة أسباب رئيسية تجعل هؤلاء الوكلاء الأذكياء يتعثرون في العالم الحقيقي:
- "الإفراط في الأدوات" (تشبع الاسترجاع): تخيل أمين مكتبة عليه العثور على كتاب محدد في مكتبة تضم 300,000 كتاب. إذا طلبت منه العثود إلى كتاب دون إعطائه فهرساً، فسيشعر بالارتباك. وبالمثل، عندما يتعين على الذكاء الاصطناعي الاختيار من بين مئات الأدوات، فإنه غالباً ما ينسى الأداة الصحيحة أو يرتبك بسبب الحجم الهائل للخيارات.
- تحيز "اللوحة النظيفة" (الثقة المفرطة): هذا هو الخطأ الأكثر شيوعاً. يفترض الذكاء الاصطناعي أن العالم فارغ وجديد، مثل مستوى جديد في لعبة. في الواقع، قد تحتوي "عربة التسوق" بالفعل على عناصر، أو قد تكون "الشبكة" معطلة. يتخطى الذكاء الاصطناعي مرحلة التحقق من الحالة الحالية ويحاول التصرف مباشرة، مما يؤدي إلى أخطاء (مثل محاولة شراء شيء تملكه بالفعل). إنه يشبه محاولة إضافة عنصر جديد إلى حقيبة سفر ممتلئة دون التحقق مما إذا كان هناك متسع.
- الهزيمة الاستراتيجية: عندما يصطدم الذكاء الاصطناعي بخطأ صغير (مثل خلل مؤقت في الشبكة)، فبدلاً من محاولة إصلاحه (مثل استخدام أداة "مسرع الشبكة")، فإنه غالباً ما يستسلم. يستخدم مهاراته اللغوية الراقية ليقول بأدب: "لا أستطيع فعل هذا"، بدلاً من محاولة اتباع مسار مختلف لحل المشكلة. إنه يشبه السائق الذي يرى حفرة في الطريق فيقرر فوراً العودة بالسيارة بدلاً من مجرد القيادة حولها.
ماذا عن "الاسترجاع" (RAG)؟
اختبر الباحثون أيضاً ما إذا كان إعطاء الذكاء الاصطناعي "محرك بحث" للعثور على الأداة المناسبة (بدلاً من عرض جميع الأدوات الـ 300 أمامه دفعة واحدة) سيساعده. وبينما وفر ذلك بعض الذاكرة، إلا أنه جعل الذكاء الاصطناعي أسوأ في هذه المهام المعقدة. لماذا؟ لأن محرك البحث لم يستطع العثون على الأدوات "الخفية" المطلوبة للخطوة التالية. إنه يشبه سؤال أمين مكتبة عن "كتب عن الطبخ"، لكن الكتاب الذي تحتاجه فعلياً بعنوان "كيفية خبز كعكة"، ولم يفكر أمين المكتبة في اقتراحه لأن الرابط لم يكن واضحاً.
الخلاصة
يخلص البحث إلى أنه بينما يزداد الذكاء الاصطناعي ذكاءً، إلا أنه لا يزال غير مستعد ليكون عاملاً مستقلاً بالكامل في بيئات العالم الحقيقي المعقدة والفوضوية. فهو يفتقر إلى القدرة على إدراك الحالة الحالية للعالم، والتعافي من الأخطاء الصغيرة، والتنقل عبر سلاسل الاعتماديات المعقدة. أصبح ComplexMCP الآن هو "اختبار القيادة" الجديد للذكاء الاصطناعي، المصمم لاكتشاف نقاط الضعف هذه حتى يتمكن الجيل القادم من الروبوتات من تعلم القيادة عبر المدينة دون الاصطدام.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.