← أحدث الأبحاث
💬 NLP

The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

تقدم الورقة البحثية Toolathlon، وهو معيار شامل يضم 32 تطبيقاً متنوعاً و108 مهام واقعية طويلة المدى ذات تنفيذ قابل للتحقق، صُمم لتقييم وكشف القصور الكبير في الوكلاء اللغويين الحاليين ذوي الحالة الراهنة في سير عمل الخطوات المتعددة المعقدة والواقعية.

المؤلفون الأصليون: Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xin
نُشر 2026-02-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xingyao Wang, Xiang Yue, Shuyan Zhou, Graham Neubig, Junxian He

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف مساعداً شخصياً جديداً. في الماضي، ربما كنت تختبرهم بأسئلة بسيطة مثل: "كيف حال الطقس؟" أو "اكتب رسالة بريد إلكتروني قصيرة لوالدتي". إذا أجابوا بشكل صحيح، كنت تعتقد: "رائع، إنهم مستعدون للعالم الحقيقي!".

لكن العالم الحقيقي ليس بسيطاً؛ إنه فوضوي، ومعقد، ويتطلب إدارة أشياء كث many مختلفة في وقت واحد.

تقدم هذه الورقة البحثية "ديكاثلون الأدوات" (TOOLATHLON)، وهو اختبار جديد وأكثر صعوبة لمساعدي الذكاء الاصطناعي (الذين يُطلق عليهم "الوكلاء اللغويون" - Language Agents) ليرى ما إذا كانوا مستعدين حقاً للوظائف الواقعية.

إليك تفصيل لما قاموا به، باستخدام بعض التشبيهات من الحياة اليومية:

1. الاختبارات القديمة مقابل العالم الحقيقي

الطريقة القديمة: كانت الاختبارات السابقة تشبه ألعاب الفيديو. حيث يُعطى الذكاء الاصطناعي عالماً وهمياً ومبسطاً يعمل فيه كل شيء بشكل مثالي. إذا كان على الذكاء الاصطناعي "إرسال بريد إلكتروني"، فإن الاختبار يتحقق فقط مما إذا كان قد كتب الكلمات الصحيحة. لم يكن يرسل البريد فعلياً، وكان "صندوق الوارد" فارغاً ونظيفاً.
الطريقة الجديدة (TOOLATHLON): هذا يشبه فترة تدريب عملي في الواقع. يتم إلقاء الذكاء الاصطناعي في مكتب حقيقي وفوضوي.

  • صندوق الوارد ليس فارغاً؛ بل يحتوي على 50 رسالة بريد إلكتروني، بعضها رسائل مزعمة (Spam) وبعضها واجبات مدرسية عاجلة.
  • التقويم مليء بالاجتماعات.
  • الكمبيوتر يحتوي على ملفات حقيقية، بعضها تالف أو مفقود.
  • يجب على الذكاء الاصطناعي استخدام 32 تطبيقاً برمجياً مختلفاً وحقيقياً (مثل Google Calendar، وNotion، وقاعدة بيانات حقيقية، وحتى متجر إلكتروني وهمي) لإنجاز المهمة.

2. "مضمار العقبات" (الديكاثلون)

اسم "ديكاثلون" يأتي من رياضة الأولمبياد حيث يتعين على الرياضيين الجري، والقفز، والرمي، والسباحة. إنها ليست مجرد مهارة واحدة، بل هي مزيج من كل شيء.

TOOLATHLON هو مضمار عقبات للذكاء الاصطناعي يحتوي على 108 مهام مختلفة.

  • مثال للمهمة 1: "تحقق من بريدي الإلكتروني بحثاً عن تسليمات الواجبات المنزلية، وقم بتنزيل الكود، وشغله على جهازي لأرى ما إذا كان سيتعطل، وإذا كان يعمل، امنح الطالب درجة 10/10 على موقع التصحيح. إذا تعطل، امنحه درجة 0."
    • لماذا هي صعبة: يجب على الذكاء الاصطناعي قراءة بريد إلكتروني، وحفظ ملف، وكتابة أوامر في واجهة التحكم (Terminal)، والتحقق من الأخطاء، ثم تسجيل الدخول إلى موقع التصحيح. إذا أخطأ في أي خطوة، سيفشل في المهمة بأكملها.
  • مثال للمهمة 2: "انظر إلى قاعدة بيانات دعم العملاء لدينا. إذا كانت هناك تذكرة (Ticket) تنتظر لفترة طويلة، اقرأ الدليل لمعرفة ما يجب فعله، ثم أرسل بريد اعتذار للعميل وتذكيراً للمدير."
    • لماذا هي صعبة: يجب على الذكاء الاصطناعي العثور على البيانات الصحيحة، وقراءة دليل بصيغة PDF (والذي قد يكون مربكاً)، ثم كتابة بريدين إلكترونيين مختلفين بالنبرة المناسبة.

3. التعليمات "الغامضة"

في الحياة الواقعية، لا يعطي الرؤساء تعليمات مثالية وخطوة بخطوة. يقولون أشياء مثل: "مهلاً، هل يمكنك تولي أمر تصحيح الواجبات؟" دون إخبارك بكيفية القيام بذلك بالضبط.

TOOLATHLON يحاكي هذا. التعليمات غامضة و"غير دقيقة".

  • الاختبار القديم: "الخطوة 1: افتح البريد الإلكتروني. الخطوة 2: حمل المرفق. الخطوة 3: شغل الكود."
  • TOOLATHLON: "صحح الواجبات المنزلية."
    يجب على الذكاء الاصطناعي أن يستنتج كيفية القيام بذلك بمفرده. يجب عليه فحص البيئة (الملفات، رسائل البريد الإلكتروني) والاستنتاج لما يجب فعله، تماماً كما يفعل البشر.

4. النتائج: الذكاء الاصطناعي لا يزال مبتدئاً

اختبر الباحثون أذكى نماذج الذكاء الاصطناعي في العالم (مثل Claude وGPT-5 وDeepSeek) في هذا المضمار الصعب الجديد.

بطاقة النتائج:

  • أفضل ذكاء اصطناعي (Claude-4.5-Sonnet): نجح في حوالي 39% من المهام.
  • الذكاء الاصطناعي مفتوح المصدر (DeepSeek): نجح في حوالي 20% من المهام.

ماذا يعني هذا؟
حتى "أذكى" أنظمة الذكاء الاصطناعي تفشل في أكثر من 60% من المهام التي يمكن لمتدرب بشري كفء أن يفهمها ويقوم بها.

لماذا يفشلون؟

  1. الضياع في الضجيج: عندما يتعين على الذكاء الاصطناعي النظر في قائمة ضخمة من الملفات أو سلسلة رسائل بريد إلكتروني طويلة، فإنه يصاب بالارتباك وينسى ما كان يفعله.
  2. الخلط بين الأدوات: يحاول استخدام الأداة الخاطئة (مثل محاولة استخدام مطرقة لربط مسمار براغي) أو يستدعي أداة غير موجودة.
  3. الاستسلام المبكر: بعض المهام تستغرق وقتاً طويلاً (مثل فحص 100 ملف). يتعب الذكاء الاصطناعي، ويعتقد أنه انتهى، ثم يتوقف قبل إتمام المهمة.

5. لماذا هذا مهم؟

فكر في TOOLATHLON كـ "اختبار واقع".

لفترة طويلة، اعتقدنا أن الذكاء الاصطناعي جاهز تقريباً لتولي وظائفنا. تقول هذه الورقة البحثية: "ليس تماماً بعد". إنها توضح لنا بالضبط أين تكمن نقاط ضعف الذكاء الاصطناعي. المسألة ليست في أن الذكاء الاصطناعي لا يستطيع فهم اللغة؛ بل في أنه لا يستطيع التعامل مع الواقع الفوضوي، طويل الخطوات، والمتعدد المهام للعمل مع البرمجيات الحقيقية.

من خلال بناء هذا الاختبار الصعب، يأمل الباحثون في دفع مطوري الذكاء الاصطناعي لبناء مساعدين أكثر ذكاءً ومتانة، يمكنهم حقاً التعامل مع فوضى العالم الحقيقي، بدلاً من مجرد اجتياز اختبارات بسيطة تشبه ألعاب الفيديو.

باختصار: TOOLATHLON هو "الامتحان النهائي" لمساعدي الذكاء الاصطناعي، وفي الوقت الحالي، معظمهم يرسبون. لكننا الآن نعرف بالضبط ما الذي يحتاجون إلى دراسته للنجاح.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →