AutomationBench
تقدم الورقة البحثية AutomationBench، وهو معيار مرجعي جديد وتحدٍ يقيّم قدرة وكلاء الذكاء الاصطناعي على تنسيق سير عمل معقد وعابر للتطبيقات عبر واجهات برمجة تطبيقات REST من خلال الاكتشاف الذاتي لنقاط النهاية والالتزام بسياسات العمل، مما يكشف عن معاناة النماذج الرائدة الحالية بشكل كبير مع هذه المتطلبات التجارية الواقعية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك وظفت مساعداً آلياً فائق الذكاء لإدارة عملك التجاري الصغير. قلت له: "يرجى تنظيم جدول فريق المبيعات لدينا، وتحديث قائمة العملاء، وإرسال رسالة شكر لأكبر عملائنا".
في عالم مثالي، سيعرف الروبوت فوراً أي برنامج حاسوبي يفتحه، وأي زر ينقر عليه، وكيف ينقل البيانات من مكان إلى آخر. لكن في الواقع، الذكاء الاصطناعي اليوم يشبه طالباً عبقرياً قرأ كل الكتب في المكتبة، لكن لم يُسمح له قط بلمس الكتب أو فتح الأبواب. هو يعرف ماذا يجب أن يفعل، لكنه يتوه وهو يحاول اكتشاف كيفية القيام بذلك عبر الأنظمة المختلفة.
AutomationBench هو اختبار جديد وصعب للغاية، صُمم ليرى ما إذا كان بإمكان الوكلاء الذكيين (AI Agents) إنجاز المهمة فعلياً في العالم الحقيقي. إليك شرح مبسط لما يدور حوله هذا البحث:
1. المشكلة: "برج بابل" للأعمال
تستخدم الشركات مزيجاً فوضوياً من الأدوات: نظام إدارة علاقات العملاء (CRM) للمبيعات، وGmail للبريد الإلكتروني، وSlack للدردشة، وGoogle Calendar للاجتماعات، وجداول بيانات للتمويل.
- الاختبارات القديمة: كانت اختبارات الذكاء الاصطناعي السابقة تشبه طلب "ابحث عن صورة قطة على موقع إلكتروني" أو "انقر على هذا الزر". كانت بسيطة للغاية أو تركز على تطبيق واحد فقط في كل مرة.
- التحدي الحقيقي: مهمة العمل الحقيقية تشبه سباق التتابع حيث تتغير العصا خمس مرات. يجب على الذكاء الاصطناعي الانتقال من التقويم إلى البريد الإلكتروني، ثم إلى جدول البيانات، وأخيراً إلى تطبيق الدردشة، كل ذلك مع اتباع قواعد صارمة للشركة.
2. الحل: "مضمار عقبات رقمي"
قام المؤلفون (من شركة Zapier) ببناء عالم محاكى يعمل كـ مضمار عقبات رقمي.
- الخريطة مخفية: لا يتم إعطاء الذكاء الاصطناعي خريطة. عليه أن يتجول في "المدينة الرقمية" (واجهات برمجة التطبيقات - APIs) ويكتشف أي باب يؤدي إلى "مكتب المبيعات" وأي باب يؤدي إلى "خزنة المالية".
- الضجيج: المضمار مليء بالمشتتات. هناك سجلات وهمية، وعلامات مضللة، وبيانات غير ذات صلة. الأمر يشبه المشي في سوق مزدحم حيث يصرخ شخص ما بتعليمات خاطئة.
- القواعد: يجب على الذك الذكاء الاصطناعي اتباع "كتيب القواعد" (سياسة العمل) التي قد تنص على: "تجاهل بريد المدير التنفيذي إذا لم يكن يحتوي على موضوع محدد".
3. التقييم: "هل تم خبز الكعكة؟"
هذا هو الجزء الأهم. في العديد من اختبارات الذكاء الاصطناعي، يحصل الذكاء الاصطناعي على نقاط لكتابة مقال لطيف حول كيف كان سيخبز الكعكة.
- AutomationBench لا يهتم بالمقال. هو يتحقق فقط من المطبخ في النهاية.
- هل ظهرت الكعكة بالفعل في الفرن؟ هل كانت بالنكهة الصحيحة؟ هل تم قياس السكر بدقة؟
- إذا اتخذ الذكاء الاصطناعي مساراً غريباً، وارتكب 50 خطأً، لكنه أصلحها جميعاً في النهاية، فإنه يحصل على الدرجة كاملة. أما إذا كتب خطة مثالية لكنه نسي وضع الدقيق في الوعاء، فإنه يحصل على صفر.
4. النتائج: واقع "العبقرية والخرق"
اختبر هذا البحث أقوى نماذج الذكاء الاصطناعي في العالم (مثل "العقول الفائقة" لعام 2026) في مضمار العقبات هذا.
- النتيجة: حتى أفضل النماذج سجلت أقل من 10%.
- التشبيه: تخيل أنك أعطيت مجموعة من طلاب الدكتوراه لغزاً معقداً. لقد قرأوا التعليمات بشكل مثالي، ولكن عندما حاولوا حله، استمروا في إسقاط القطع، أو الخلط بين الألوان، أو نسيان الصندوق الذي تنتمي إليه القطع.
- لماذا فشلوا:
- الثقة الزائفة: غالباً ما يقولون "تم!" بينما لم ينهوا المهمة فعلياً.
- الاستسلام: عندما لا يجدون قطعة من البيانات فوراً، يفترضون أنها غير موجودة بدلاً من البحث بعمق أكبر.
- تخطي الخطوات: قاموا بمعالجة 10 رسائل إلكترونية لكنهم نسوا التحقق من الرسالة الحادية عشرة.
5. لماذا هذا مهم؟
هذا المعيار هو بمثابة "واقع صادم". فهو يوضح لنا أنه بينما يتحسن الذكاء الاصطناعي في التحدث والتفكير، إلا أنه لا يزال سيئاً جداً في القيام بالمهام المعقدة متعددة الخطوات عبر برامج حاسوبية مختلفة.
الخلاصة:
نحن حالياً في "مرحلة الطفولة" لأتمتة الذكاء الاصطناعي. يمكنهم قول "مرحباً" و"من فضلك"، لكن لا يمكن الوثوق بهم بعد لإدارة عمل تجاري كامل دون إشراف مستمر. AutomationBench هو ساحة التدريب المصممة لدفع هؤلاء "الأطفال الرقميين" ليصبحوا موظفين موثوقين.
باختصار: لقد صنع هذا البحث لعبة فيديو صعبة جداً ليلعبها الذكاء الاصطناعي. ولاعبو الذكاء الاصطناعي يخسرون حالياً معظم المستويات، مما يثبت أنه لا تزال هناك فجوة كبيرة بين "روبوتات الدردشة الذكية" و"العمال المستقلين".
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.