← أحدث الأبحاث
🤖 AI

Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows

يُعد Harness-Bench معياراً تشخيصياً يتألف من 106 مهمة واقعية ومعزولة، يعمل على تقييم كيفية تأثير تكوينات طبقة النظام المختلفة (الحواجز/البيئات التنفيذية) على أداء وكلاء النماذج اللغوية الكبيرة، كاشفاً أن نتائج التنفيذ تتباين بشكل كبير عبر الاقتران بين النموذج والحاجز، ومسلطاً الضوء على الحاجة إلى الإبلاغ عن قدرات الوكيل على مستوى التكوين بدلاً من نسبها حصرياً إلى النموذج الأساسي.

المؤلفون الأصليون: Yilun Yao, Xinyu Tan, Chao-Hsuan Liu, Yaoming Li, Zhengyang Wang, Wenhan Yu, Zhewen Tan, Yuxuan Tian, Guangxiang Zhao, Lin Sun, Xiangzheng Zhang, Tong Yang

نُشر 2026-05-28
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yilun Yao, Xinyu Tan, Chao-Hsuan Liu, Yaoming Li, Zhengyang Wang, Wenhan Yu, Zhewen Tan, Yuxuan Tian, Guangxiang Zhao, Lin Sun, Xiangzheng Zhang, Tong Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طباخاً بارعاً وعالمياً (النموذج الذكي - AI Model). هذا الطباخ يمكنه طبخ أي شيء إذا أعطيته التعليمات الصحيحة. ولكن في العالم الحقيقي، لا يقف الطباخ في فراغ؛ بل يعمل في مطبخ له أدوات محددة، ومجموعة من القواعد، ومدير يراجع الطلبات، ونظام للتعامل مع الأخطاء.

هذه الورقة البحثية، Harness-Bench، تدور حول اختبار نظام المطبخ هذا (الذي يسمى "المنصة" أو الـ harness)، وليس فقط الطباخ.

المشكلة: لقد كنا نتجاهل المطبخ

حتى الآن، عندما كان الناس يختبرون الوكلاء الذكيين (AI agents)، كانوا يسألون غالباً: "ما مدى جودة الطباخ؟". كانوا ينظرون إلى الطبق النهائي (هل أنهى الذكاء الاصطعي المهمة؟) لكنهم تجاهلوا كيفية إعداد المطبخ.

  • هل امتلك الطباخ السكاكين المناسبة (الأدوات)؟
  • هل عرف الطباخ كيف يتعامل مع مقلاة محترقة (التعافي من الخطأ)؟
  • هل منع مدير المطبخ (النظام) الطباخ من استخدام مكونات خاطئة (الصلاحيات)؟

يجادل المؤلفون بأنه لا يمكنك الحكم على قدرة الذكاء الاصطناعي بمجرد النظر إلى النموذج فقط. يجب أن تنظر إلى النموذج + نظام المطبخ معاً. فالطباخ العظيم في مطبخ فوضوي ومعطل سيفشل، بينما قد ينجح الطباخ الجيد في مطبخ مثالي ومنظم جيداً.

الحل: "محاكي مطبخ" للذكاء الاصطناعي

قام الباحثون ببناء Harness-Bench، وهو ميدان اختبار ضخم يحتوي على 106 تحدياً مختلفاً للطبخ (مهام). هذه ليست مجرد أسئلة بسيطة؛ بل هي وظائف معقدة مثل إصلاح الكود البرمجي، أو تحليل البيانات المالية، أو إدارة مشروع.

إليكم كيف اختبروه:

  1. نفس المكونات، مطابخ مختلفة: أخذوا نفس الـ 106 مهمة وأعطوها لنماذج ذكاء اصطناعي مختلفة.
  2. المتغير: أبقوا المهمة كما هي تماماً، لكنهم استبدلوا "نظام المطبخ" (المنصة/harness) في كل مرة. بعض المطابخ كانت تقنية متطورة وصارمة؛ والبعض الآخر كان فضفاضاً وبسيطاً.
  3. النتيجة: أجروا أكثر من 5,000 تجربة.

ما الذي وجدوه؟

كانت النتائج مفاجئة وواضحة: المطبخ يهم بقدر أهمية الطباخ تماماً.

  • اختلافات هائلة: عندما استخدموا نفس نموذج الذكاء الاصطناعي ولكن وضعوه في "مطابخ" مختلفة، تباين معدل النجاح بشكل كبير. أحد أنظمة المطبخ حقق معدل نجاح 76%، بينما حقق نظام آخر 52% فقط مع نفس النموذج تماماً.
  • المطبخ "الذكي" هو الفائز: لم تكن الأنظمة الأفضل أداءً هي تلك التي تمتلك أذكى نماذج ذكاء اصطناعي فحسب، بل كانت هي الأنظمة التي ساعدت الذكاء الاصطناعي على البقاء في المسار الصحيح، والتعافي من الأخطاء، واستخدام الأدوات بشكل صحيح.
  • مشكلة "الانحراف": وجد الباحثون أن الذكاء الاصطناعي غالباً ما يبدأ بخطة جيدة ثم "ينحرف عن المسار". قد يفكر منطقياً ولكنه ينسى حفظ الملف فعلياً، أو قد يتجاهل خطأً في الأداة ويستمر في المحاولة نفسها. أفضل "أنظمة المطابخ" كانت تلتقط هذه الانحرافات وتصلحها.

الخلاصة الكبرى

يخلص البحث إلى أننا بحاجة للتوقف عن قول "هذا النموذج الذكي جيد بنسبة 90%". بدلاً من ذلك، يجب أن نقول: "هذا النموذج الذكي جيد بنسبة 90% عند اقترانه بهذا النظام المحدد".

إذا كنت تريد بناء وكيل ذكاء اصطناعي موثوق، فلا يمكنك فقط اختيار أذكى عقل؛ بل يجب عليك بناء أفضل جسد وجهاز عصبي (المنصة/harness) ليتماشى معه. Harness-Bench هو الأداة التي ابتكروها لمساعدة المهندسين على قياس وتحسين ذلك الجسد.

باختاًختصار

فكر في الأمر كاختبار سيارة سباق. لا يمكنك فقط النظر إلى المحرك (نموذج الذكاء الاصطناعي) والقول إنه سريع. يجب عليك اختبار المحرك على مسارات مختلفة مع إطارات وسائقين مختلفين (المنصة/harness). Harness-Bench هو المضمار الجديد الذي يثبت أن سرعة السيارة تعتمد بشكل كبير على المضمار والإطارات، وليس فقط على المحرك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →