Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
يُعد Harness-Bench معياراً تشخيصياً يتألف من 106 مهمة واقعية ومعزولة، يعمل على تقييم كيفية تأثير تكوينات طبقة النظام المختلفة (الحواجز/البيئات التنفيذية) على أداء وكلاء النماذج اللغوية الكبيرة، كاشفاً أن نتائج التنفيذ تتباين بشكل كبير عبر الاقتران بين النموذج والحاجز، ومسلطاً الضوء على الحاجة إلى الإبلاغ عن قدرات الوكيل على مستوى التكوين بدلاً من نسبها حصرياً إلى النموذج الأساسي.