← أحدث الأبحاث
💻 computer science

How Benchmarks Mis-Score Computer-Use Agents

تنقد هذه الورقة موثوقية معايير قياس وكلاء استخدام الحاسوب الحالية من خلال تحديد العيوب المنهجية في بناء المهام، والملاحظة، والتسجيل التي تؤدي إلى أحكام فشل خاطئة، وتقترح إطاراً تشخيصياً وقواعد تصميم لتحسين دقة التقييم.

المؤلفون الأصليون: Zihan Dong, Zhiyuan Ma, Zekun Wang, Yunqing Li, Zirou Liu, Ruixuan Deng, Qishi Zhan, Rui Qian

نُشر 2026-07-31
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zihan Dong, Zhiyuan Ma, Zekun Wang, Yunqing Li, Zirou Liu, Ruixuan Deng, Qishi Zhan, Rui Qian

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تشاهد مسابقة طبخ عالية المخاطر على التلفاز. من المفترض أن يقوم الحكام بتذوق الأطباق لتحديد الفائز. ولكن ماذا لو كان الحكام يستخدمون اختبار تذوق معطلاً؟ ماذا لو كانت الوصفة التي يتبعونها مكتوبة بحبر يختفي، أو أن الفرن الذي يستخدمونه هو في الواقع لعبة لا تسخن؟ في عالم الذكاء الاصطناعي، وتحديداً "وكلاء استخدام الكمبيوتر" (البوتات الذكية التي يمكنها النقر، والكتابة، وتصفح الويب تماماً مثل البشر)، نواجه مشكلة مماثلة. يتم اختبار هذه البوتات لمعرفة ما إذا كانت قادرة على أداء وظائف حقيقية، مثل تقديم الإقرارات الضريبية أو حجز الرحلات الجوية. ومع ذلك، فإن "بطاقات تسجيل الدرجات" التي نستخدمها لتقييمهم غالباً ما تكون معيبة. فقد تعطي درجة رسوب لبوت قام بعمل رائع بالفعل، أو قد تغفل عن حقيقة أن البوت فشل لأن الاختبار نفسه كان معطلاً. هذه الورقة البحثية تشبه قصة بوليسية حيث يحقق المؤلفون في سبب قيام بطاقات التسجيل هذه بتضليلنا.

الورقة التي تحمل عنوان "كيف تخطئ المعايير المرجعية في تقييم وكلاء استخدام الكمبيوتر"، تجادل بأن الطريقة التي نختبر بها هذه البوتات حالياً معيبة للغاية. وجد المؤلفون أنه عندما يحصل البوت على نتيجة "فشل" (FAIL)، فهناك احتمال كبير ومفاجئ بأن النتيجة خاطئة في الواقع. وفي تحقيقهم في 150 حالة محددة حيث تم تصنيف البوتات كفاشلة، اكتشفوا أن 15.3% من أحكام "الفشل" تلك كانت أخطاءً.

إليك كيف حدثت هذه الأخطاء:

  • القاضي كان شديد التدقيق (10.7%): في بعض الأحيان فعل البوت الشيء الصحيح، لكن الفاحص الآلي كان جامداً للغاية. كان الأمر يشبه إخفاق قاضٍ لشيف لأنه استخدم سكيناً مختلفاً قليلاً عن السكين المذكور في بطاقة الوصفة، رغم أن الطعام كان مذاقه مثالياً.
  • الاختبار كان معطلاً (4.7%): في بعض الأحيان لم يستطع البوت إنهاء المهمة لأن بيئة الاختبار كانت معطلة. كان الأمر يشبه مطالبة شيف بخبز كعكة في فرن لا يعمل. لقد فشل البوت، ولكن ليس لأنه سيء في الطبخ؛ بل لأن المطبخ كان معطلاً.

نظر المؤلفون أيضاً إلى البوتات التي فشلت بالفعل. ووجدوا أن الأسباب الرئيسية لم تكن عادةً بسبب نقر البوت على الزر الخطأ (وهو ما يشبه اليد الخرقاء). بدلاً من ذلك، فشلت البوتات في الغالب لأنها علقت في حلقة مفرغة من التخطيط السيئ أو لأنها لم تدرك أن أفعالها لا تؤتي ثمارها (مثل الشيف الذي يستمر في تحريك قدر فارغ بالفعل).

تقترح الورقة أننا لا يمكننا فقط النظر إلى رقم واحد، مثل "معدل النجاح"، لنعرف ما إذا كان الذكاء الاصطناعي جيداً أم لا. هذا الرقم يخفي الكثير من الأسرار. بدلاً من ذلك، نحن بحاجة إلى بناء اختبارات أصعب في الكسر، واستخدام حكام أكثر ذكاءً يفهمون طرقاً مختلفة لحل المشكلات، وتوفير تسجيلات فيديو كاملة للاختبارات حتى نتمكن من رؤية أين سارت الأمور بشكل خاطئ بالضبط. الهدف هو التوقف عن إعطاء البوتات درجة رسوب لأشياء ليست خطأها، ومساعدتنا على فهم ما يحتاجون لتعلمه حقاً ليصبحوا مساعدين مفيدين حقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →