← أحدث الأبحاث
🤖 AI

Computer Use at the Edge of the Statistical Precipice

تحدد هذه الورقة عيوباً جوهرية في تقييم وكلاء استخدام الحاسوب الحاليين ناتجة عن تصميم البيئة والمنهجية غير القائمين على أسس منهجية، وتقترح إطار عمل التصميم PRISM، ومعيار DigiWorld المرجعي، وطريقة تجميع إحصائي صارمة لوضع المتطلبات الأساسية لإجراء أبحاث ذات مغزى.

المؤلفون الأصليون: Pierluca D'Oro, Sneha Silwal, William Wong, Yuxuan Sun, Fanyi Xiao, Manchen Wang, Eric Gan, Allen Bolourchi, Joseph Tighe

نُشر 2026-05-12
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Pierluca D'Oro, Sneha Silwal, William Wong, Yuxuan Sun, Fanyi Xiao, Manchen Wang, Eric Gan, Allen Bolourchi, Joseph Tighe

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول توظيف موظف جديد لإدارة مكتب مزدحم. تريد أن تعرف ما إذا كان ذكياً وقادراً على التكيف حقاً، أم أنه مجرد شخص حفظ الإجابات من اختبار تجريبي محدد.

هذه الورقة البحثية، التي كتبها باحثون في شركة "ميتا" (Meta)، تجادل بأن الطريقة الحالية لاختبار "وكلاء استخدام الكمبيوتر" (Computer Use Agents) -وهي ذكاء اصطناعي يمكنه النقر على الأزرار، والكتابة، والتنقل بين التطبيقات مثل البشر- هي طريقة معطلة. الأمر يشبه توظيف شخص بناءً على اختبار يمكنه فيه ببساطة إلقاء نظرة خاطفة على نموذج الإجابة مسبقاً.

إليك تفصيل للمشكلة وحلها، باستخدام تشبيهات بسيطة.

المشكلة: فخ "ورقة الغش"

1. خدعة "إعادة التشغيل الأعمى"
اكتشف الباحثون خللاً صادماً في الاختبارات الحالية. لقد أخذوا نصاً برمجياً بسيطاً جداً للكمبيوتر (حجمه 1 ميجابايت فقط - أصغر من صورة واحدة) لا "ينظر" حتى إلى الشاشة. كان النص يقوم فقط بالنقر بشكل أعمى على نفس الأزرار بالضبط وبنفس الترتيب الذي استخدمه ذكاء اصطناعي فائق الذكاء لاجتياز اختبار سابق.

  • النتيجة: في الاختبارات الشهيرة الحالية، سجل هذا "النص البرمجي الأعمى" درجة أعلى من نماذج الذكاء الاصطناعي المتقدمة.
  • التشبيه: تخيل طالباً يؤدي اختباراً في الرياضيات. بدلاً من حل المسائل، قام فقط بحفظ تسلسل ضغطات الأزرار على الآلة الحاسبة التي نجحت في نسخة سابقة من الاختبار. إذا لم تتغير أسئلة الاختبار أبداً، سيحصل الطالب على 100% دون أن يعرف أي شيء عن الرياضيات. اختبارات التقييم الحالية تشبه هذه الاختبارات التي لا تتغير؛ فالذكاء الاصطناعي لا "يفكر"، بل يتذكر المسار فحسب.

2. خطأ "رمي العملة"
المشكلة الثانية هي كيفية حساب الباحثين للدرجات. فهم غالباً ما يعاملون كل محاولة اختبار كحدث مستقل تماماً، مثل رمي العملة المعدنية.

  • التشبيه: إذا طلبت من شخص التنقل في 10 تطبيقات مختلفة، وفشل 3 مرات، فإن المتوسط البسيط سيقول إن مستواه هو 70%. لكن إذا كانت حالات الفشل الثلاث قد حدثت جميعها في نفس التطبيق لأنه تطبيق مربك، فإن المتوسط البسيط يخفي حقيقة أن الشخص سيء جداً في ذلك التطبيق تحديداً. الأساليب الحالية تتجاهل هذه الأنماط، مما يجعل التصنيفات غير موثوقة.

الحل: PRISM و DigiWorld

لإصلاح ذلك، اقترح الفريق مجموعة جديدة من القواعد تسمى PRISM وبنوا بيئة اختبار جديدة تسمى DigiWorld.

PRISM: القواعد الخمس لاختبار عادل
اعتبر PRISM بمثابة "الدستور" لبناء اختبار عادل للذكاء الاصطناعي.

  1. التحقق ذو الامتياز (Privileged Verification): بدلاً من سؤال إنسان (أو ذكاء اصطناعي آخر) للنظر إلى لقطة شاشة وتخمين ما إذا كانت المهمة قد أُنجزت، يتحقق الاختبار من ذاكرة الكمبيوتر الداخلية مباشرة. الأمر يشبه التحقق من دفتر حسابات البنك للتأكد من تحويل الأموال، بدلاً من سؤال الصراف عما إذا كان يعتقد أنها حدثت.
  2. بيئات واقعية: يجب أن تستخدم الاختبارات تطبيقات حقيقية، وليس نسخاً مبسطة أو كرتونية. لا يمكنك اختبار سائق على مضمار سيارات لعبة وتتوقع منه التعامل مع طريق سريع حقيقي.
  3. تكوينات مدققة النزاهة: قبل بدء الاختبار، يتحقق النظام تلقائياً مما إذا كانت المهمة ممكنة بالفعل. فهو يضمن وجود "أموال" في "الحساب البنكي" لتحويلها، أو وجود "بريد إلكتروني" لإرساله. لا يُسمح بالمهام المعطلة.
  4. تنفيذ في بيئة معزولة (Sandboxed Execution): يجب أن يتم الاختبار في صندوق مغلق ومتحكم فيه. لا ينبغي أن يعتمد على الإنترنت المباشر، الذي يتغير كل يوم. إذا اعتمد الاختبار على موقع إلكتروني مباشر، فستتغير النتائج لمجرد أن الموقع قام بتحديث تصميمه.
  5. تعدد المتغيرات (Multifactorial Variability): هذا هو الجزء الأهم. يجب أن يغير الاختبار المتغيرات في كل مرة.
    • التشبيه: إذا اختبرت سائقاً في يوم مشمس فقط على طريق مستقيم، فلن تعرف ما إذا كان بإمكانه القيادة في المطر أو في طريق جبلي متعرج. يقوم DigiWorld بتغيير "الطقس" (الثيمات البصرية)، و"حركة المرور" (محتوى البيانات)، و"نقطة البداية" (حالة الشاشة) لكل محاولة. هذا يجبر الذكاء الاصطناعي على الرؤية والاستنتاج فعلياً، بدلاً من حفظ المسار.

DigiWorld: مضمار الاختبار الجديد
بنى الباحثون DigiWorld، وهو معيار تقييم يحتوي على 15 تطبيقاً للهواتف المحمولة واقعياً (مثل تطبيقات البنوك، التسوق، والسفر).

  • بفضل قاعدة "تعدد المتغيرات"، يمكنهم توليد أكثر من 3.2 مليون نسخة فريدة من كل مهمة.
  • النتيجة: عندما قاموا بتشغيل نص "إعادة التشغيل الأعمى" البرمجي على DigiWorld، فشل فشلاً ذريعاً (سجل 6.9% فقط). لم يستطع النص البرمجي حفظ 3.2 مليون مسار مختلف. أثبت هذا أن DigiWorld يختبر بالفعل ما إذا كان الذكاء الاصطناعي يمكنه التفكير، وليس فقط ما إذا كان يمكنه التذكر.

الطريقة الجديدة لحساب الدرجات

أخيراً، تقدم الورقة طريقة أفضل لحساب الدرجة النهائية. بدلاً من المتوسط البسيط، يستخدمون التمهيد الهرمي (Hierarchical Bootstrap).

  • التشبيه: تخيل أنك تحكم في مسابقة طبخ تضم 15 حكماً مختلفاً. إذا قمت فقط بمتوسط درجاتهم، فقد تفوتك حقيقة أن أحد الحكام هو "حَكَم صارم" والآخر هو "حَكَم متساهل".
  • تنظر الطريقة الجديدة إلى هيكل الاختبار: فهي تجمع الدرجات حسب التطبيق، ثم حسب السيناريو، ثم حسب الإعدادات المحددة. وهي تستخدم تقنية إحصائية (فترات درجة ويلسون) لإنشاء "نطاق ثقة" بدلاً من رقم واحد. هذا يخبرنا: "نحن متأكدون بنسبة 95% أن هذا الذكاء الاصطناعي يتراوح مستواه بين 40% و50%"، بدلاً من مجرد قول "إنه بنسبة 45% جيد".

الخلاصة

تخلص الورقة إلى أنه لا يمكننا الوثوق بتصنيفات الذكاء الاصطناعي الحالية لأن الاختبارات سهلة الغش للغاية، والرياضيات المستخدمة في التقييم بسيطة جداً. لمعرفة ما إذا كان الذكاء الاصطناعي جاهزاً حقاً للعالم الواقعي، نحتاج إلى DigiWorld (اختبار يتغير باستمرار بحيث يفشل الحفظ) و PRISM (مجموعة من القواعد لضمان أن يكون الاختبار عادلاً، واقعياً، وسليماً إحصائياً). بدون هذه الأدوات، نحن نقيس فقط مدى براعة الذكاء الاصطنا_ي في الغش، وليس مدى براعته في العمل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →