Principles and Guidelines for Randomized Controlled Trials in AI Evaluation
تضع هذه الورقة إطاراً تأسيسياً لتوحيد معايير التجارب العشوائية المنضبطة في تقييم الذكاء الاصطناعي عبر تكييف نموذج الصلاحية الرباعي لـ "شاديش وآخرون" وإرشادات (TOP) إلى خمسة مبادئ و33 إرشاداً تشغيلياً تعطي الأولوية للأداء البشري، والاستدلال السببي، والشفافية لمعالجة التحديات الفريدة في دراسات التفاعل بين الإنسان والذكاء الاصطناعي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول معرفة ما إذا كانت هناك آلة حاسبة جديدة فائقة الذكاء تساعد الناس حقًا في حل المسائل الرياضية، أم أنها تجعلهم يشعرون فقط بأنهم يؤدون عملًا أفضل.
لفترة طويلة، كان العلماء الذين يختبرون الذكاء الاصطوي مثل الطهاة الذين يتذوقون حساءهم الخاص دون وصفة. قد يقولون: "هذا الحساء مذاقه رائع!" لكنهم لم يخبروك ما هي المكونات التي استخدموها، أو كمية الملح التي أضيفت، أو ما إذا كانوا قد تذوقوه وهم يرتدون عصبة على أعينهم. أحيانًا، يتغير طعم "الحساء" (الذكاء الاصطناعي) في منتصف عملية التذوق، أو يكون الأشخاص الذين يتذوقونه جميعهم طهاة محترفين وليسوا مجرد زبائن عاديين.
هذه الورقة البحثية هي كتاب وصفات جديد وصارم لاختبار الذكاء الاصطناعي. وهي تقول: "توقفوا عن التخمين. دعونا نجري تجربة علمية سليمة لنرى ما إذا كان الذكاء الاصطناعي يساعد البشر حقًا."
إليك التقسيم البسيط لـ "وصفة" هؤلاء، باستخدام تشبيهات من الحياة اليومية:
1. الفكرة الجوهرية: اختبار "الارتقاء البشري" (Human Uplift)
معظم اختبارات الذكاء الاصطناعي اليوم تشبه اختبار تصادم السيارات حيث يصدمون السيارة بجدار فقط ليروا مدى تحطم السيارة. تقول هذه الورقة إننا بحاجة لاختبار السائق، وليس فقط السيارة.
- الطريقة القديمة: "انظروا، لقد كتب الذكاء الاصطناعي هذا الكود!"
- الطريقة الجديدة: "لقد أعطينا نصف الناس الذكاء الاصطناعي والنصف الآخر لم يحصلوا عليه. هل كتب الأشخاص الذين امتلكوا الذكاء الاصطناعي كودًا أفضل حقًا، أو تعلموا بشكل أسرع، أو ارتكبوا أخطاءً أقل من الأشخاص الذين لم يمتلكوه؟"
2. القواعد الخمس للعبة (المبادئ)
استعار المؤلفون قواعد من الطب وعلم النفس وأضافوا إليها قاعدة جديدة للذكاء الاصطناعي. فكر في هذه القواعد كأنها الأعمدة الخمسة التي تدعم جسرًا. إذا كان أحدها ضعيفًا، ينهار الجسر (الدراسة).
القاعدة 1: هل نقيس الشيء الصحيح؟ (صدق البناء - Construct Validity)
- تشبيه: تخيل أنك تريد اختبار ما إذا كان حذاء الجري الجديد يجعلك أسرع. إذا قمت بقياس "مدى صرير الحذاء"، فأنت لا تقيس السرعة.
- وجهة نظر الورقة: لا تكتفِ بعدّ عدد الكلمات التي ساعد الذكاء الاصطناعي شخصًا ما في كتابتها (فهذا أمر سهل التزييف). بل قِس ما إذا كانت جودة التفكير قد تحسنت بالفعل.
القاعدة 2: هل تسبب الذكاء الاصطناعي في التغيير فعليًا؟ (الصدق الداخلي - Internal Validity)
- تشبيه: إذا أعطيت مجموعة من الناس فيتامينًا جديدًا وأصبحوا أكثر صحة، فهل كان السبب هو الفيتامين؟ أم أنهم بدأوا أيضًا في تناول السلطة والنوم لفترات أطول؟
- وجهة نظر الورقة: يجب أن تتأكد من أن الفرق الوحيد بين المجموعتين هو الذكاء الاصطناعي. إذا حصلت "مجموعة الذكاء الاصطناعي" أيضًا على تعليمات أفضل أو جهاز كمبيوتر أفضل، فلا يمكنك إرجاع النجاح للذكاء الاصطناعي. كما يجب عليك منع مجموعة "بدون ذكاء اصطناعي" من التلصص سرًا على الذكاء الاصطناعي.
القاعدة 3: هل هذا يعمل للجميع؟ (الصدق الخارجي - External Validity)
- تشبيه: إذا كان الدواء يعمل على رجال في العشرين من عمرهم في مختبر، فهل يعمل على نساء في السبعين من عمرهن في مستشفى؟
- وجهة نظر الورقة: لا تختبر الذكاء الاصطناعي على خبراء الكمبيوتر فقط أو طلاب الجامعات فقط. إذا فعلت ذلك، فلا يمكنك الادعاء بأنه يعمل للجميع. يجب أن توضح بوضوح: "هذا يعمل لـ هؤلاء الناس، في هذا الموقف".
القاعدة 4: هل الأرقام حقيقية؟ (صدق الاستنتاج الإحصائي - Statistical Conclusion Validity)
- تشبيه: إذا رميت عملة معدنية 3 مرات وظهر الوجه (الصورة) في كل مرة، فقد تعتقد أن العملة سحرية. لكن إذا رميتها 1,000 مرة، فمن المحتمل أن الأمر مجرد حظ.
- وجهة نظر الورقة: لا تتحمس للتحسينات الضئيلة التي قد تكون مجرد ضربة حظ. يقول المؤلفون إننا بحاجة لأن نكون صارمين للغاية في رياضياتنا (باستخدام "قيمة احتمالية p-value" أكثر صرامة وهي 0.005 بدلاً من الـ 0.05 المعتادة) لأن ادعاءات الذكاء الاصطناعي ذات مخاطر عالية. نحن بحاجة لمعرفة مقدار التحسن الذي أحدثه الذكاء الاصطناعي، وليس فقط ما إذا كان قد جعل الأمور "أفضل".
القاعدة 5: أظهر عملك! (الشفافية، القابلية للتكرار، والتحقق - Transparency, Repeatability, and Verification)
- تشبيه: إذا قال ساحر: "لقد جعل الأرنب يظهر"، لكنه رفض أن يسمح لك برؤية القبعة أو الأرنب، فلن تصدقه.
- وجهة نظر الورقة: يتغير الذكاء الاصطناعي بسرعة. إذا لم تكتب بالضبط أي نسخة من الذكاء الاصطناعي استخدمت، وما هي الأوامر (prompts) التي كتبتها، وشاركت بياناتك، فلن يتمكن أحد من مراجعة عملك لاحقًا. تضع الورقة "سلم ثقة" مكون من 4 مستويات:
- الإفصاح: "لقد أخبرناك بما فعلناه."
- المشاركة: "لقد أعطيناك البيانات والكود."
- التحقق: "قام شخص مستقل بالتحقق من أن الكود يعمل بالفعل."
- القابلية للتكرار: "حاول فريق آخر تجربته مع أشخاص جدد وحصلوا على نفس النتيجة."
3. قائمة التحقق المكونة من 33 خطوة
لا تكتفي الورقة بوضع القواعد فحًا؛ بل تقدم قائمة تحقق مكونة من 33 خطوة للباحثين.
- مثال: "قبل أن تبدأ، اكتب بالضبط ما تختبره حتى لا يمكنك تغيير القواعد في منتصف الطريق."
- مثال: "تأكد من أن الأشخاص في مجموعة 'بدون ذكاء اصطناعي' لا يستخدمون الذكاء الاصطناعي سرًا على هواتفهم الخاصة."
- مثال: "تحقق مما إذا كان الذكاء الاصطناعي يجعل العمل أسرع ولكنه أسوأ، أو أبطأ ولكنه أفضل."
4. لماذا نحتاج إلى هذا؟
في الوقت الحالي، العالم مليء بدراسات الذكاء الاصطناعي المربكة. بعضها يقول إن الذكاء الاصطناعي مذهل؛ والبعض الآخر يقول إنه عديم الفائدة. يقول المؤلفون إن هذا بسبب أن الجميع يلعب بقواعد مختلفة.
- المشكلة: إذا لم نتمكن من الوثوق بالدراسات، فقد نستخدم ذكاءً اصطناعيًا خطيرًا، أو قد نتجاهل ذكاءً اصطناعيًا مفيدًا.
- الحل: هذه الورقة هي "إجراء تشغيل قياسي". إنها مخطط لبناء جسر من الثقة. فهي تساعد الباحثين في التخطيط لدراساتهم، وتساعد المراجعين في التحقق مما إذا كانت الدراسة جيدة، وتساعد الحكومات في سن قوانين بناءً على حقائق حقيقية، وليس مجرد تخمينات.
الملخص
فكر في هذه الورقة كأنها هيئة الغذاء والدواء (FDA) لتجارب الذكاء الاصطناعي. تمامًا كما لا ترغب في تناول دواء جديد دون تجربة سريرية صارمة ومزدوجة التعمية، لا ينبغي لنا الوثوق بالادعاءات حول مساعدة الذكاء الاصطناعي للبشر دون هذه الاختبارات المعيارية الصارمة. الأمر يتعلق بالانتقال من "نعتقد أن الذكاء الاصطناعي رائع" إلى "لدينا دليل على أن الذكاء الاصطناعي يساعد هؤلاء الناس على القيام بـ هذه المهمة بشكل أفضل".
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.