NeurIPS Should Require Reproducibility Standards for Frontier AI Safety Claims
تجادل هذه الورقة الموقفية بوجوب فرض مؤتمر "نيوريبس" (NeurIPS) لمعايير قابلية التكرار فيما يتعلق بادعاءات سلامة الذكاء الاصطناعي الرائدة، مقترحةً إطار إفصاح ثلاثي المستويات لمعالجة حالة "الانعكاس الأدلي" الراهنة حيث تكون أكثر تأكيدات السلامة خطورة هي الأقل قابلية للتحقق بسبب حجب المصوغات البرمجية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل عالماً تقوم فيه شركة ببناء آلة جديدة قوية للغاية. وقبل أن تبيعها للجمهور، تنشر تقريراً تقول فيه: "لا تقلقوا، هذه الآلة آمنة. لن تؤذي أحداً".
المشكلة، وفقاً لهذه الورقة، هي أن الشركة غالباً ما ترفض أن تريك كيف اختبرت تلك الآلة. إنهم يعطونك النتيجة النهائية (مثل "آمن بنسبة 99%!") لكنهم يخفون أسئلة الاختبار، وقواعد التقييم، وإعدادات الآلة. ويقولون: "ثقوا بنا، لقد تحققنا من ذلك".
يجادل مؤلفو هذه الورقة بأن مؤتمر NeurIPS (وهو تجمع رئيسي لعلماء الكمبيوتر) يحتاج إلى تغيير القواعد. يقولون: "إذا أردتم نشر ادعاء حول سلامة ذكاء اصطناعي فائق القوة، يجب عليكم إثبات ذلك. إذا لم تتمكنوا من إظهار طريقة عملكم، فلا يمكنك تقديم هذا الادعاء الكبير."
إليك تفصيل لمقترحهم باستخدام تشبيهات بسيطة:
1. المشكلة: "الانقلاب الevidentiary" (البرهاني)
عادةً في العلم، كلما كان الادعاء أكبر وأكثر أهمية، احتجت إلى دليل أكثر لإثباته.
- العلم الطبيعي: إذا قال عالم "لقًدت وجدت كوكباً جديداً"، فعليه أن يظهر بيانات التلسكوب حتى يتمكن الآخرون من رؤيتها أيضاً.
- سلامة الذكاء الاصطناعي (المشكلة): إذا قالت شركة "هذا الذكاء الاصطناعي آمن بما يكفي لتشغيل شبكة الكهرباء"، فإنهم غالباً ما يخفون البيانات.
يسمي المؤلفون هذا "انقلاباً برهانياً" (Evidential Inversion). الأمر يشبه ساحراً يدعي أن خدعته غير ضارة، لكنه يرفض السماح لأي شخص برؤية مجموعة أوراق اللعب. تجادل الورقة بأن هذا فشل علمي، وليس مجرد نقص في الشفافية.
2. الحل: نظام "إشارات المرور" ثلاثي المستويات
يدرك المؤلفون أن إظهار "الأوراق" (بيانات الاختبار) قد يكون خطيراً في بعض الأحيان. فإذا أظهرت بالضبط كيفية كسر نظام أمني، فقد يتعلم الأشرار كيفية القيام بذلك.
لذلك، يقترحون نظاماً ثلاثي المستويات (مثل إشارات المرلو) لكيفية مشاركة المعلومات:
🟢 المستوى 1 (الضوء الأخضر - عام):
- متى: عندما تكون بيانات الاختبار آمنة لعرضها للجميع.
- القاعدة: يجب عليك نشر كل شيء: الأسئلة التي طرحتها على الذكاء الاصطناعي، والشيفرة البرمجية التي استخدمتها، والنتائج. يمكن لأي شخص إعادة إجراء الاختبار.
- النتيجة: ثقة كاملة. الادعاء مدعوم بالكامل.
🟡 المستوى 2 (الضوء الأصفر - محكوم):
- متى: عندما يكون عرض البيانات للجمهور خطيراً (على سبيل المثال، إذا كانت تعلم الناس كيفية الاختراق)، ولكن يمكن لخبير مستقل وموثوق الاطلاع عليها بأمان.
- القاعدة: أنت لا تنشر البيانات للجمهور. بدلاً من ذلك، تسلمها إلى لجنة سرية من الخبراء المستقلين الموثوقين (مثل تصريح أمني خاص). يقومون بفحص العمل خلف أبواب مغلقة ويعطون "موافقة" أو "رفضاً".
- النتيجة: الادعاء مدعوم، ولكن مع ملاحظة تقول: "لقد تحققنا من هذا بشكل خاص، لكن لا يمكنك رؤية البيانات الخام".
🔴 المستوى 3 (الضوء الأحمر - مقيد):
- متى: حتى اللجنة السرية لا يمكنها الاطلاع على البيانات لأنها خطيرة للغاية (على سبيل المثال، الاختبار يتضمن إنشاء محاكاة لسلاح بيولوجي).
- القاعدة: لا يزال بإمكانك كتابة الورقة، ولكن لا يمكنك تقديم الادعاء الكبير بأن هذا الذكاء الاصطناوي "آمن بما يكفي للإطلاق". يمكنك فقط أن تقول: "لقد حاولنا اختبار هذا، لكن البيانات حساسة للغاية".
- النتيجة: الادعاء "محدد النطاق". لا يمكنك استخدام الورقة لتبرير إطلاق الذكاء الاصطناعي للعالم.
3. "جرد الادعاءات" (الإيصال)
للتأكد من أن الشركات لا تغش، تقترح الورقة نموذجاً جديداً يجب على المؤلفين ملؤه، يسمى "جرد الادعاءات" (Claim Inventory).
- فكر في الأمر مثل إيصال في متجر.
- يجب على المؤلف إدراج كل ادعاء سلامة يقدمه.
- بجانب كل ادعاء، يجب عليه تحديد مربع: "هل أظهرنا البيانات؟ هل جعلنا لجنة سرية تتحقق منها؟ أم أنها خطيرة جداً؟"
- إذا اختار "خطيرة جداً" دون وجود سبب وجيه، يتم رفض الورقة أو إضعاف الادعاء.
4. لماذا NeurIPS؟
اختار المؤلفون NeurIPS لأنه بمثابة "الأولمبياد" لأبحاث الذكاء الاصطناعي.
- حالياً، تحب الشركات نشر تقارير السلامة الخاصة بها في NeurIPS لأن ذلك يمنح ادعاءاتها شرعية علمية. هذا يجعل الجمهور والحكومات تثق بهم.
- تجادل الورقة: "إذا أردتم الميدالية الذهبية (النشر في NeurIPS)، فعليكم اتباع القواعد. لا يمكنك مجرد قول إنك آمن؛ يجب عليك إثبات ذلك، إما علناً أو لمُحكّم موثوق".
5. كيف نمنع الغش؟
يتوقع المؤلفون أن بعض الشركات قد تحاول التلاعب بالنظام (على سبيل المثال، الادعاء بأن بياناتهم "خطيرة جداً" فقط لإخفائها).
- الحل: يقترحون نظام مراجعة اتحادياً (Federated Review System). تخيل مجموعة من "التصاريح الأمنية" المختلفة (مثل معاهد السلامة الوطنية المختلفة أو المختبرات المستقلة). إذا قالت شركة إن بياناتها حساسة للغاية بالنسبة لـ NeurIPS، فإن خبيراً محايداً من هذه المجموعة سيتحقق منها.
- إذا قال الخبير: "لا، هذا ليس خطيراً في الواقع، يجب عليك إظهاره"، فعلى الشركة إظهاره. وإذا رفضت، يتم رفض الورقة.
الملخص
الورقة هي دعوة للعمل لمجتمع الذكاء الاصطناعي: توقفوا عن قبول عبارة "ثقوا بنا" كدليل على السلامة.
إذا ادعيت أن ذكاءً اصطناعياً قوياً آمن، فيجب عليك إما:
- إظهار عملك للجميع.
- السماć لمُحكّم مستقل وموثوق بالتحقق من عملك في السر.
- إذا لم تتمكن من القيام بأي منهما، فاعترف بأنك لم تثبت أنه آمن، ولا تستخدم ورقتك البحثية لتبرير إطلاق الذكاء الاصطناعي.
الهدف ليس إيقاف تطوير الذكاء الاصطناعي؛ بل هو التأكد من أنه عندما نقول "هذا آمن"، فإن لدينا بالفعل الإيصالات لإثبات ذلك.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.