SafetyRepro: Configuration-Conditional Rank Instability on Alignment Benchmarks
تُظهر ورقة "SafetyRepro" أن خيارات التكوين في معايير قياس الأمان يمكن أن تعكس بشكل جوهري ترتيبات السلامة الثنائية، مما يقدم إطاراً نظرياً وبروتوكول تقييم لقياس ومعالجة عدم استقرار هذا الترتيب.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول الحكم على أي من ثلاثة عداءين (لنسمهم العداء أ، والعداء ب، والعداء ج) هو الأسرع. تريد سباقاً عادلاً لمعرفة من سيفوز.
في عالم الذكاء الاصطناعي، هؤلاء "العداءون" هم النماذج اللغوية الكبيرة (LLMs)، و"السباق" هو اختبار معيار (benchmark) صُمم لمعرفة أيهم أكثر أماناً، أو صدقاً، أو أقل انحيازاً.
هذه الورقة البحثية، SafetyRepro، تجادل بأن نتائج هذه السباقات غالباً ما تكون مزيفة لأن الشخص الذي يدير السباق (المُقيِّم) يمتلك سيطرة كبيرة على القواعد، والمضمار، وساعة التوقيت. في الواقع، بمجرد تغيير القواعد قلياً، يمكن للمُقيِّم جعل أي عداء يفوز، حتى لو كانوا جميعاً يجرون في نفس السباق.
إليك تفصيل نتائج الورقة باستخدام تشبيهات بسيطة:
1. مشكلة "كتاب القواعد"
عندما تقول ورقة بحثية معيارية "النموذج أ أكثر أماناً من النموذج ب"، يبدو الأمر كأنه حقيقة علمية. لكن الورقة تجادل بأن هذا يشبه لعبة "حجر ورقة مقص" حيث يمكن للشخص الذي يمسك بالورقة أن يغير القواعد سراً قبل بدء اللعبة.
قبل أن يجيب الذكاء الاصطناعي على سؤال ما، يتعين على المُقيِّم اختيار:
- قالب المطالبة (Prompt Template): كيفية صياغة السؤال (مثلاً: "أجب على هذا" مقابل "أنت مساعد مفيد، أجب على هذا").
- طريقة فك التشفير (Decoding): كيف يتوقع الذكاء الاصطناعي الكلمة التالية (مثلاً: أن يكون صارماً جداً مقابل أن يكون مبدعاً قليلاً).
- طريقة التسجيل (Scoring): كيف يتم تقييم الإجابة (مثلاً: البحث عن حرف معين مثل "أ" مقابل قراءة فقرة كاملة).
اختبرت الورقة ثلاثة نماذج ذكاء اصطناعي شهيرة على خمسة معايير سلامة مشهورة. لم يكتفوا بتشغيل الاختبار مرة واحدة؛ بل مرروه عبر 612 تركيبة مختلفة من هذه القواعد (مثل تجربة كل التشكيلات الممكنة من الأحذية، والجوارب، والأربطة).
2. "القلب" (الاكتشاف الرئيسي)
الاكتشاف الأكثر صدمة هو ما يسميه المؤلفون "قلب الترتيب" (Rank Flip).
تخين لوحة الصدارة لديك:
- السيناريو 1: استخدمت "مجموعة القواعد أ". تقول لوحة الصدارة: العداء أ > العداء ب > العداء ج.
- السيناريو 2: قمت بتبديل "مجموعة القواعد ب" (طريقة مطالبة أو طريقة تسجيل مختلفة). فجأة، تقول لوحة الصدارة: العداء ج > العداء أ > العداء ب.
وجدت الورقة أنه في كل معيار اختبروه، استطاع المُقيِّم قلب الفائز بمجرد تغيير الإعدادات.
- في اختبار محدد يسمى XSTest (الذي يتحقق مما إذا كان الذكاء الاصطناعي يرفض الإجابة على الأسئلة الخطيرة)، استطاع المُقيِّم جعل أي من الترتيبات الستة الممكنة تحدث. يمكنهم جعل أسوأ نموذج يبدو كأنه الأفضل، والأفضل يبدو كأنه الأسوأ، ببساطة عن طريق ضبط الإعدادات.
التشبيه: الأمر يشبه حكماً في مسابقة طبخ يمكنه أن يقرر أن "درجة الحرارة الحارة" هي الشيء الوحيد المهم. إذا فعل ذلك، ستخسر حساء خفيف أمام كاري حار. ولكن إذا قرر أن "الحلاوة" هي الشيء الوحيد المهم، فإن الكاري سيخسر أمام الكعكة. توضح الورقة أن معايير الذكاء الاصطناعي حالياً تشبه هذا: "الفائز" يعتمد كلياً على أي نكهة يقرر الحكم تذوقها أولاً.
3. "الصندوق الأسود" للأدوات المختلفة
نظرت الورقة أيضاً فيما يحدث إذا استخدمت ثلاث حزم برمجية مختلفة لـ "برامج السباق" (مثل lm-evaluation-harness و HELM و Inspect AI) لاختبار نفس النموذج مع نفس الإعدادات.
النتيجة: كانت الدرجات متفاوتة بشكل كبير.
- في أحد الاختبارات، تباينت الدرجات بمقدار 21.7 نقطة مئوية لمجرد استخدام حزمة برمجية مختلفة.
- لماذا؟ لأنهم رغم اختبارهم لـ نفس المهمة، كانت الحزم البرمجية تقيس في الواقع أشياء مختلفة قلياً. أحدهم قد يتحقق مما إذا كان الذكاء الاصطناعي قد اختار الحرف الصحيح، بينما يتحقق آخر مما إذا كان الذكاء الاصطناعي قد كتب جملة تحتوي على الحرف الصحيح.
التشبيه: إنه يشبه ثلاثة أشخاص مختلفين يقيسون ارتفاع مبنى. أحدهم يقيس من الأرض إلى السقف. والآخر من القبو إلى السقف. والثالث من السقف إلى السماء. جميعهم "يقيسون الارتفاع"، لكنهم يحصلون على أرقام مختلفة تماماً لأن أدواتهم وتعاريفهم لا تتطابق.
4. ماذا يعني هذا بالنسبة لـ "السلامة"
تخلص الورقة إلى أنه عندما تقرأ عنواناً يقول "النموذج X أكثر أماناً من النموذج Y"، يجب أن تكون متشككاً للغاية.
- الادعاء: الورقة لا تقول إن النماذج سيئة. بل تقول إن الترتيب غير مستقر.
- الواقع: عبارة "النموذج أ أكثر أماناً" هي في الواقع عبارة عن الزوج المكون من (النموذج أ + القواعد المحددة المستخدمة). إذا غيرت القواعد، فقد تصبح العبارة خاطئة.
- الحل المقترح: يقترح المؤلفون "بطاقة GRID". تماماً كما تخبرك الملصقات الغذائية الموجودة على الطعام بكل المكونات الموجودة فيه، يجب أن يأتي كل معيار درجات مع ملصق يسرد كل قاعدة تم استخدامها لتوليد تلك الدرجة. بدون هذا الملصق، تصبح الدرجة بلا معنى.
ملخص في جملة واحدة
تثبت الورقة أن اختبارات سلامة الذكاء الاصطناعي الحالية حساسة جداً للتغييرات الطفيفة في كيفية تشغيلها، لدرجة أن المُقيِّم يمكنه أساساً "تزوير" النتائج لجعل أي نموذج ذكاء اصطناعي يبدو كالفائز أو الخاسر، مما يعني أننا لا نستطيع الوثوق بالترتيبات الحالية حتى نوحد القواعد ونكشف بدقة عن كيفية إجراء الاختبار.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.