← أحدث الأبحاث
🤖 AI

Single-Configuration Attack Success Rate Is Not Enough: Jailbreak Evaluations Should Report Distributional Attack Success

تجادل ورقة الموقف هذه بأن تقييمات كسر الحماية الحالية التي تعتمد على معدلات نجاح التكوين الواحد غير كافية لتوصيف التهديدات، وتقترح اعتماد مقاييس توزيعية مثل مقياس حساسية المتغير (VSM) وتغطية الاتحاد (UC) لالتقاط النطاق الكامل لأداء الهجوم عبر تغيرات المعلمات بشكل أفضل.

المؤلفون الأصليون: Carsten Maple, Abhishek Kumar, Riya Tapwal

نُشر 2026-05-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Carsten Maple, Abhishek Kumar, Riya Tapwal

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك حارس أمن يحاول معرفة مدى سهولة اختراق مبنى عالي التقنية.

في عالم سلامة الذكاء الاصطناي، يختبر الباحثون غالبًا هجمات "كسر الحماية" (jailbreak)—وهي طرق مصممة لخداع نماذج الذكاء الاصطناعي لجعلها تقول أشياء لا ينبغي لها قولها. المعيار الحالي للإبلا عن هذه الاختبارات يشبه لصًا يقول: "لقد وجدت مفتاحًا واحدًا محددًا يفتح الباب الأمامي بنسبة 80% من المرات. لذلك، هذا المبنى معرض للاختراق بنسبة 80%."

تجادل هذه الورقة البحثية بأن طريقة الإبلاغ هذه مضللة وغير مكتملة. الأمر يشبه القول بأن المبنى آمن لأنك جربت مفتاحًا واحدًا فقط على باب واحد، متجاهلاً حقيقة أن هناك 36 مفتاحًا آخر قد تفتح أبوابًا مختلفة، أو أن "أفضل" مفتاح يعمل فقط مع نوع معين جدًا من الأقفال.

إليك تفصيل حجة الورقة البحثية باستخدام تشبيهات بسيطة:

المشكلة: مغالطة "المفتاح الأفضل"

تُبلغ معظم أوراق سلامة الذكاء الاصطناعي عن رقم واحد فقط: معدل نجاح الهجوم (ASR). هم يختارون أفضل مجموعة واحدة من الإعدادات (مثل "المفتاح الأفضل") ويقولون: "انظروا، هذا الهجوم ينجح بنسبة 80% من المرات!"

يقول المؤلفون إن هذا يشبه لصًا يريك مفتاحًا واحدًا يفتح الباب الأمامي ويدعي: "هذا هو مدى أمان المبنى". ولكن ماذا لو:

  1. كان ذلك المفتاح يعمل فقط على الباب الأمامي، بينما هناك 10 مفاتيح أخرى تفتح الأبواب الخلفية والجانبية والقبو؟
  2. كانت نسبة "النجاح 80%" مجرد ضربة حظ لم تحدث إلا مع إعداد واحد محدد للغاية، بينما الإعدادات الـ 99 الأخرى لا تعمل تقريبًا؟

إذا اكتفى المدافعون (حراس الأمن) بالنظر إلى ذلك "الرقم الأفضل" الوحيد، فقد يقومون بسد الثغرة في الباب الأمامي ويعتقدون أنهم آمنون، بينما تظل الأبواب الخلفية والجانبية مفتوحة على مصراعيها.

الحل: كوبا قياس جديدان

يقترح المؤلفون طريقتين جديدتين لقياس الخطر، واللتين يسمونهما VSM و UC.

1. مقياس حساسية المتغير (VSM): "هل كان ذلك المفتاح ضربة حظ؟"

تخيل أن لديك حقيبة تحتوي على 100 مفتاح مختلف.

  • السيناريو أ: 95 منها تفتح الباب بسهولة، وواحد منها معطل. إذا أبلغت عن "أفضل" مفتاح، فأنت تقول الحقيقة بشأن المتوسط.
  • السيناريو ب: مفتاح واحد فقط يعمل بشكل مثالي، والـ 99 الأخرى عديمة الفائدة. إذا أبلغت عن "أفضل" مفتاح، فأنت تكذب بشأن المتوسط.

يقيس VSM الفجوة بين النتيجة "الأفضل" والنتيجة "المتوسطة".

  • VSM منخفض: الهجوم ثابت. الرقم الرئيسي موثوق به.
  • VSM مرتفع: الرقم الرئيسي هو مجرد ضربة حظ. الهجوم ينجح فقط إذا حالفك الحظ بشكل كبير مع الإعدادات. وجدت الورقة أنه بالنسبة لبعض الهجمات، كانت النتيجة "الأفضل" أفضل بخمس مرات من النتيجة المتوسطة، مما يعني أن الرقم الرئيسي كان متفائلًا بشكل مبالغ فيه.

2. تغطية الاتحاد (UC): "كم عدد الأبواب التي يمكن فتحها؟"

هذا هو الجزء الأهم بالنسبة للأمن.
تخيل أن لديك 36 مفتاحًا مختلفًا.

  • المفتاح (أ) يفتح 60% من الأبواب.
  • المفتاح (ب) يفتح 40% مختلفة.
  • المفتاح (ج) يفتح الـ 20% المتبقية.

إذا نظرت فقط إلى "أفضل" مفتاح (المفتاح أ)، فستعتقد أن 60% من المبنى معرض للاختراق. ولكن إذا جربت كل المفاتيح معًا، فستدرك أن 100% من المبنى معرض للاختراق.

يقيس UC النسبة المئوية الإجمالية للأبواب التي يمكن فتحها إذا جرب المهاجم كل تنويعات الهجوم. وجدت الورقة أنه بالنسبة لبعض الهجمات، كانت "تغطية الاتحاد" أعلى بنسبة 33% من "أفضل تكوين منفرد". وهذا يعني أن المدافعين الذين ينظرون فقط إلى الرقم الأفضل يفتقدون جزءًا كبيرًا من الخطر.

أمثلة من الواقع من الورقة البحثية

اختبر المؤلفون هذه الأفكار على اثنتين من "عائلات الهجمات" الشهيرة (PAIR و Bijection Learning) باستخدام ثلاثة نماذج مختلفة للذكاء الاصطناعي.

  • هجوم PAIR: جربوا "شخصيات" مختلفة (مثل التظاهر بأنهم شخصية ذات سلطة مقابل مفكر منطقي).
    • العنوان الرئيسي: "تأييد السلطة" نجح بنسبة 69% من المرات.
    • الواقع: عندما جمعوا الشخصيات الثلاث، تمكنوا من كسر 88% من الحالات. الرقم المنفرد أغفل 19% من المطالبات (prompts) الضعيفة.
  • هجوم Bijection: يستخدم هذا الهجوم حيل "ترميز" مختلفة (مثل تغيير اللغة أو المسافات في النص).
    • العنوان الرئيسي: أفضل إعداد منفرد نجح بنسبة 81% من المرات.
    • الواقع: عندما جربوا جميع التشكيلات الـ 36 الممكنة، تم كسر 100% من المطالبات. الرقم "الأفضل" أغفل تمامًا حقيقة أن كل حالة اختبار كانت معرضة للاختراق إذا جربت تنويعات كافية.

لماذا هذا مهم؟

الورقة لا تقول إن الأرقام الحالية "خاطئة" من الناحية الرياضية؛ هي فقط غير مكتملة.

  • للمدافعين: إذا قمت بسد ثغرة "أفضل" هجوم فقط، فإنك تترك الـ 30% الأخرى من المبنى مفتوحاً. أنت بحاجة لمعرفة "تغطية الاتحاد" لتعرف مقدار المبنى المعرض للخطر فعليًا.
  • للباحثين: إذا كنت تقارن بين هجومين، أحدهما لديه درجة "الأفضل" وهي 80% (لكنه غير متسق للغاية) والآخر لديه درجة "الأفضل" وهي 60% (لكنه متسق للغاية)، فلا يمكنك القول ببساطة إن الأول "أفضل". أنت بحاجة لمعرفة ما إذا كان الأول مجرد ضربة حظ.

الخلاصة

يطلب المؤلفون من مجتمع أبحاث الذكاء الاصطناعي التوقف عن مجرد الصراخ برقم "الحالة الأفضل". بدلاً من ذلك، يجب عليهم الإبلاغ عن:

  1. الحالة الأفضل (العنوان الرئيسي).
  2. الحالة المتوسطة (مدى نموذجية هذا النجاح؟).
  3. إجمالي التغطية (كم عدد المطالبات المختلفة التي يمكن كسرها إذا جربت كل التنويعات؟).

حتى يبدأ الباحثون في تقديم هذه الصورة الكاملة، سنظل مثل حراس الأمن الذين يفحصون الباب الأمامي فقط ويفترضون أن بقية المبنى آمن.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →