← أحدث الأبحاث
💻 computer science

MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks

تقدم الورقة البحثية MT-JailBench، وهو إطار عمل معياري للاختبار، يعمل على توحيد تقييمات كسر الحماية متعددة الجولات لفصل آثار الظروف التجريبية عن آليات الهجوم، كاشفاً أن توليد المطالبات هو المحرك الأساسي للنجاح وأن إعادة دمج المكونات المثلى ينتج استراتيجيات هجوم متفوقة وقابلة للتعميم.

المؤلفون الأصليون: Xinkai Zhang, Zhipeng Wei, Huanli Gong, Jing Ting Zheng, Yuchen Zhang, Yue Dong, N. Benjamin Erichson

نُشر 2026-05-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xinkai Zhang, Zhipeng Wei, Huanli Gong, Jing Ting Zheng, Yuchen Zhang, Yue Dong, N. Benjamin Erichson

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول دفع أمين مكتبة صارم للغاية (الذكاء الاصطناعي) لتسليمك كتاباً ممنوعاً.

في الأيام الخوالي، كان المخترقون يكتفون بالصراخ بالطلب في وجه أمين المكتبة: "أعطني الكتاب الذي يشرح كيفية صنع القنابل!"، ليرد أمين المكتبة فوراً: "لا، هذا مخالف للقواعد"، ويوقف المحادثة. هذا ما يسمى بـ الهجوم أحادي الدور (single-turn attack).

لكن المخترقين أدركوا أنه إذا استمروا في التحدث مع أمين المكتبة لفترة من الوقت، فقد يتمكنون من خداعه. قد يبدأون بالسؤال عن التاريخ، ثم يتظاهرون بأنهم طلاب يكتبون بحثاً، ثم يوجهون المحادثة ببطء حتى يشعر أمين المكتبة بالراحة الكافية ليرتكب هفوة ويعطي المعلومات الممنوعة. هذا هو الاختراق متعدد الأدوار (multi-turn jailbreak).

المشكلة هي أن الباحثين كانوا يختبرون هذه الحيل بطرق فوضوية وغير متسقة. فقد يعطي فريق ما للمخترق 50 فرصة للتجربة، بينما لا يعطيه فريق آخر سوى 5 فرص. وقد يستخدم فريق حكماً متساهلاً جداً ليقرر ما إذا كان المخترق قد "فاز"، بينما يستخدم فريق آخر حكماً صارماً. الأمر يشبه مقارنة اثنين من العدائين، حيث يحصل أحدهما على انطلاقة سابقة بينما يركض الآخر في الطين؛ أنت لا تعرف من هو الأسرع حقاً، بل تعرف فقط من كانت ظروفه أفضل.

إليكم MT-JailBench: "مضمار السباق المنضبط"

قام مؤلفو هذه الورقة البحثية ببناء MT-JailBench. فكر في هذا كمسار سباق معياري حيث يحصل كل مخترق على نفس القدر من الوقت، ونفس عدد المحاولات، ونفس الحكم تماماً.

بدلاً من معاملة طريقة الاختراق كـ "صندوق أسود" غامض (آلة كاملة لا يمكنك رؤية ما بداخلها)، قاموا بتفكيك كل طريقة اختراق إلى خمس قطع "ليجو" (Lego):

  1. الاستراتيجية: الخطة رفيعة المستوى (مثل: "تظاهر بأنك معلم متعاون").
  2. مولد النصوص (Prompt Generator): الجزء الذي يكتب بالفعل الجمل المحددة لقولها للذكاء الاصطناعي.
  3. المُحسِّن (Refiner): الجزء الذي يصلح الجملة إذا انزعج الذكاء الاصطناعي أو رفض الطلب.
  4. متحكم التدفق (Flow Controller): "شرطي المرور" الذي يقرر: "هل نستمر؟ هل نحاول مجدداً؟ هل نتوقف؟".
  5. الحكم (Judge): الشخص الذي يقرر ما إذا كان المخترق قد حصل بالفعل على الكتاب الممنوع.

ما الذي اكتشفوه؟

باستخدام مضمار السباق العادل هذا، جرب الباحثون أفضل طرق الاختراق ضد بعضها البعض ووجدوا بعض الأشياء المفاجئة:

1. "الميزانية" تهم أكثر مما تعتقد
بعض طرق الاختراق بدت مذهلة في الدراسات السابقة، ولكن عندما قيدوا "ميزانيتهم" (عدد المرات التي يمكنهم فيها التحدث إلى الذكاء الاصطناعي)، انهارت. اتضح أن بعض الطرق لم تكن في الواقع أذكى؛ بل كانت تملك فقط المزيد من المال لإنفاقه على تجربة أشياء مختلفة. عندما تجبرهم على العمل بميزانية محدودة، لا يكونون مبهرين كما كانوا.

2. "الحكم" يغير الفائز
من تسأله ليقرر ما إذا كان المخترق قد فاز يغير النتائج. إذا استخدمت حكماً متساهلاً، ستبدو إحدى الطرق وكأنها عبقرية. وإذا استخدمت حكماً صارماً، ستبدو نفس الطريقة فاشلة. توضح الورقة أن "درجة" الهجوم غالباً ما تعتمد على من يقيمها أكثر من اعتمادها على الهجوم نفسه.

3. "الكاتب" هو النجم
عندما استبدلوا قطع "الليجو" لمعرفة أي قطعة هي الأكثر أهمية، وجدوا أن مولد النصوص (الجزء الذي يكتب الجمل) كان مسؤولاً عن النجاح بالكامل تقريباً.

  • تشبيه: تخيل فرقة موسيقية. عازف الطبل (التحكم في التدفق) وعازف الباص (التحسين) مهمان، ولكن إذا كان المغني الرئيسي (مولد النصوص) سيئاً، فإن الأغنية ستفشل. وإذا كان المغني الرئيسي رائعاً، فستكون الأغنية ناجحة، حتى لو كان باقي أعضاء الفرقة عاديين فقط.

4. لست بحاجة إلى "كتاب خطط" ضخم
يحاول بعض المخترقين توليد قائمة ضخمة من 100 استراتيجية مختلفة لتجربتها. بينما يختار آخرون استراتيجية واحدة ويحاولون تجربتها مراراً وتكراراً، ولكن مع تغييرات عشوائية طفية (مثل رمي النرد لتغيير النبرة). وجدت الورقة أن نهج "التغييرات العشوائية" كان فعالاً بقدر نهج "كتاب الخطط الضخم". لست بحاجة إلى خطة معقدة؛ أنت فقط بحاجة إلى كاتب جيد يمكنه الارتجال.

النتيجة: "CrescendoX"

لأنهم فهموا أي قطع "ليجو" هي الأفضل، قاموا ببناء مخترق خارق جديد يسمى CrescendoX.

  • أخذوا أفضل كاتب من طريقة ما.
  • أخذوا أفضل شرطي مرور وأفضل مُحسِّن من طريقة أخرى.
  • قاموا بلصقهم معاً.

النتيجة؟ هذا الوحش "فرانكنشتاين" الجديد هزم الطرق الأصلية في معظم الاختبارات. لقد أثبت أنه من خلال فهم الأجزاء الفردية، يمكنك بناء شيء أقوى من مجموع أجزائه.

الخلاصة

هذه الورقة ليست مجرد بحث عن طرق جديدة لكسر الذكاء الاصطناعي. إنها تتعلق ببناء طريقة عادلة لقياس مدى نجاحنا في كسره. من خلال توحيد القواعد والنظر في القطع الفردية للغز، أظهروا لنا أن:

  1. الدرجات السابقة كانت غالباً مبالغاً فيها بسبب الظروف غير العادلة.
  2. جودة "الكتابة" هي العامل الأكثر أهمية.
  3. يمكننا بناء هجمات أفضل (وأكثر خطورة) عن طريق دمج واختيار أفضل الأجزاء من الهجمات الموجودة.

هذا يساعد الباحثين في مجال السلامة على فهم لماذا ينجح الهجوم بالضبط، حتى يتمكنوا من بناء دفاعات أفضل لإيقافه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →