← أحدث الأبحاث
🤖 AI

Fair ASR: Re-Evaluating Black-Box Jailbreaks under Shared Target-Call Budgets

تقدم هذه الورقة Fair-ASR، وهو بروتوكول تقييم مدرك للميزانية يكشف عن تحولات كبيرة في التصنيف لهجمات كسر الحماية (jailbreak) في الصندوق الأسود تحت قيود استدعاء الهدف المشتركة، وتقترح ReCode، وهو هجوم تركيبي عالي الكفاءة يحقق نسبة نجاح 85% على GPT-5 مع استخدام أدنى قدر من الموارد.

المؤلفون الأصليون: Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Jiajia Li, Chaochao Lu, Qiaosheng Zhang

نُشر 2026-08-19
📖 1 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Jiajia Li, Chaochao Lu, Qiaosheng Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

ملخص تقني: Fair ASR: إعادة تقييم عمليات اختراق الصندوق الأسود تحت ميزانيات استدعاء الهدف المشتركة

1. بيان المشكلة

تعتمد التقييمات الحالية لهجمات "كسر الحماية" (Jailbreak) على النماذج اللغوية الكبيرة (LLM) بشكل أساسي على معدل نجاح الهجوم (ASR)، لكنها غالبًا ما تفشل في مراعاة ميزانية الهجوم المطلوبة لتحقيق هذا النجاح. غالبًا ما تعرض الدراسات الحالية قيم ASR النهائية التي تم الحصول عليها تحت قيود موارد غير متكافئة، مما يؤدي إلى مقارنات غير عادلة حيث يتم الخلط بين فعالية الطريقة وكمية الوصول إلى النموذج المستهدف التي تستخدمها.

بينما تحاول التقييمات الحديثة "المدركة للحوسبة" (compute-aware) توحيد الميزانيات من خلال تجميع الموارد في قيمة عددية موحدة (مثل FLOPs)، فإن هذا النهج يعاني من قيود كبيرة في سيناريوهات الصندوق الأسود (black-box):

  1. عدم الوضوح: عمليات حساب FLOPs للاستدلال للنماذج مغلقة المصدر غير متاحة عمومًا ويجب تقديرها.
  2. عدم القابلية للتبادل: تقوم FLOPs بدمج قيود الموارد المتميزة (مثل حدود معدل الاستخدام في واجهة برمجة التطبيقات مقابل التكلفة الحسابية) في مقياس واحد، مما يحجب الحقائق التشغيلية حيث يكون الوصول إلى النموذج المستهدف هو العائق الأساسي بسبب حدود المعدل وأنظمة كشف الإساءة.

وبناءً على ذلك، هناك نقص في وجود أساس قابل للمقارنة والملاحظة لتقييم هجمات الصندوق الأسود غير المتجانسة.

2. المنهجية: بروتوكول Fair-ASR

لمعالجة هذه المشكلات، قدم المؤلفون Fair-ASR، وهو بروتوكول تقييم يعمل على توحيد المقارنات تحت ميزانيات استدعاء هدف مشتركة (BB).

المبادئ الأساسية

  • الميزانية الأساسية (BB): يستخدم البروتوكول عدد استدعاءات الهدف (الاستعلامات الموجهة للنموذج الضحية) كميزانية أساسية. وقد تم اختيار ذلك لأنها:
    • عالمية عبر جميع هجمات الصندوق الأسود (كل هجوم يجب أن يستعلم من الهدف).
    • تعكس القيود التشغيلية (حدود المعدل، تعليق الحسابات).
    • قابلة للملاحظة مباشرة، على عكس FLOPs للواجهات البرمجية المغلقة.
  • المقياس الثانوي: يتم تتبع استدعاءات المهاجم (الاستعلامات الموجهة لنموذج مهاجم أو قاضٍ مساعد) بشكل منفصل لتحليل مقايضات الكفاءة، بدلاً من دمجها في الميزانية الأساسية.
  • مقاييس التقييم:
    • ASR@B: نسبة الطلبات الضارة التي تم اختراقها بنجاح ضمن BB من استدعاءات الهدف كحد أقصى.
    • منحنى ASR-الميزانية (ASR-Budget Curve): مسار ASR مع زيادة BB، مما يكشف عن معدلات النمو ونقاط التشبع.
    • متوسط استدعاءات الهدف (ATC): متوسط عدد استدعاءات الهدف المستهلكة لكل هجوم ناجح.
    • درجة الضرر (HS): مقياس جودة (باستخدام معيار StrongREJECT) لتقييم شدة وإقناع الاستجابة الضارة.

النطاق التجريبي

أعاد المؤلفون تقييم 11 هجوماً ممثلاً عبر ثلاث فئات:

  1. القوالب المصنوعة يدويًا: CodeAttack، DeepInception، CipherChat.
  2. أخذ العينات المتكرر العشوائي: Best-of-N (BoN).
  3. الهجمات المؤتمتة المدفوعة بالنماذج اللغوية الكبيرة: PAIR، TAP، ReNeLLM، AutoDAN، GPTFuzzer، AutoDAN-Turbo، Rainbow Teaming.

أُجريت التجارب على نماذج مستهدفة متنوعة (Llama-3.1، gpt-oss، GPT-4o، GPT-5، Gemini-3.1-Pro، Claude-Sonnet-4.6) باستخدام مجموعات بيانات قياسية (HarmBench، JailbreakBench).

3. النتائج الرئيسية لإعادة التقييم

كشف تطبيق Fair-ASR عن ثلاث رؤى حاسمة:

  1. التصنيفات المعتمدة على الميزانية: تتأثر تصنيفات الهجمات بشدة بميزانية استدعاء الهدف. الطرق التي تبدو متفوقة تحت الميزانيات الكبيرة قد تتفوق عليها طرق أبسط تحت الميزانيات الضيقة. على سبيل المثال، في Llama-3.1-8B، يتصدر TAP طريقة BoN عند B=5B=5، ولكن تتجاوزه BoN عند B=100B=100.
  2. تنافسية العناصر الأولية البسيطة: تظل عناصر الهجوم الأولية البسيطة تنافسية للغاية تحت وصول متساوٍ للهدف.
    • الاضطراب العشوائي: تستمر BoN في التحسن مع زيادة استدعاءات الهدف، محققة ASR مرتفع دون أي استدعاءات لنموذج المهاجم.
    • القوالب المصنوعة يدويًا: تحقق القوالب المهيكلة (مثل CodeAttack) معدلات نجاح عالية بعدد قليل جداً من استدعاءات الهدف (على سبيل المثال، 62% ASR عند B=1B=1)، وغالباً ما تتفوق على الطرق المعقدة المدفوعة بالنماذج اللغوية في أنظمة الميزانية المنخفضة.
  3. مقايضات الكفاءة: لا يوجد أي من الطرق المدفوعة بالنماذج اللغوية التي تم تقييمها تتسم بالكفاءة بشكل موحد في كل من استدعاءات الهدف واستدعاءات المهاجم.
    • تحقق ReNeLLM كفاءة عالية في استدعاءات الهدف (ATC منخفض) ولكنها تتسبب في تكاليف عالية لاستدعاءات المهاجم بسبب إعادة الكتابة التكرارية وبوابات الضرر القائمة على المطالبات فقط.
    • قد تستخدم الطرق الأخرى (مثل PAIR، TAP) استدعاءات أقل للمهاجم ولكنها تتطلب المزيد من استدعاءات الهدف للوصول إلى عتبات نجاح مماثلة.

4. الحل المقترح: ReCode

مدفوعاً بـ "فجوة الكفاءة ثنائية الأبعاد" المحددة، يقترح المؤلفون ReCode، وهو هجوم تركيبي مصمم لتعظيم ASR مع تقليل كل من استدعاءات الهدف واستدعاءات المهاجم.

هندسة التصميم

يجمع ReCode ثلاثة مكونات في خط معالجة بمسار واحد:

  1. إعادة الكتابة لتقليل الحساسية بدون بوابة (Gate-free Desensitization Rewriting): على عكس ReNeLLM، الذي يستخدم بوابة ضرر قائمة على المطالبة فقط لتصفية عمليات إعادة الكتابة (مما يؤدي إلى محاولات إعادة مكلفة)، يقوم ReCode بإعادة كتابة بمسار واحد باستخدام استراتيجيات تقليل الحساسية (مثل إعادة الكتابة الأدبية، أو استبدال الأهداف) دون الحاجة إلى حلقة قاضٍ مساعد.
  2. الاضطراب العشوائي الخالي من المهاجم (Attacker-Free Stochastic Perturbation): تخضع المطالبة المعاد كتابتها لاضطرابات على مستوى الحروف (مثل عكس حالة الأحرف، أو إدخال رموز ASCII) بشكل مشابه لـ BoN، مما يتطلب صفر من استدعاءات المهاجم الإضافية.
  3. التداخل بأسلوب الكود المهيكل (Structured Code-Style Nesting): يتم تضمين المطالبة المضطربة في قالب مهيكل بأسلوب الكود (مثل تعريفات فئات Python)، مما يزيد من إخفاء النية دون الحاجة إلى تحسين من نموذج المهاجم.

النتائج

عند تقييمه تحت ميزانية B=20B=20 من استدعاءات الهدف:

  • الأداء: حقق ReCode متوسط ASR بنسبة 81.0% عبر خمسة نماذج مستهدفة (بما في ذلك متغيرات gpt-oss) و 70.3% عبر ثلاثة من النماذج المغلقة الرائدة (GPT-5، Gemini-3.1-Pro، Claude-Sonnet-4.6).
  • الكفاءة: تطلب متوسط 7.00 استدعاءات مهاجم فقط لكل طلب (AAC)، وهو أقل بكثير من ReNeLLM (18.69) و TAP (49.56).
  • مكاسب محددة: في GPT-5، حسن ReCode نسبة ASR من 31% (في ReNeLLM) إلى 85% مع تقليل استدعاءات المهاجم من 26.02 إلى 7.19.
  • الضرر: حقق ReCode أيضاً أعلى متوسط لدرجة الضرر (HS) بواقع 0.662، مما يشير إلى أن معدلات النجاح الأعلى ارتبطت باستجابات ضارة ذات جودة أعلى.

5. الأهمية والادعاءات

يزعم البحث أن Fair-ASR يوفر خط أساس ضروري وقابل للملاحظة لمقارنة عمليات اختراق الصندوق الأسود، مما يصحح الاستنتاجات المضللة المستمدة من مقارنات الميزانية غير المتساوية. ويوضح أن التعقيد الخوارزمي لا يضمن الكفاءة، وأن العناصر الأولية البسيطة ومنخفضة التكلفة غالباً ما يتم عدم استغلالها بشكل كافٍ.

إن تقديم ReCode يعمل كإثبات مفهوم لإمكانية سد فجوة الكفاءة من خلال الجمع بين إعادة الكتابة لتقليل الحساسية وتقنيات التمويه الخالية من المهاجم. ويخلص المؤلفون إلى أن التقييمات المستقبلية يجب أن تتجاوز ASR النهائي للنظر في كفاءة الموارد المشتركة (استدعاءات الهدف والمهاجم) لتقييم مشهد السلامة للنماذج اللغوية الكبيرة بدقة.

القيود الملحوظة:

  • يركز البروتوكول حالياً على هجمات الدور الواحد ولا يغطي بعد إعدادات تعدد الأدوار.
  • لا تلتقط استدعاءات الهدف استخدام الرموز (tokens)، أو أسعار واجهة برمجة التطبيقات، أو التكلفة اليدوية لتطوير القوالب.
  • تقر الدراسة بأنه بينما يعد ReCode فعالاً، فإن سلوكيات نماذج معينة (مثل حساسية Claude تجاه تداخل الكود) يمكن أن تختلف، مما يتطلب مزيداً من الاستقصاء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →