Accelerating Suffix Jailbreak attacks with Prefix-Shared KV-cache
تقدم هذه الورقة تقنية "مخزن مفاتيح التنبؤ المشترك للبادئة" (Prefix-Shared KV Cache - PSKV)، وهي تقنية تحسين جاهزة للاستخدام تعمل على تسريع هجمات كسر الحماية عبر اللاحقات بشكل كبير من خلال مشاركة مخزن مفاتيح تنبؤ واحد لبادئة التعليمات الضارة المشتركة عبر المطالبات المرشحة، مما يقلل وقت الاستدلال بنسبة 40% واستهلاك ذروة الذاكرة بنسبة 50% دون المساس بمعدلات نجاح الهجوم.
المؤلفون الأصليون:Xinhai Wang, Shaopeng Fu, Shu Yang, Liangyu Wang, Tianhang Zheng, Di Wang
إليك شرح للورقة البحثية باستخدام لغة بسيطة وتشبيهات إبداعية.
المشكلة: عنق زجاجة "النسخ واللصق"
تخيل أنك مختبر أمني تحاول اختراق روبوت ذكي جداً، ولكنه مهذب للغاية (نموذج لغوي كبير أو LLM). هدفك هو العثور على "عبارة سحرية" محددة (اللاحقة - suffix) التي، عند إضافتها إلى نهاية سؤال محظور (مثل "كيف أصنع قنبلة؟")، تخدع الروبوت وتجعله يجيب عليه.
للعثور على هذه العبارة السحرية، عليك تجربة آلاف النهايات المختلفة.
الطريقة القديمة: تخيل أن لديك تعليمات مملة وطويلة (السؤال الضار) مكونة من 80 صفحة. أنت بحاجة لاختبار 1,000 نهاية مختلفة.
في الماضي، لاختبار هذه النهايات، كنت ستصور تلك التعليمات المكونة من 80 صفحة بالكامل 1,000 مرة. ثم ستلصق نهاية مختلفة خلف كل نسخة.
بعد ذلك، ستغذي الروبوت بجميع النسخ الـ 1,000 واحدة تلو الأخرى (أو في كومة كبيرة).
الهدر: يتعين على الروبوت قراءة ومعالجة نفس الـ 80 صفحة 1,000 مرة منفصلة! الأمر يشبه طباخاً يقطع نفس البصلة 1,000 مرة فقط ليضيف توابل مختلفة إلى الحساء. هذا يستغرق وقتاً طويلاً ويملأ المطبخ (الذاكرة) بالأوراق غير المفيدة.
الحل: PSKV (المخطط المشترك)
أدرك مؤلفو هذه الورقة، شينهي وانغ وفريقه، أن الروبوت ليس بحاجة لإعادة قراءة التعليمات المملة المكونة من 80 صفحة في كل مرة. فالتعليمات لا تتغير أبداً؛ ما يتغير فقط هو النهاية.
لقد ابتكروا طريقة جديدة تسمى PSKV (ذاكرة KV المسبقة المشتركة - Prefix-Shared KV Cache). وإليك كيف تعمل:
القراءة لمرة واحدة: بدلاً من تصوير التعليمات 1,000 مرة، يقرأ الروبوت التعليمات المكونة من 80 صفحة مرة واحدة فقط. ثم يكتب "ورقة غش" (KV Cache) لكل ما تعلمه من تلك الصفحات.
البث السحري: الآن، عندما يحتاج الروبوت لاختبار الـ 1,000 نهاية مختلفة، فإنه لا يعيد قراءة التعليمات. بل يأخذ ورقة الغش الوحيدة تلك ويقول: "حسناً، استخدموا جميعاً ورقة الغش هذه كنقطة انطلاق لكم، ثم اقرأوا فقط النهاية الجديدة الخاصة بكم".
النتيجة: يوفر الروبوت كمية هائلة من الوقت لأنه لا يعيد القيام بالعمل الشاق المتمثل في قراءة التعليمات الطويلة. كما يوفر كمية هائلة من المساحة لأنه لا يحتفظ بـ 1,000 نسخة من التعليمات في ذاكرته.
لماذا يعد هذا أمراً هاماً
اختبرت الورقة هذا على ست طرق مختلفة لـ "الاختراق" وخمسة نماذج ذكاء اصطناه مختلف. وكانت النتائج مبهرة:
السرعة: كانت الهجمات أسرع بنسبة 40%. إنه يشبه الانتقال من قيادة سيارة في زحام مروري شديد إلى ركوب قطار فائق السرعة.
الذاكرة: استخدم الكمبيوتر ذاكرة أقل بنسبة 50%. وهذا أمر بالغ الأهمية لأن ذلك يعني أن الباحثين يمكنهم اختبار نماذج ذكاء اصطناعي أكبر وأذكى بكثير، والتي كانت ستؤدي سابقاً إلى تعطل الكمبيوتر بسبب نفاد المساحة.
الأمان: ظلت معدلات نجاح "الاختراق" كما هي تماماً. لم تجعل الطريقة الهجمات أضعف؛ بل جعلتها فقط أسرع.
تشبيه "المجموعات"
فكر في الأمر كحافلة مدرسية تنقل الطلاب.
الطريقة القديمة: تقود الحافلة إلى المدرسة، وتنزّل طالباً واحداً، ثم تعود إلى المدرسة، وتنزّل الطالب التالي، وتكرر ذلك 1,000 مرة. يعمل محرك الحافلة (الكمبيوتر) فوق طاقته لمجرد قيادة الحافلة الفارغة ذهاباً وإياباً.
طريقة PSKV: تقود الحافلة إلى المدرسة مرة واحدة. ثم تأخذ جميع الطلاب الـ 1,000 في نفس الوقت (لأنهم جميعاً يسكنون في نفس العنوان — "البادئة" أو الـ prefix). ثم تقودهم إلى وجهاتهم المختلفة (اللاحقات أو الـ suffixes).
الخلاية
تقدم هذه الورقة أداة "جاهزة للاستخدام" تجعل اختبار أمن الذكاء الاصطناعي أكثر كفاءة. من خلال إدراك أن "الجزء الممل" من السؤال هو نفسه في كل اختبار، وجدوا طريقة لمنع الكمبيوتر من تكرار نفس العمل مراراً وتكراراً. وهذا يسمح لخبراء الأمن باختبار نماذج الذكاء الاصطناعي بشكل أكثر شمولاً وسرعة، مما يساعد في العثور على الثغرات الأمنية وإصلاحها قبل أن يستغلها المهاجمون.
إليك ملخص تقني مفصل لورقة البحث بعنوان "تسريع هجمات كسر الحماية باللاحقات باستخدام ذاكرة التخزين المؤقت للمفاتيح والقيم المشتركة للبادئات" (Accelerating Suffix Jailbreak attacks with Prefix-Shared KV-cache):
1. بيان المشكلة
تعد هجمات كسر الحماية باللاحقات (Suffix jailbreak attacks) مكونًا حاسمًا في عمليات "اختبار الاختراق" (Red-teaming) للنماذج اللغوية الكبيرة (LLMs)، حيث يتم توليد لاحقات معادية لتجاوز ضوابط السلامة واستخراج محتوى ضار. ومع ذلك، تواجه هذه الهجمات عنق زجاجة حوسبيًا شديدًا:
التقييم التكراري: تتطلب أساليب مثل GCG وAutoDAN وBEAST تقييم آلاف اللاحقات المرشحة مقابل نموذج لغوي مستهدف للعثور على كسر حماية فعال.
الحوسبة الزائدة عن الحاجة: في كل تكرار، تظل "التعليمات الضارة" (البادئة - prefix) ثابتة بينما تتغير اللاحقة فقط. تقوم محركات الاستدلال القياسية بإعادة حساب حالات المفتاح-القيمة (KV) لهذه البادئة الطويلة بشكل مكرر لكل لاحقة مرشحة.
انفجار الذاكرة: تتطلب تطبيقات ذاكرة التخบั الموقت KV القياسية (مثل PyTorch) تكرار ذاكرة التخزين المؤقت KV للبادئة N من المرات لتتناسب مع حجم الدفعة (Batch size) لـ N من المرشحين. وبما أن البادئة غالبًا ما تكون أطول من اللاحقة، فإن هذا يؤدي إلى استهلاك مفرط للذاية، مما يحد من حجم الدفعة وعرض البحث، أو يتسبب في أخطاء "نفاد الذاكرة" (OOM).
عدم التوافق مع الأنظمة المتقدمة: تفتقر محركات الاستدلال المتطورة مثل vLLM وSGLang، التي تحسن خدمة تعدد المستخدمين، إلى نوى الانتشار العكسي (Backpropagation kernels) المطلوبة لهجمات كسر الحماية القائمة على التدرج (Gradient-based)، مما يقيد فائدتها في الأساليب التي لا تعتمد على التدرج فقط.
يقترح المؤلفون إطار عمل PSKV، وهو إطار تحسين استدلال قابل للتركيب والتشغيل (Plug-and-play) مصمم خصيصًا للزيادة الهيكلية في هجمات كسر الحماية.
الآلية الجوهرية
ذاكرة تخزين مؤقت واحدة للبادئة: بدلاً من تكرار ذاكرة التخزين المؤقت KV للتعليمات الضارة الثابتة (x(h)) لكل مرشح، يقوم PSKV بحساب ناقلات KV للبادئة مرة واحدة وتخزينها في ذاكرة تخزين مؤقت مشتركة واحدة.
البث الطبقي (Layer-wise Broadcasting): أثناء استدلال K⋅q من اللاحقات المرشحة، يسترجع PSKV ذاكرة التخบั الموقت KV للبادئة المشتركة ويقوم ببثها (تكرارها) إلى طبقة الانتباه المحددة التي يتم معالجتها.
التوسع الطبقي: من الضروري أن يحدث هذا التكرار طبقة تلو الأخرى. يقوم النظام فقط بالاحتفاظ بالرؤية الموسعة لـ KV للطبقة الحالية في الذاكرة، ويتخلص منها قبل الانتقال إلى الطبقة التالية. هذا يمنع التخزين المتزامن للبيانات الزائدة عبر كامل هيكل الشبكة، مما يقلل بشكل كبير من ذروة استخدام الذاكرة.
المحاذاة المتمحورة حول اللاحقة (Suffix-Centric Alignment)
للتعامل مع الهجمات المجمعة التي تتضمن تعليمات ضارة متعددة ومتميزة (سيناريوهات التعليمات المتعددة)، قدم المؤلفون استراتيجية المحاذاة المتمحورة حول اللاحقة:
استراتيجية الحشو (Padding Strategy): يتم حشو التعليمات من جهة اليسار (Left-padded)، وحشو الاستجابات المستهدفة من جهة اليمين (Right-padded).
تكوين الموتر الكثيف (Dense Tensor Formation): يضمن ذلك محاذاة جميع اللاحقات المولدة عند نفس مؤشر العمود، مما يشكل مصفوفة توكنات كثيفة. يسمح هذا بعمليات متجهة محسنة للغاية (مثل PyTorch) والبث الفعال لملفات تعريف البادئة المشتركة عبر بُعد المرشحين.
تحليل التعقيد
التعقيد الحوسبي: يحافظ PSKV على نفس التعقيد الحسابي لذاكرة التخزين المؤقت KV القياسية (إلغاء حسابات البادئة الزائدة) ولكنه يتجنب الأعباء الإضافية لمحركات الخدمة العامة.
تعقيد الذاكرة:
ذاكرة التخزين المؤقت KV القياسية:O(Ncand⋅Nprefix) (تتوسع الذاكرة خطيًا مع إجمالي عدد المرشحين).
PSKV:O(B⋅Nprefix+Ncand⋅Nsuffix) (تتوسع الذاكرة مع عدد البرومبتاتB، وليس إجمالي المرشحين). هذا يزيل فعليًا حاجز الذاكرة لعرض البحث الواسع.
3. المساهمات الرئيسية
تحديد التكرار: حددت الورقة أن التخزين المؤقت للاستدلال العام غير فعال لهجمات كسر الحماية لأنها تتجاهل النمط الهيكلي "بادئة واحدة لعدة لاحقات".
إطار عمل PSKV: يقترح إطار عمل خفيف الوزن ومعتمد على نوع العمل، يتميز بـ البث الافتراضي لذاكرة التخزين المؤقت ومحاذاة التوتر المتمحورة حول اللاحقة لإزالة حسابات البادئة الزائدة وتكرار الذاكرة.
الحفاظ على التدرج: على عكس محركات الاستدلال المغلفة (vLLM/SGLang)، يتكامل PSKV بسلاسة في مسارات الهجوم الحالية (بما في ذلك الهجمات القائمة على التدرج) دون التضحة بالوصول إلى التدرجات.
تقييم شامل: تم التحقق من صحته عبر ستة هجمات لاحقة متنوعة (GCG, GCQ, AutoDAN, BEAST, AmpleGCG, AdvPrompter) وخمسة نماذج لغوية شهيرة (Vicuna, Llama-2/3, Mistral, Qwen).
4. النتائج التجريبية
قام المؤلفون بتقييم PSKV على وحدتي GPU من نوع 2x 80GB A100. تشمل النتائج الرئيسية ما يلي:
الحفاظ على الأداء: PSKV "محايد في الأداء". ظل معدل نجاح الهجوم (ASR) متسقًا إحصائيًا مع الأساليب المرجعية (التقلبات كانت ضمن نطاق الضوضاء العشوائية)، مما يثبت أن التحسين لا يغير منطق الهجوم.
التسريع:
قلل وقت الاستدلال بنسبة ~40% في المتوسط مقارنة بالأساليب المرجعية غير المعززة.
حقق نسب تسريع تتراوح بين 1.4x إلى 1.95x اعتمادًا على نوع الهجوم (على سبيل المثال، شهد AutoDAN تسريعًا يقرب من ضعفين بسبب عدد خطوات الاستدلال العالي لديه).
تفوق على تطبيقات ذاكرة التخزين المؤقت KV القياسية أو ساواها دون تكبد عقوبات زمنية.
كفاءة الذاكرة:
قلل ذروة استخدام الذاكرة بنسبة ~50% مقارلة بتطبيقات ذاكرة التخزين المؤقت KV القياسية.
مكّن الهجمات التي كانت تؤدي سابقًا إلى أخطاء OOM (نفاد الذاكرة) مع التخزين المؤقت القياسي من العمل بنجاح.
أظهر قابلية التوسع: أدى زيادة عرض البحث (حجم الدفعة) إلى زيادات طفيفة في ذروة الذاكرة، حيث أصبح تكلفة الذاكرة تهيمن عليها التوترات الوسيطة بدلاً من الذاكرة المؤقتة نفسها.
المقارنة مع SOTA: بينما تعد محركات vLLM وSGLang أسرع للهجمات التي لا تعتمد على التدرج (مثل BEAST)، إلا أنها لا تستطيع دعم الهجمات القائمة على التدرج. يسد PSKV هذه الفجوة، حيث يقدم كفاءة مماثلة لهذه المحركات مع دعم كامل لمجموعة الهجمات التدرجية.
5. الأهمية
اختبار اختراق قابل للتوسع: يخفض PSKV الحاجز الحوسبي لتقييم سلامة النماذج اللغوية الكبيرة، مما يسمح للباحثين بتوسيع التقييمات لنماذج أكبر ومساحات بحث أوسع كانت تعتبر سابقًا باهظة التكلفة حوسبيًا.
تحسين عالمي: يعمل كتحسين "جاهز للاستخدام" (Drop-in) لمنظومة هجمات كسر الحماية باللاحقات بأكملها، بغض النظر عما إذا كانت قائمة على التدرج أو قائمة على النموذج.
نموذج الكفاءة: تسلط الورقة الضوء على أهمية التحسينات المخصصة لأعباء العمل مقارنة بمحركات الاستدلال العامة للمهام الأمنية المتخصصة، مما يثبت أن دمج الأنماط الهيكلية (مثل البادئات المشتركة) في نواة الاستدلال يحقق كفاءة فائقة.
في الختام، يحول PSKV عملية كسر الحماية باللاحقات من عملية مقيدة بالذاكرة وبطيئة إلى عملية عالية الكفاءة وقابلة للتوسع، مما يسهل إجراء تقييمات سلامة أكثر صرامة وشمولية للنماذج اللغوية الكبيرة.