Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
تقترح هذه الورقة "الدفاع المعزز بالاسترجاع" (RAD)، وهو إطار عمل لا يتطلب تدريباً يستفيد من قاعدة بيانات لأمثلة هجمات معروفة للكشف عن استراتيجيات كسر الحماية الخبيثة واستنتاجها، مما يوفر حماية تكيفية وموازنة قابلة للتحكم بين السلامة والمنفعة للنماذج اللغوية الكبيرة.
تخيل الإنترنت كمكتبة ضخمة تعج بالحركة، حيث أمهر وأذكى المكتبيين هم الذكاء الاصطناعي. هؤلاء المكتبيون من الذكاء الاصطناعي، المعروفون باسم النماذج اللغوية الكبيرة (LLMs)، يمكنهم كتابة القصائد، وحل المسائل الرياضية، والدردشة حول أي شيء يمكنك تخيله. إنهم مفيدون للغاية، لكن لديهم كتاب قواعد صارم: فقد تمت برمجتهم على عدم تقديم تعليمات خطيرة، مثل كيفية صنع قنبلة أو سرقة هوية شخص ما. ومع ذلك، تماماً كما يمكن لطفل ذكي أن يخدع معلماً صارماً عبر طرح سؤال بطريقة ماكرة، وجد المتربصون طرقاً لـ "كسر الحماية" (jailbreak) لهؤلاء المكتبيين من الذكاء الاصطناعي. إنهم يلفون طلباتهم الخطيرة في أزياء تنكرية فاخرة — مثل التظاهر بكتابة سيناريو فيلم أو لعب دور في لعبة تقمص أدوار — لخداع الذكاء الاصطناعي لجعله ينسى قواعده ويبوح بالأسرار. المشكلة الكبيرة تكمن في أن هؤلاء "المحتالين" يتغيرون بسرعة أكبر مما يمكن للمطورين تعليم الذكاء الاصطناعي قواعد جديدة؛ ففي كل مرة يسدون فيها ثغرة، تظهر ثغرة أخرى، وتعليم الذكاء الاصطناعي تعلم كل هذه الحيل الجديدة يتطلب عادةً عملية إعادة تدريب ضخمة ومكلفة وبطيئة.
هنا يأتي دور فكرة جديدة تسمى "الدفاع المعزز بالاسترجاع" (Retrieval-Augmented Defense - RAD)، والتي اقترحها باحثون من جامعة كامبريدج. فكر في RAD ليس كمعلم يحاول حفظ كل حيلة ممكنة، بل كحارس أمن فائق الذكاء يمتلك ألبوماً لصور "المطلوبين" محدثاً باستمرار. بدلاً من إجبار الذكاء الاصطناعي على إعادة تعلم شخصيته بالكامل في كل مرة تظهر فيها حيلة جديدة، يعمل RAD كشرطي واقف عند الباب. عندما يطرح مستخدم سؤالاً، لا ينظر RAD إلى الكلمات فحسب؛ بل يتصفح بسرعة ألبوم صوره للحيل المعروفة ليرى ما إذا كان السؤال الحالي يرتدي تنكراً. إذا وجد تطابقاً، فإنه ينزع القناع ليكشف عن النية الخطيرة الحقيقية الكامنة تحته. إذا كانت النية سيئة، يوقف الحارس الطلب. وإذا كان السؤال غير ضار، يمرره الحارس لكي يقوم المكتبي من الذكاء الاصطناعي بعمله.
وجد الباحثون أن نهج "ألبوم الصور" هذا يغير قواعد اللعبة. ففي اختباراتهم، أظهروا أن RAD يمكنه إيقاف هجمات كسر الحماية القوية والجديدة — مثل أساليب "PAIR" و"PAP" التي تخدع نماذج الذكاء الاصطناعي عادةً — دون الحاجة إلى إعادة تدريب الذكاء الاصطناعي على الإطلاق. الأمر يشبه تحديث ألبوم صور حارس الأمن بصورة جديدة لمجرم اليوم، ليكون الحارس جاهزاً للإمساك به غداً. والأفضل من ذلك، أن النظام قابل للضبط؛ إذ يمكن للأشخاص الذين يديرون الذكاء الاصطناعي تحديد مدى صرامة الحارس. يمكنهم ضبط الحارس ليكون حذراً للغاية (يمسك بكل الأشرار تقريباً ولكنه يوقف بعض الأبرياء أحياناً) أو أكثر استرخاءً (يسمح بمرور المزيد من الناس ولكنه يمسك بعدد أقل من الأشرار). هذا التوازن أمر بالغ الأهمية لأنك لا تريد نظام أمن صارماً لدرجة أنه يرفض الإجابة على أسئلة بسيطة مثل "ما هي حالة الطقس؟".
تشير الورقة البحثية إلى أن هذه الطريقة فعالة للغاية في الحفاظ على سلامة الذكاء الاصطناست مع بقائه مفيداً. ففي التجارب، نجح RAD في تقليل معدل نجاح هذه الهجمات الماكرة بشكل كبير، حيث خفضها إلى ما يقرب من الصفر في حالات كثيرة، بينما سمح للذكاء الاصطناعي بالإجابة على الأسئلة العادية بشكل صحيح. كما أظهر الباحثون أنه كلما أضافوا المزيد من الأمثلة على الهجمات الجديدة إلى ألبوم الصور، أصبح النظام أفضل في كشف تلك الحيل الجديدة المحددة دون أن ينسى كيفية كشف الحيل القديمة. إنه درع مرن "لا يتطلب تدريباً" ينمو ويصبح أكثر ذكاءً ببساطة عن طريق إضافة صور جديدة إلى الألبوم، مما يقدم طريقة واعدة لإبقاء مساعدينا من الذكاء الاصطناعي آمنين ومفيدين في عالم يبتكر فيه المتربصون باستمرار طرقاً جديدة للتسلل عبر القواعد.
ملخص تقني: الدفاع المعزز بالاسترجاع (RAD)
بيان المشكلة
لا تزال النماذج اللغوية الكبيرة (LLMs) عرضة لهجمات الاختراق (jailbreak attacks)، حيث يقوم الفاعلون الخبثاء بتعديل المدخلات لاستدراج استجابات ضارة أو غير أخلاقية. تواجه آليات الدفاع الحالية تحديين رئيسيين:
القابلية للتكيف: إن الظهور السريع لاستراتيجيات هجوم متنوعة ومتطورة يجعل من الصعب تحديث أنظمة الدفاع دون إعادة تدريب مكلفة للنماذج.
المفاضلة بين السلامة والمنفعة: تؤدي استراتيجيات الدفاع الشديدة غالبًا إلى معدلات رفض مرتفعة للطلبات الحميدة (حظر الاستعلامات السليمة)، بينما تفشل الاستراتيجيات المتساهلة في حظر المحتوى الضار. هناك حاجة لآلية يمكنها التحكم في هذه المفاضلة بناءً على متطلبات النشر وتفاوت مستويات المخاطر.
المنهجية: الدفاع المعزز بالاسترجاع (RAD)
يقترح المؤلفون إطار عمل الدفاع المعزز بالاسترجاع (RAD)، وهو إطار عمل خالٍ من التدريب يستخدم التوليد المعزز بالاسترجاع (RAG) والتحصين الجماعي (ensemble classification) للكشف عن محاولات الاختراق. بخلاف الدفاعات القائمة على RAG السابقة التي تتدخل في عملية توليد الاستجابة، يعمل RAD كنظام كشف مستقل.
المكونات الأساسية
يتكون مسار RAD من مرحلة بناء قاعدة بيانات غير متصلة بالإنترنت (offline) وخمس خطوات معالجة متصلة بالإنترنت (online):
بناء قاعدة البيانات:
يتم بناء قاعدة بيانات تحتوي على أزواج من استعلامات المستخدم الأصلية (qi) ونصوص الاختراق المقابلة لها (xi).
باستخدام نموذج لغوي كبير (LLM)، يستنتج النظام استراتيجية الاختراق الضمنية (S~i) وإرشادات الاستخراج (G~i) لكل مدخل.
يعمل نص الاختراق xi كمفتاح للاسترجاع عبر التضمين النصي الكثيف (dense text embedding retrieval).
مسار الكشف المتصل بالإنترنت:
الاسترجاع (Retrieve): بالنظر إلى مدخل جديد x، يقوم النظام باسترجاع أكثر الأمثلة تشابهًا مع نصوص الاختراق من قاعدة البيانات باستخدام تشابه جيب التمام (cosine similarity).
إعادة الترتيب (Rerank): يتم إعادة ترتيب المجموعة المسترجعة لضمان صلة الاستراتيجيات المستنتجة. تم اقتراح طريقتين للتنقيط:
تنقيط PMI: يستخدم المعلومات المتبادلة النقطية (Pointwise Mutual Information) لقياس الارتباط بين الاستراتيجية والمدخل.
تنقيط احتمالية الاستراتيجية: يستخدم احتمالية الاستراتيجية بالنظر إلى المدخل.
يتم تضمين عنصر "لا توجد استراتيجية" للتعامل مع الاستعلامات الحميدة.
الاستخراج (Extract): لكل زوج (استراتيجية-إرشادات) من الأعلى ترتيبًا، يقوم نموذج لغوي كبير باستخراج استعلام مستخدم أصلي مرشح (qˉj) من نص المدخل، وهو ما يمثل محاولة لعكس عملية تحويل الهجوم.
التصنيف (Classify): يحسب النظام احتمالية الضرر لكل استعلام مستخرج (Pj) مشروطًا بالاستعلام، والاستراتيجية، والمدخل الأصلي.
التصويت (Vote): يتم تجميع الاحتمالات الفردية عبر التصويت بالأغلبية (المتوسط) أو التصويت الموزون (الموزون باحتمالية اللاحقة المشتركة) لإنتاج احتمالية الضرر النهائية P(harmful∣x).
القرار والتحكم:
تتم مقارنة الاحتمالية النهائية بعتبة قابلة للضبط τ. إذا كان P(harmful∣x)≥τ، يصدر النظام رفضًا قاطعًا؛ وإلا، يتم تمرير النص إلى النموذج اللغوي المستهدف.
يسمح تعديل τ للممارسين بالتحكم الصريح في التوازن بين السلامة (حظر النصوص الضارة) والمنفعة (الحفاظ على الاستجابات الحميدة).
المساهمات الرئيسية
القابلية للتكيف دون تدريب: يتيح RAD التحديث المستمر ببسال إضافة أمثلة هجوم جديدة إلى قاعدة البيانات. وهذا يسمح للنظام بمواجهة استراتيجيات الاختراق الناشئة (مثل متغيرات PAIR أو PAP الجديدة) دون الحاجة لإعادة تدريب النماذج الأساسية.
أداء دفاعي قوي: يقلل RAD بشكل كبير من فعالية هجمات الاختراق القوية (بما في ذلك هجمات PAP وPAIR وTemplate) عبر نماذج مستهدفة متعددة (Qwen, GPT-4o, Luma) مع الحفاظ على معدلات منخفضة للرفض الخاطئ للاستعلامات الحميدة.
مفاضلة قابلة للتحكم بين السلامة والمنفعة: قدم المؤلفون مخطط تقييم يعتمد على منحنيات التشغيل (درجة الدفاع مقابل ميزانية معدل الرفض الخاطئ). يُظهر RAD حدود باريتو (Pareto frontier) قوية، مما يسمح للمستخدمين باختيار نقاط التشغيل التي تتوافق مع مستويات تحمل المخاطر الخاصة بتطبيقاتهم.
الحفاظ على المنفعة: باعتباره نظام كشف فقط، يتجنب RAD التعديلات المطلوبة على النصوص التي تتطلبها الدفاعات الأخرى (مثل تحليل النية أو استرجاع سياق السلامة)، مما يحافظ على أداء النموذج المستهدف في مهام الأسئلة والأجوبة العامة (AlpacaEval 2.0, MMLU).
النتائج التجريبية
أجريت التجارب على معيار StrongREJECT ومجموعات بيانات الأسئلة والأجوبة العامة:
تخفيف الهجمات: خفض RAD درجات الهجوم بشكل كبير في StrongREJECT. على سبيل المثال، ضد هجوم PAP على Qwen-2.5-14B-Instruct، خفض RAD-Base-14B درجة الهجوم من 81.51 (بدون دفاع) إلى 30.91. وضد هجمات Template وDAN، حقق RAD درجات هجوم تقترب من الصفر.
القابلية للتكيف: عند إضافة أمثلة هجوم جديدة (مثل ReNeLLM وSATA) إلى قاعدة البيانات، تحسن أداء RAD بشكل كبير ضد هذه الهجمات المحددة دون تدهور الأداء في الهجمات التي تمت رؤيتها سابقًا (مما يدل على عدم حدوث نسيان كارثي).
المنفعة: حافظ RAD على معدلات الفوز في AlpacaEval 2.0 والدقة في MMLU بشكل متطابق تقريبًا مع الخط المرجعي غير المدافع، بينما تسببت الطرق الأخرى (مثل تحليل النية) في تدهور كبير في منفعة النموذج.
القابلية للتوسع: ظل النظام مستقرًا وفعالًا حتى عند توسيع قاعدة البيانات لتشمل أكثر من 500,000 مثال.
الأهمية والادعاءات
يزعم البحث أن RAD يقدم حلاً عمليًا وقابلاً للتوسع لسلامة النماذج اللغوية الكبيرة يعالج قيود آليات الدفاع الحالية. تكمن أهميته الأساسية في:
فك الارتباط بين الدفاع والتدريب: من خلال الاستفادة من نهج قائم على الاسترجاع، فإنه يلغي الحاجة إلى دورات إعادة تدريب مكلفة للتكيف مع التهديدات الجديدة.
التحكم الصريح: يوفر آلية للمشغلين لضبط المفاضلة بين السلامة والمنفعة، مع الإقرار بأن سيناريوهات النشر المختلفة تتطلب مستويات مختلفة من الصرامة.
التعميم: أظهر تعميماً قوياً ضمن عائلات الهجوم (على سبيل المثال، الدفاع ضد PAIR-5 باستخدام أمثلة PAIR-1 فقط) وعبر نماذج مستهدفة متنوعة.
يشير المؤلفون إلى بعض القيود، بما في ذلك التركيز الحالي على المدخلات النصية فقط (لم يتم توسيعها بعد إلى البيئات متعددة الوسائط) والاعتماد على التعريفات المحددة للضرر الموجودة في معيار StrongREJECT. ويؤكدون أن النظام مصمم حصريًا للكشف وأن قاعدة بيانات أمثلة الهجوم مقصورة على الباحثين المصرح لهم لمنع إساءة الاستخدام.