Do LLMs Know Their Vulnerable Scenarios?
تقدم هذه الورقة البحثية \textsc{Concept2Scenario}، وهو إطار عمل للتفسير الآلي (mechanistic interpretability) يحدد اتجاهات السيناريوهات الداخلية التي تقمع الرفض، ويترجمها إلى سيناريوهات لغوية طبيعية قابلة للتفسير، ويثبت أن هذه السيناريوهات المكتشفة ترفع معدلات نجاح عمليات الاختراق (jailbreak) بشكل كبير عبر نماذج متعددة مفتوحة المصدر ومتطورة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: هل تعرف النماذج اللغوية الكبيرة سيناريوهاتها الضعيفة؟
بيان المشكلة
تُدرب النماذج اللغوية الكبيرة (LLMs) المتوافقة مع معايير السلامة على رفض الطلبات الضارة عبر الضبط الدقيق الخاضع للإشراف والتعلم التعزيزي. ومع ذلك، تظل هذه النماذج عرضة لهجمات "كسر الحماية" (Jailbreak attacks)، حيث يتم صياغة مطالبات (prompts) بعناية للالتفاف على ضوابط السلامة. وتتمثل إحدى الاستراتيجيات الشائعة في تغليف الطلبات الضارة ضمن سيناريوهات محددة (مثل: البحث الأكاديمي، أو السرد القصصي الخيالي، أو مهام توليد الكود البرمجي) لإخفاء النوايا الضارة وإضعاف آليات الرفض.
بينما حددت جهود "الفريق الأحمر" (Red-teaming) تجريبياً سيناريوهات فعالة من خلال نتائج الهجوم المرصودة، إلا أن السبب الميكانيكي وراء إضعاف سيناريوهات معينة لآلية الرفض لا يزال غير واضح. لقد شخصت دراسات التفسير الميكانيكي الحالية اتجاهات الرفض وميزات كسر الحماية بشكل مستقل، لكنها لم تثبت وجود رابط سببي بين تفعيل تمثيل سيناريو معين وقمع اتجاه الرفض المحدد مسبقاً. علاوة على ذلك، لم تترجم هذه الدراسات مثل هذه العلاقات إلى سيناريوهات بلغة طبيعية قابلة للتفسير من أجل عمليات "الفريق الأحمر" المنهجية.
المنهجية: Concept2Scenario
يقترح المؤلفون إطار عمل Concept2Scenario، وهو إطار عمل قائم على المفاهيم مصمم لاكتشاف السيناريوهات الضعيفة من خلال تتبع سلوك كسر الحماية عبر فضاء المفاهيم الداخلي للنموذج. تعمل الطريقة بناءً على فرضية أن تغليف السيناريو يؤثر على الرفض من خلال تفعيل اتجاهات مفاهيم داخلية تعمل سببيًا على قمع نزعة الرفض لدى النموذج.
1. صياغة المشكلة
يتم تأطير عملية كسر الحماية كمسألة عزو سببي في فضاء التمثيل: .
- : الطلب الضار المغلف بالسيناريو.
- : نمط التنشيط الخاص بالنموذج عبر قاموس المفاهيم الداخلي.
- : نزعة الرفض الداخلية (درجة عددية).
- : سلوك الرفض الملحوظ.
الهدف هو تحديد المفاهيم التي يؤدي تنشيطها إلى تقليل سببياً، ومن ثم ترجمة هذه المفاهيم مرة أخرى إلى سيناريوهات لغة طبيعية تعيد تنشيطها.
2. تجسيد المفاهيم والرفض
- المفاهيم (): تم تدريب مُشفّر تلقائي متفرق (SAE) على مجموعة بيانات مختلطة من نصوص التدريب المسبق العامة (SlimPajama) والبيانات المتعلقة بالسلامة (BeaverTails) لتفكيك تمثيلات التيار المتبقي (residual stream) إلى مجموعة متفرقة من المفاهيم المتماسكة دلالياً.
- الرفض (): تم تدريب متجه تنشيط المفهوم (CAV) على مجموعة بيانات للرفض/عدم الرفض لتوفير درجة رفض عددية بناءً على تمثيل الطبقة الأخيرة للنموذج. يتم استخراج الدرجة عند الرمز (token) المحدد بعد المطالبة والذي يحمل أقصى معلومات الرفض التي أدخلها التوافق مع السلامة.
3. العزو السببي
- العزو الفردي: يتدخل المؤلفون في التيار المتبقي عن طريق إضافة اتجاه فك التشفيد لمفهوم معين بمقياس شدة تنشيطه عند المئين الخامس والعشرين. ويقيسون التغير في درجة الرفض (). تُحدد المفاهيم ذات قيم السالبة الكبيرة كعناصر مثبطة للرفض.
- عزو التفاعل: لإيجاد التأثيرات التآزرية، يتدخل المؤلفون في أزواج من المفاهيم في وقت واحد. ويحسبون حد التفاعل غير الإضافي (). تشير القيم السالبة إلى أن الزوج يثبط الرفض بقوة أكبر من مجموع التأثيرات الفردية، مما يوجه اختيار السيناريوهات المركبة.
4. الترجمة إلى سيناريوهات
تتم ترجمة مفاهيم تثبيط الرفض المحددة إلى سيناريوهات كسر حماية قابلة للتنفيذ من خلال حلقة تكرارية:
- جمع الأدلة: يجمع النظام النصوص التي يعمل فيها المفهوم بأقصى قوة (المقاطع ذات التنشيط العالي).
- التفسير: يقوم نموذج لغوي للتحليل (Gemini-3.1-Pro) بتلخيص النمط الموحد لهذه النصوص.
- التوليد: يقوم النموذج بتوليد وصف سيناريو باللغة الطبيعية، وآلية تحفيز، ومطالبة نموذجية (template).
- التحقق (بوابة التنشيط): يتم اختبار المطالبة المولدة على النموذج المستهدف. إذا لم يكن رتبة تنشيط المفهوم المصدر ضمن أعلى من الميزات، يتم تعديل المطالبة وإعادة اختبارها. تدخل السيناريوهات التي تم التحقق منها فقط إلى المكتبة النهائية.
المساهمات الرئيسية
- العزو الميكانيكي لكسر الحماية: صاغ البحث عملية كسر الحماية القائمة على السيناريو كمسألة عزو سببي في فضاء التمثيل، موضحاً أن التوجيه على طول اتجاهات السيناريوهات المتعلمة يقلل باستمرار من درجات الرفض.
- إطار عمل Concept2Scenario: طريقة مبتكرة تكتشف السيناريوهات الضعيفة مباشرة من المفاهيم الداخلية للنموذج. وهي تسد الفجوة بين التمثيلات الداخلية المجردة والسيناريوهات القابلة للتفسير باللغة الطبيعية، بما في ذلك تحديد تركيبات السيناريوهات التآزرية عبر عزو التفاعل.
- التحقق التجريبي: تم تقييم إطار العمل عبر ثلاثة نماذج مفتوحة المصدر (Qwen3.5-9B، LLaMA-3.1-8B، Ministral-3-8B)، واختبارين للسلامة (GuidedBench، HarmBench)، وست طرق لكسر الحماية بنظام الصندوق الأسود.
النتائج
- تحسن معدل نجاح الهجوم (ASR): أدى حقن السيناريوهات المكتشفة في طرق كسر الحماية الموجودة إلى تحسين متوسط معدل نجاح الهجوم (ASR) بما يصل إلى 18.2 نقطة مئوية في النماذج مفتوحة المصدر.
- قابلية الانتقال عبر النماذج: انتقلت السيناريوهات المكتشفة حصرياً من النماذج مفتوحة المصدر بفعالية إلى النماذج مغلقة المصدر (GPT-5، Claude-Haiku-4.5، وGemini-3-Flash)، مما يشير إلى وجود نقاط ضعف مشتركة في مستوى السيناريو عبر عائلات النماذج المختلفة.
- التركيبات التآزرية: حدد عزو التفاعل تركيبات السيناريوهات التي تفوقت على السيناريوهات الفردية والضوابط الإضافية، مما قلل من عدد الدورات المطلوبة لنجاح الهجمات التكرارية.
- نقاط الضعف الخاصة بالنماذج: كشف التحليل عن ملفات تعريف متميزة لنقاط الضعف لمختلف النماذج (على سبيل المثال، Qwen معرض للنماذج النصية الويب، بينما Ministral معرض للمدخلات المهيكلة برمجياً)، مما يشير إلى ضرورة تخصيص السيناريوهات الفعالة لتناسب بنيات النماذج المختلفة بدلاً من استخدام مجموعة عامة.
- سلامة الوكيل (Agent Safety): في التقييمات على معيار AgentHarm، أدت إعادة الكتابة الموجهة بالسيناريو إلى زيادة معدل إكمال سير العمل متعدد الخطوات الضار بنسبة 7.1 نقطة مئوية وزيادة معدل عدم الأمان على مستوى المسار بنسبة 9.7 نقطة.
الأهمية والادعاءات
يزعم البحث أن العزو على مستوى التمثيل يوفر إشارة مبدئية لاكتشاف سيناريوهات كسر الحماية الفعالة، متجاوزاً الاعتماد على المطالبات المصممة يدوياً أو المتراكمة تجريبياً. ومن خلال تحديد المفاهيم الداخلية التي تثبط الرفض سببياً، يوضح المؤلفون أن:
- تمتلك النماذج اللغوية الكبيرة "اتجاهات سيناريو" داخلية محددة، والتي عند تفعيلها، تضعف توافقها مع معايير السلامة.
- هذه الثغرات ليست عشوائية، بل هي مهيكلة، وقابلة للتفسير، وغالباً ما تكون مشتركة عبر عائلات النماذج المختلفة.
- يقدم إطار العمل المقترح نهجاً منهجياً ومؤتمتاً لعمليات "الفريق الأحمر" يمكنه توليد مقدمات قابلة لإعادة الاستخدام لتحسين معدلات نجاح الهجوم وتقليل كفاءة دفاعات السلامة.
يحافظ المؤلفون على موقف متواضع، مشيرين إلى أنه على الرغم من أن الطريقة تحسن بشكل كبير معدل نجاح الهجوم (ASR)، إلا أن حجم التحسن يختلف حسب قوة توافق النموذج (على سبيل المثال، مكاسب أقل على النماذج عالية التوافق مثل Qwen مقارنة بالنماذج الأقل توافقاً)، وأن قابلية الانتقال إلى النماذج المغلقة، رغم ملاحظتها، تشير إلى ثغرات مشتركة بدلاً من آليات داخلية متطابقة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.