NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation
يُعد NeuronFuzz إطار عمل للفحص (fuzzing) من نوع الصندوق الأبيض (white-box)، حيث يستفيد من تنشيطات عصبونات السلامة الداخلية كتعليقات مستمرة وقابلة للتفاضل لتحديد مواضع المطالبات الحساسة للسلامة بكفاءة وتوليد هجمات كسر حماية (jailbreak) فعالة دون الحاجة إلى توليد استجابة كاملة، مما يتفوق بشكل كبير على الأساليب الحالية في اكتشاف الثغرات عبر مختلف النماذج اللغوية الكبيرة (LLMs).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: NeuronFuzz
بيان المشكلة
يعد تقييم السلامة أمرًا بالغ الأهمية لضمان بقاء النماذج اللغوية الكبيرة (LLMs) المتوافقة قوية ضد هجمات الاختراق (jailbreak). ومع ذلك، تعتمد طرق الاختبار الآلي الحالية بشكل كبير على التغذية الراجعة على مستوى الاستجابة. في هذا النموذج، يجب تقديم كل مطالبة (prompt) مرشحة إلى النموذج المستهدف، وتوليد استجابة عبر فك التشفير التلقائي (autoregressive decoding)، ثم تقييم المخرجات بواسطة مصنف أو حكم. يفرض هذا النهج قيودين أساسيين:
- تغذية راجعة بحثية متفرقة: في النماذج شديدة التوافق، يتم رفض معظم المطالبات المعدلة، مما يؤدي إلى نفس نتيجة "الفشل". لا يمكن للتقييم على مستوى الاستجابة التمييز بين مطالبة تركت آلية السلامة دون تغيير، وبين مطالبة أضعفتها بشكل كبير ولكنها فشلت في إنتاج اختراق ناجح. هذا النقص في التفاصيل يترك أدوات الفحص (fuzzers) بقدرة محدودة على تحديد المرشحات التي يجب الاحتفاظ بها.
- توليد استجابة مكلف: إن توليد استجابة كاملة لكل مرشح مكلف حاسوبيًا مقارلة بمعالجة مدخلات المطالبة وحدها. وهذا يخلق عقبة أمام القابلية للتوسع في عمليات الفحص الآلي، والتي تتطلب تقييم أعداد كبيرة من المرشحات.
المنهجية: NeuronFuzz
يقترح البحث NeuronFuzz، وهو إطار عمل للفحص (fuzzing) بنظام الصندوق الأبيض (white-box)، يستبدل التقييم المكلف والمتفرق على مستوى الاستجابة بـ تغذية راجعة داخلية مستمرة مشتقة من تنشيطات عصبونات السلامة (safety-neuron activations). يعمل الإطار في مرحلتين رئيسيتين:
1. بناء مستشار السلامة (SafetyOracle)
جوهر NeuronFuzz هو مستشار سلامة (SafetyOracle) خفيف الوزن يقوم برسم خرائط لتنشيطات النموذج الداخلية إلى "درجة إنذار سلامة" مستمرة ().
- استخراج التنشيط غير المرتبط بالقوالب: لضمان أن الإشارة تلتقط النية الضارة بدلاً من سمات قالب الاختراق، قام المؤلفون ببناء أزواج من المدخلات التي تشترك في نفس قالب الاختراق ولكنها تحتوي إما على حمولات ضارة أو حمولة حميدة. يقومون باستخراج التنشيطات من إسقاطات البوابة (gate) والرفع (up projections) لكتل MLP في المحول (Transformer) خلال مرحلة التعبئة المسبقة (prefill stage) (قبل توليد الاستجابة).
- اختيار العصبونات الواعي بالاستقرار: التنشيطات الخام عالية الأبعاد ومشوشة. يستخدم المؤلفون عملية اختيار استقرار قائمة على "Bootstrap" لتحديد مجموعة مدمجة من "عصبونات السلامة". هذه هي العصبونات التي تظهر باستمرار معاملات إيجابية للمدخلات الضارة عبر مجموعات التدريب المعاد أخذ عيناتها، مما يضمن القوة ضد تباين العينات.
- رأس التسجيل (Scoring Head): يتم تدريب نموذج انحدار لوجستي مع تنظيم (Elastic Net) لرسم خرائط تنشيطات العصبونات المختارة إلى درجة مستمرة . تشير الدرجة الأعلى إلى إدراك داخلي أقوى للنية الضارة، بينما تشير الدرجة الأقل إلى أن آلية السلامة يتم تجاوزها.
2. خط أنابيب الفحص الموجه بالتدرج (Gradient-Guided Fuzzing Pipeline)
يدمج NeuronFuzz مستشار السلامة في حلقة فحص تتجنب توليد الاستجابة للمرشحات المتوسطة:
- جدولة البذور (Seed Scheduling): يستخدم البحث عن الشجرة بمونت كارلو (MCTS) لاختيار قوالب الاختراق الواعدة للتحوير (mutation).
- التحوير الموجه بالتدرج: بما أن درجة مستشار السلامة قابلة للاشتقاق بالنسبة لتضمينات المدخلات (input embeddings)، فإن الإطار يحسب التدرجات لتحديد مواضع الرموز (tokens) الحساسة للسلامة داخل القالب.
- التحوير المتوافق مع السياق: يتم استخدام نموذج لغة مقنع (MLM) لتوليد بدائل سلسة للمواضع الحساسة المختارة. من المهم أن التحويرات تقتصر على قالب الاختراق فقط؛ حيث تظل الحمولة الضارة ثابتة. هذا يحافظ على بنية اللغة الطبيعية والنية الضارة الجوهرية مع استكشاف التغييرات في صياغة المطالبة.
- حلقة التغذية الراجعة: يتم تقييم المرشحات عبر تمريرة تعبئة مسبقة فقط (prefill-only pass) لجمع تنشيطات عصبونات السلامة. يقوم مستشار السلامة بتعيين درجة مستمرة، والتي تعمل كإشارة مكافأة لتحديث مجدول البذور. يقوم النموذج المستهدف فقط بتوليد استجابة للتحقق النهائي من نجاح الاختراق.
المساهمات الرئيسية
- منظور جديد للفحص: يقدم استخدام تنشيطات عصبونات السلامة الداخلية كتغذية راجعة للتنفيذ، مستبدلاً التقييم المكلف على مستوى الاستجابة بإشارة مستمرة متاحة أثناء التعبئة المسبقة.
- تصميم مستشار السلامة (SafetyOracle): يطور مستشارًا خفيف الوزن يعتمد على استخراج التنشيط غير المرتبط بالقوالب واختيار العصبونات الواعي بالاستقرار. درجاته القابلة للاشتقاق توجه كل من ترتيب المرشح وتحديد مواقع مواضع القالب الحساسة للسلامة.
- إطار عمل NeuronFuzz: يجمع بين التغذية الراجعة المقتصرة على التعبئة المسبقة والتحوير الموجه بالتدرج باستخدام الرموز المقنعة لاستكشاف قوالب الاختراق بكفاءة مع الحفاظ على الحمولة الضارة وبنية اللغة الطبيعية.
- التقييم المكثف: يتحقق من النهج عبر 21 نموذجًا نصيًا ومتعدد الوسائط، مما يثبت التحسينات في اكتشاف الاختراق، والكفاءة، والقابلية للنقل.
النتائج التجريبية
قيم المؤلفون NeuronFuzz على خمسة نماذج مصدر بيضاء (DeepSeek-R1-14B, GPT-OSS-20B, Gemma-3-4B-it, Gemma-4-E4B-it, Llama-3.1-8B-Instruct) واختبروا قابليته للنقل على 16 نموذجًا مستهدفًا إضافيًا (بما في ذلك واجهات برمجة التطبيقات المملوكة).
- معدل اكتشاف الاختراق (JDR): حقق NeuronFuzz معدل اكتشاف يتراوح بين 76-100% عبر النماذج الخمسة، متفوقًا على النماذج المرجعية (GCG, AutoDAN, PAIR, LLM-Fuzzer) بما يصل إلى 48 نقطة مئوية في النماذج شديدة التوافق (على سبيل المثال، 96% على GPT-OSS-20B مقابل 48% لـ LLM-Fuzzer).
- الكفاءة: من خلال إلغاء توليد الاستجابة للمرشحات المتوسطة، حقق NeuronFuzz عدد استجابات لكل اكتشاف (RGD) قدره 1.0 (توليد استجابة واحدة فقط للتحقق النهائي). أدى هذا إلى تقليل وقت النهاية إلى النهاية (ETD) لكل اكتشاف بشكل كبير مقارنة بالنماذج المرجعية، التي تطلبت غالبًا مئات من عمليات توليد الاستجابة.
- القوالب العالمية: نجح الإطار في تحسين القوالب المشتركة التي تعمم عبر مختلف الحمولات الضارة، محققًا معدل نجاح هجوم تجميعي (EASR) قدره 92.6% (لأفضل 5 قوالب) على الأهداف ذات الصندوق الأبيض.
- القابلية للنقل: انتقلت القوالب المحسنة بصفر محاولة (zero-shot) إلى النماذج المستهدفة ذات الأوزان المفتوحة وواجهات برمجة التطبيقات المملوكة. في النماذج ذات الأوزان المفتوحة، حقق النهج متوسط ASR قدره 69.6% وEASR لأفضل 5 قوالب قدره 92.6%. وفي واجهات برمجة التطبيقات المملوكة، حقق متوسط ASR قدره 44.1% وEASR لأفضل 5 قوالب قدره 60.0%.
- صلاحية المستشار: أظهرت درجة إنذار السلامة ارتباطًا سلبيًا قويًا (معاملات Spearman ) مع معدلات نجاح الاختراق، مما يؤكد أن درجات السلامة الداخلية المنخفضة تتنبأ بشكل موثوق بالاختراقات الناجحة حتى قبل توليد الاستجابة.
الأهمية والادعاءات
يدعي البحث أن NeuronFuzz يعالج عدم الكفاءة الجوهري في اختبارات السلامة الآلية الحالية من خلال الاستفادة من الحالة الداخلية للنماذج اللغوية الكبيرة. تكمن أهميته في:
- التغلب على التفرّق: توفير إشارة تغذية راجعة كثيفة ومستمرة تسم تسمح لأدوات الفحص بالتمييز بين المرشحات الفاشلة "الواعدة" وغير "الواعدة"، وهي قدرة تفتقر إليها الأساليب القائمة على مستوى الاستجابة.
- القابلية للتوسع: تقليل التكلفة الحاسوبية لتقييم السلامة بشكل جذري من خلال إزالة الحاجة إلى فك التشفير التلقائي أثناء مرحلة البحث.
- القوة: إثبات أن إشارات السلامة الداخلية تظل معلوماتية حتى في النماذج شديدة التوافق حيث تكون التغذية الراجعة على مستوى الاستجابة غالبًا ثنائية وغير مفيدة.
يضع المؤلفون NeuronFuzz كأداة للمقيمين المصرح لهم (المطورين، المدققين) لتحديد نقاط ضعف السلامة بشكل منهجي قبل النشر، وكوسيلة للمهاجمين لتحسين الاختراقات القابلة للنقل، مما يسلط الضوء على الطبيعة مزدوجة الاستخدام لتحليل النماذج الداخلية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.