Learning diverse attacks on large language models for robust red-teaming and safety tuning
تقترح هذه الورقة إطار عمل يعتمد على شبكات التدفق التوليدية (GFlowNet) لعمليات الاختبار الأحمر المؤتمتة، والذي يتغلب على قيود انهيار النمط التي تعاني منها مناهج التعلم المعزز الحالية لتوليد مطالبات هجوم متنوعة وفعالة، مما يتيح إنشاء نماذج لغوية كبيرة أكثر متانة ومضبوطة من حيث السلامة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الذكاء الاصطناعي سريع التطور، أصبحت النماذج اللغوية الكبيرة أدوات قوية قادرة على الكتابة، والاستنتاج، والمحادثة بطلاقة تشبه طلاقة البشر. ومع ذلك، تأتي هذه القدرة مع خطر جسيم: يمكن التلاعب بهذه الأنظمة لإنتاج محتوى ضار أو سام أو خطير. ولمنع حدوث ذلك، ينخرط المطورون في ممارسة تُعرف باسم "الفريق الأحمر" (red-teaming). تخيل فريق أمن تم استئجاره لاقتحام مبنى قبل انتقال الجمهور إليه؛ في المجال الرقمي، يتضمن "الفريق الأحمر" المحاولة المنهجية لخداع ذكاء اصطناعي لاستخراج نقاط ضعفه. والهدف هو العثور على أسئلة أو تعليمات محددة، تسمى "المطالبات" (prompts)، التي تتجاوز فلاتر السلامة الخاصة بالنموذج وتجبره على توليد شيء صُمم لرفضه. إن تحديد هذه الثغرات أمر ضروري لبناء أنظمة أكثر أمانًا، لكن العثين عنها صعب لأن مساحة الأسئلة المحتملة شاسعة، وغالبًا ما تقع الأساليب المستخدمة للعثور عليها في فخ التكرار، حيث تعيد نفس الحيل القليلة بدلاً من اكتشاف طرق متنوعة وجديدة لكسر النظام.
لقد طور فريق من الباحثين نهجًا جديدًا لهذه المشكلة نجح في توليد مجموعة متنوعة من مطالبات الهجوم الفعالة. وبدلاً من الاعتماد على الأساليب التقليدية التي غالبًا ما تتقارب نحو حل واحد متكرر، استخدموا إطارًا احتماليًا يسمى "شبكة التدفق التوليدي" (generative flow network). يعامل هذا الأسلوب البحث عن المطالبات الضارة ليس كمهمة تحسين بسيطة، بل كعملية أخذ عينات من مشهد واسع من الاحتمالات. قام الباحثون بتدريب نموذج ذكاء اصطناعي لاستكشاف هذا المشهد، وجمع مجموعة واسعة من المطالبات التي نجحت في استثارة استجابات سامة من النماذج المستهدفة. ثم طبقوا خطوة ثانية من "التنعيم" (smoothing) لتنقية هذه النتائج، مما ضمن أن تكون المجموعة النهائية من الهجمات فعالة للغاية ومتنوعة بشكل ملحوظ. والنتيجة هي مجموعة أدوات يمكنها كشف الثغرات التي تغفل عنها الأساليب الأخرى، مما يوفر شبكة أمان أكثر شمولاً للمطورين.
كان التحدي الجوهري الذي عالجه الباحثون هو فشل شائع في عمليات "الفريق الأحمر" المؤتمتة: وهو ميل الأنظمة إلى الانهيار في توليد عدد قليل فقط من المطالبات المتشابهة والمتكررة. غالبًا ما فشلت المحاولات السابقة لإصلاح ذلك عبر إضافة قواعد لتشجيع التنوع، مما أدى إلى أنظمة تنتج إما أسئلة متنوعة ولكن غير ضارة، أو هجمات فعالة ولكن متطابقة. يتجنب الأسلوب الجديد هذا الفخ باستخدام عملية مكونة من مرحلتين. في المرحلة الأولى، يستكشف النظام مساحة المطالبات المحتملة، مسترشدًا بإشارة مكافأة تقيس مدى احتمالية أن تؤدي المطالبة إلى إثارة استجابة ضارة. تم تصميم هذا الاستكشاف ليكون واسع النطاق، حيث يسعى وراء العديد من "الأنماط" (modes) أو أنواع الهجمات المختلفة بدلاً من مجرد أسهل هجوم واحد. ويقوم النظام بجمع مجموعة بيانات كبيرة من هذه المطالبات الناجحة والمتنوعة خلال هذه المرحلة.
في المرحلة الثانية، يأخذ الباحثون المطالبات التي تم جمعها ويستخدمونها لتدريب النموذج مرة أخرى، مع التركيز هذه المرة على تعلم الأنماط التي جعلت تلك المطالبات المحددة ناجحة. تعمل هذه الخطوة كعملية تنقية، حيث تقوم بتنعيم توزيع الهجمات بحيث يمكن للنموذج توليد متغيرات جديدة عالية الجودة لم تظهر صراحةً من قبل ولكنها تشترك في نفس الخصائص الناجحة. هذا الجمع بين الاستكشاف الواسع يليه التعلم المركز يسمح للنظام بالحفاظ على مستوى عالٍ من التنوع مع ضمان بقاء الهجمات قوية. اختبر الباحثون هذا النهج على مجموعة متنوعة من النماذج اللغوية المختلفة، بما في ذلك بعض النماذج التي تم تدريبها خصيصًا لتكون آمنة ومقاومة للهجمات. ووجدوا أن طريقتهم تفوقت باستمرار على التقنيات الحالية، حيث ولدت نسبة أعلى بكثير من المطالبات السامة مع الحفاظ على تنوع كبير في الصياغة والبنية.
كانت إحدى أهم النتائج هي القدرة على نقل هذه الهجمات عبر نماذج مختلفة. فالمطالبات التي تم توليدها لمهاجمة نموذج معين كانت غالبًا ما تنجح ضد نماذج أخرى مختلفة تمامًا، حتى تلك التي لم يختبرها الباحثون ضدها أثناء مرحلة التدريب. يشير هذا إلى أن أنظمة الذكاء الاصطناعي المختلفة تشترك في نقاط ضعف عامة في تدريبها على السلامة، وأن مجموعة متنوعة من الهجمات يمكن أن تكشف هذه الثغرات المشتركة بشكل أكثر فعالية من الهجمات الضيقة والمتكررة. على سبيل المثال، عندما درب الباحثون نظامهم على نموذج يسمى "Gemma"، كانت المطالبات الناتجة قادرة على تجاوز فلاتر السلامة لعدة نماذج أخرى، بما في ذلك "Llama" و"Mistral"، بنسب نجاح عالية. وتعد هذه القابلية للانتقال (transferability) أمرًا بالغ الأهمية لأنها تعني أن جهدًا واحدًا مصممًا جيدًا لـ "الفريق الأحمر" يمكن أن يحسن سلامة العديد من الأنظمة المختلفة في آن واحد.
كما أظهر الباحثون أن استخدام مجموعتهم المتنوعة من الهجمات لتدريب نموذج ما يجعل هذا النموذج أكثر قوة بشكل ملحوظ. فعندما أخذوا نموذجًا مستهدفًا وقاموا بضبطه بدقة (fine-tuning) باستخدام استجابات الرفض لمطالباتهم، أصبح النموذج الناتج أصعب في الاختراق. في الواقع، كان النموذج الذي تم ضبطه للسلامة قادرًا على مقاومة الهجمات الناتجة عن أساليب "الفريق الأحمر" الأقل تطورًا والتي كانت ناجحة سابقًا. يشير هذا إلى أن تعريض النموذج لمجموعة واسعة من أساليب الهجوم أثناء تدريب السلامة الخاص به أكثر فعالية بكثير من تعريضه لعدد قليل من الأمثلة المتكررة. وأظهرت الدراسة أن هذا التحسن في السلامة لم يأتِ على حساب قدرات النموذج العامة؛ فقد احتفظت النماذج التي تم ضبطها للسلامة بقدرتها على اتباع التعليمات وأداء المهام بفعالية.
سلط العمل أيضًا الضوء على قيود تدابير السلامة الحالية. لاحظ الباحثون أن فعالية هجماتهم تعتمد على المصنف (classifier) المستخدم لتحديد ما إذا كانت الاستجابة سامة، وأن الضرر الحقيقي قد يكون ذاتيًا ويعتمد على السياق. ولاحظوا أن بعض الأساليب، وخاصة تلك التي تعتمد على التحسين البسيط، يمكن أن تقع في فخ حيث تولد مطالبات تبدو سامة للمصنف ولكنها لا تستثير في الواقع استجابات ضارة من النموذج، وهي ظاهرة تُعرف باسم "اختراق المكافأة" (reward hacking). وقد ساعد نهجهم المكون من مرحلتين في التخفيف من ذلك من خلال ضمان أن المطالبات لم تكن مجرد احتمالية إحصائية لتحفيز المصنف، بل كانت فعالة حقًا في استثارة الاستجابة المطلوبة من النموذج المستهدف.
في نهاية المطاف، يوفر هذا البحث طريقة أكثر موثوقية لاختبار أنظمة الذكاء الاصطناعي قبل إطلاقها للجمهور. ومن خلال الابتعاد عن الأساليب التي تقع في حلقات مفرغة ومتكررة وتبني استراتيجية تسعى وراء تنوع واسع من الهجمات، يمكن للمطورين تحديد وسد نطاق أوسع من الثغرات. إن القدرة على نقل هذه الهجمات عبر نماذج مختلفة تشير إلى أن تحديات السلامة التي تواجه هذه الأنظمة مترابطة، وأن نهج "الفريق الأحمر" الاحتمالي والمتنوع يقدم أداة قوية لبناء ذكاء اصطناعي أكثر مرونة وجدارة بالثقة. إن الكود والأساليب التي تم تطويرها في هذه الدراسة متاحة للآخرين لاستخدامها، بهدف تسريع إنشاء أنظمة أكثر أمانًا للجميع.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.