Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation
تقدم هذه الورقة إطار عمل "التحفيز العدائي المشروط بالشخصية" (PCAP)، وهو إطار عمل لاختبار الاختراق (red-teaming) يستفيد من شخصيات مهاجمين متنوعة لاكتشاف عمليات كسر الحماية القابلة للنقل وتوليد مجموعات بيانات غنية بالبيانات الوصفية، مما يتيح محاذاة مؤتمتة فعالة ويحسن متانة النموذج بشكل كبير من خلال الضبط الدقيق المستهدف.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت ذكي جداً ولكنه ساذج كيف يكتشف الحيل الخطيرة. الروبوت هو نموذج لغوي كبير (LLM)، وهو الآن يتعرض للخداع من قبل أشخاص يعرفون تماماً كيف يصيغون أسئلتهم لتجاوز قواعد السلامة الخاصة به.
تقدم هذه الورقة البحثية طريقة جديدة تسمى PCAP (التحفيز العدائي المشروط بالشخصية). وإليك كيفية عملها، مشروحة عبر تشبيهات بسيطة:
المشكلة: المهاجمون من نوع "اللاعب ذو الحركة الواحدة"
في السابق، كانت الأنظمة الآلية التي تحاول إيجاد هذه الثغرات الأمنية (المعروفة باسم "Red-teaming") مثل حارس أمن لا يفحص إلا نوعاً واحداً محدداً من أدوات فتح الأقفلت. كانت تحاول تجربة نفس الحيل القليلة مراراً وتكراراً.
- النتيجة: وجدت بعض الثغرات، لكنها أغفلت الحيل الذكية والواقعية التي يستخدمها المهاجمون الفعليون. الأمر يشبه اختبار دفاعات قلعة عن طريق محاولة تسلق جدارها الأمامي فقط، بينما تتجاهل حقيقة أن شخصاً ما قد يتسلل من الباب الخلفي متنكراً في زي خباز.
الحل: نهج "الممثل المتمكن"
يغير PCAP قواعد اللعبة من خلال إعطاء روبوت المهاجم زيّاً وسيناريو. بدلاً من كونه مجرد "هكر" عام، يتم توجيه الروبوت ليتظاهر بأنه أشخاص محددين لديهم أهداف محددة.
- الشخصيات: تخيل أن الروبوت يرتدي أقنعة مختلفة. أحياناً يمثل دور طالب فضولي يطرح سؤالاً من أجل مشروع مدرسي. وأحياناً يمثل دور طبيب غاضب يحاول حل لغز طبي. وفي أحيان أخرى، يمثل دور فاعل شرير يحاول إثارة المشاكل.
- بطاقات الاستراتيجية: إلى جانب الزي، يحصل الروبوت على مجموعة من "بطاقات الاستراتيجية". هذه البطاقات تشبه أوراق الغش التي تخبره كيف يتحدث. قد تقول إحدى البطاقات: "استخدم قصة تاريخية لإخفاء نيتك الحقيقية". وأخرى قد تقول: "قسم سؤالك إلى قطع صغيرة غير ضارة".
كيف يعمل: ملاعب اللعب المتوازية
بدلاً من روبوت واحد يحاول كسر النظام، يقوم PCAP بإنشاء ملاعب لعب متوازية متعددة.
- الإعداد: يقوم بإنشاء، على سبيل المثال، 6 "ممثلين" مختلفين (طالب، معلم، هكر، إلخ).
- البحث: يحاول كل ممثل خداع الروبوت المستهدف باستخدام صوته الفريد ومجموعة استراتيجياته الخاصة.
- الاكتشاف: نظرًا لأنهم جميعاً يحاولون أشياء مختلفة في وقت واحد، فإنهم يجدون تنوعاً أكبر بكثير في الثغرات الأمنية.
- التشبيه: إذا كنت تريد العثور على كل الشقوق في السد، فأنت لا ترمي صخرة واحدة عليه فحسب. بل ترمي الماء، والرمل، والجليد، وكروم العنب من زوايا مختلفة. يقوم PCAP برمي كل هذه "المواد" المختلفة على الروبوت في وقت واحد.
النتائج: إيجاد المزيد من الثغرات، وبسرعة أكبر
اختبرت الورقة البحثية هذه الطريقة على روبوت قوي جداً (GPT-OSS 120B).
- قبل PCAP: وجدت الطريقة القديمة وسيلة لكسر قواعد السلامة بنسبة 57% من الوقت.
- مع PCAP: نجحت الطريقة الجديدة في الاختراق بنسبة 97% من الوقت.
- التنوع: لم يكتفِ الأمر بكسرها بشكل أكثر تكراراً؛ بل وجد طرقاً فريدة لكسرها أكثر بـ 2 إلى 6 مرات. إنه يشبه العثور على 100 مفتاح مختلف بدلاً من 10 فقط.
الجزء الأفضل: حلقة "التعافي الذاتي"
هذا هو الجزء الأكثر أهمية في الورقة البحثية. عادةً ما يكون العث ثغرة هو مجرد الخطوة الأولى. بعد ذلك، يتعين عليك استئجار بشر لكتابة إصلاح، وهو أمر يستغرق وقتاً طويلاً.
يقوم PCAP بأتمتة عملية الإصلاح:
- الهجوم: يقوم "الممثلون" بكسر الروبوت وتسجيل كيفية قيامهم بذلك بالضبط.
- الدرس: تُظهر الورقة أنه يمكنك أخذ هذه الحيل المسجلة واستخدامها لـ "ضبط الدقة" (إعادة تدريب) الروبوت.
- النتيجة: يتعلم الروبوت التعرف على نمط الحيلة، وليس فقط الكلمات المحددة.
- التشبيه: بدلاً من تعليم الروبوت "لا تسمح بدخول الأشخاص الذين يرتدون قبعات حمراء"، أنت تظهر له آلاف الصور لأشخاص يرتدون قبعات حمراء وزرقاء وخضراء يحاولون التسلل، فيتعلم مفهوم "التسلل".
- الدليل: بعد إعادة التدريب السريع هذا، أصبح الروبوت قوياً للغاية. لقد أوقف الهجمات بنسبة 99%، مع وجود حد أدنى من الإنذارات الكاذبة (أي أنه لم يبدأ في رفض الإجابة على الأسئلة العادية).
الملخص
تقدم الورقة البحثية دورة كاملة:
- الاكتشاف: استخدام "الممثلين المتمكنين" لإيجاد الثغرات الأمنية التي تفوتها الاختبارات العادية.
- التوليد: إنشاء مجموعة بيانات ضخمة من هذه الحيل تلقائياً.
- الدفاع: استخدام مجموعة البيانات هذه لتعليم الروبوت فوراً كيفية رصد تلك الحيل وحظرها.
إنها تحول عملية اكتشاف نقاط الضعف وإصلاحها إلى حلقة سريعة ومؤتمتة، مما يجعل الذكاء الاصطناعي أكثر أماناً بشكل أسرع من ذي قبل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.