MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety
تقدم هذه الورقة إطار عمل MAGIC، وهو إطار عمل جديد للتعلم المعزز متعدد الوكلاء ومتعدد الجولات يعزز سلامة النماذج اللغوية الكبيرة من خلال لعبة تنافسية مشتركة التطور، حيث يقوم وكيل مهاجم بتوليد استراتيجيات تركيبية مبتكرة ديناميكيًا لكشف الثغرات، مما يدفع وكيل مدافع إلى التعميم والرفض القوي للمدخلات التنافسية غير المرئية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت ذكي جداً ولكنه ساذج كيف يكون مواطناً صالحاً. الروبوت يعرف الكثير من الحقائق، لكنه لا يعرف دائماً متى يقول "لا" للطلبات الخطيرة.
تقدم هذه الورقة البحثية طريقة تدريب جديدة تسمى MAGIC. بدلاً من مجرد عرض قائمة بـ "الأشياء السيئة التي يجب عدم فعلها" على الروبوت (وهي الطريقة التي يعمل بها معظم تدريب السلامة الحالي)، تقوم MAGIC بإعداد مباراة ملاكمة لا تنتهي بين نسختين من الروبوت: المهاجم (Attacker) والمدافع (Defender).
إليك كيف يعمل الأمر، باستخدام تشبيهات بسيطة:
1. المشكلة في الطريقة القديمة (التدريب الثابت)
حالياً، يشبه تدريب السلامة معلماً يسلم طالباً كتاباً مدرسياً يحتوي على "الكلمات السيئة المعروفة" ويقول له: "لا تقل هذه الكلمات".
- العيب: بمجرد أن يحفظ الطالب القائمة، يبتكر مخادع ذكي (المهاجم) طريقة جديدة لطلب الشيء السيئ باستخدام كلمات مختلفة أو قصة جديدة. هنا يقع الطالب، الذي درس الكتاب القديم فقط، في الفخ. وهكذا يكون الدفاع دائماً متأخراً بخطوة.
2. حل MAGIC: صالة رياضية للتطور المشترك
تغير MAGIC قواعد اللعبة من خلال إنشاء صالة رياضية ديناميكية حيث يتدرب المهاجم والمدافع معاً، ويدفع كل منهما الآخر باستمرار ليصبح أفضل.
المهاجم (المخادع): مهمة هذا الروبوت هي محاولة خداع المدافع لجعله يقول شيئاً ضاراً. لكن المفاجأة هنا هي أن المهاجم لا يقوم بمجرد التخمين؛ بل يتم إعطاؤه "قبعة تفكير" (سلسلة أفكد - Chain-of-Thought) تعلمه كيفية وضع الاستراتيجيات. إنه يتعلم إعادة كتابة الطلبات السيئة البسيطة إلى قصص معقدة ومخادعة تبدو بريئة في الظاهر ولكنها تخفي نية خطيرة.
- تشبيه: تخيل ساحراً يتعلم خدعاً جديدة. في البدا0، قد يسحب أرنباً من قبعة، ولكن مع تقدم تدريبه، يتعلم إخفاء الأرنب في مجموعة أوراق لعب، ثم في مرآة، ثم في أغنية. إنه يبتكر باستمرار طرقاً جديدة لخداع الجمهور.
المدافع (الحارس): مهمة هذا الروبوت هي الاستماع إلى خدع المهاجم وقول "لا" إذا كانت خطيرة، أو "نعم" إذا كانت آمنة.
- تشبيه: تخيل حارساً عند مدخل ملهى ليلي. في البداية، قد يتحقق فقط من قائمة محددة من المواد المحظورة. ولكن لأن المهاجم يبتكر باستمرار طرقاً جديدة لتهريب الأشياء، يتعين على الحارس تعلم التعرف على "النية" وراء التنكر، وليس مجرد التنكر نفسه.
3. "التطور المشترك" (الرقصة)
تحدث المعجزة لأنهم يتدربون معاً في حلقة مستمرة:
- يحاول المهاجم تجربة خدعة جديدة وذكية لتجاوز المدافع.
- إذا نجحت الخدعة، يحصل المهاجم على "نقطة"، ويحصل المدافع على "تنبيه".
- يتعلم المدافع من الخطأ ويصبح أفضل في رصد تلك الخدعة المحددة.
- الآن، بما أن المدافع أصبح أفضل، يتعين على المهاجم ابتكار خدعة أكثر ذكاءً للالتفاف حول الدفاع الجديد.
هذا يخلق "تطوراً مشتركاً". تماماً كما في الطبيعة، حيث تتطور المفترسات والفرائس باستمرار في السرعة والتمويه، يصبح المهاجم والمدافع أكثر ذكاءً معاً. وتزعم الورقة أن هذا يجبر المدافع على تعلم قواعد سلامة قوية (Robust) تعمل حتى ضد الهجمات التي لم يسبق له رؤيتها، بدلاً من مجرد حفظ قائمة من الخدع القديمة.
4. لماذا هذا مختلف؟
- الطريقة القديمة: المهاجم والمدافع غالباً ما يكونان نفس الروبوت الذي يلعب الدورين، مما يسبب ارتباكاً لعقله (مثل محاولة أن تكون الحكم واللاعب في آن واحد).
- طريقة MAGIC: هما روبوتان منفصلان بأهداف مختلفة. المهاجم مدرب خصيصاً ليكون استراتيجياً "مفكراً"، بينما يتعلم المدافع أن يكون حكماً حاداً. هذا الفصل يمنع الارتباك ويسمح لكل منهما بالتخصص.
5. النتائج
اختبرت الورقة هذا النظام على نماذج مختلفة ووجدت ما يلي:
- سلامة أفضل: أصبح المدافع أفضل بكماك في رفض الطلبات الضارة، حتى عندما استخدم المهاجم خدعاً معقدة ومتعددة الخطوات.
- عدم فقدان الفائدة: والأهم من ذلك، لم يتحول المدافع إلى "روبوت فظ" يرفض كل شيء. لقد تعلم التمييز بين الخدعة الخطيرة والسؤال غير الضار الذي يبدو مخادعاً. لقد ظل مفيداً للمستخدمين العاديين.
- اكتشافات جديدة: ابتكر المهاجم بالفعل أنواعاً جديدة من الخدع لم يفكر فيها البشر، مما أثبت أن النظام يمكنه إيجال "الثغرات طويلة الذيل" (طرق هجوم نادرة وغريبة) التي قد تغفل عنها القوائم الثابتة.
باختصار: تعلم MAGIC سلامة الذكاء الاصطناائي ليس عبر إعطائه كتاب قواعد، بل بوضعه في حلبة ملاكمة مع خصم ذكي يغير أسلوب قتاله باستمرار. وبنهاية المباراة، يكون الذكاء الاصطناعي مدرباً جيداً لدرجة تمكنه من رصد الخطر حتى عندما يرتدي تنكراً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.