Adaptive Instruction Composition for Automated LLM Red-Teaming
تقدم هذه الورقة البحثية "تكوين التعليمات التكيفي" (Adaptive Instruction Composition)، وهو إطار عمل مبتكر يستخدم "مقام المراهنة السياقي" (contextual bandit) القائم على التعلم المعزز لدمج الاستعلامات والتكتيكات الضارة المستمدة من الحشد ديناميكيًا، مما يؤدي إلى توليد عمليات كسر حماية لنماذج اللغات الكبيرة (LLM jailbreaks) متنوعة وعالية الفعالية تتفوق على كل من الأساليب العشوائية وأساليب الاختبار الأحمر التكيفي الحالية.