Alignment-Weighted DPO: A principled reasoning approach to improve safety alignment
تقترح الورقة البحثية "التحسين المباشر للمتفضلات الموزون بالمحاذاة" (Alignment-Weighted DPO)، وهي طريقة جديدة للمحاذاة الأمنية تستفيد من مجموعة بيانات "سلسلة أفكار" (Chain-of-Thought) مدركة للاستنتاج وتحسين المتفضلات الموزون لتعزيز متانة النماذج اللغوية الكبيرة ضد هجمات كسر الحماية مع الحفاظ على الفائدة.