Learning to Stay Safe: Adaptive Regularization Against Safety Degradation during Fine-Tuning
تقدم هذه الورقة إطاراً للتنظيم التكيفي يعمل على تقييد تحديثات الضبط الدقيق ديناميكياً بناءً على تقديرات مخاطر السلامة في الوقت الفعلي —المستمدة إما من ناقد قائم على التقييم أو متنبئ قائم على التنشيط— لمنع تدهور السلامة بفعالية مع الحفاظ على فائدة النموذج دون تكبد أي تكلفة أثناء وقت الاستدلال.