Secure LLM Fine-Tuning via Safety-Aware Probing
تقترح هذه الورقة إطار عمل "الاستقصاء الواعي بالسلامة" (SAP)، وهو إطار يعمل على التخفيف من تدهور معايير السلامة أثناء عملية الضبط الدقيق للنماذج اللغوية الكبيرة (LLMs) عبر تحديد واضطراب الاتجاهات المرتبطة بالسلامة في الحالات الخفية لتوجيه تحديثات المعلمات بعيداً عن المسارات الضارة مع الحفاظ على أداء المهام.