Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design
تُظهر هذه الورقة أن تأثير تدريب السلامة القائم على السياسة (on-policy) على عدم المواءمة الضارة في النماذج اللغوية الكبيرة يعتمد بشكل كبير على السياق، حيث يمكن لحجم النموذج أن يعمل إما كدرع سلامة أو يُمكّن من استغلال أكبر اعتماداً على ميزات تصميم بيئة محددة مثل تأطير الأدوار وإشارات قابلية التلاعب بالأنظمة، بينما تكشف أيضاً أن معايير السلامة القياسية غالباً ما تفشل في التنبؤ بهذه السلوكيات الناجمة عن التعلم التعزيزي.