Internalizing Safety Understanding in Large Reasoning Models via Verification
تقدم هذه الورقة "السلامة الداخلية" (SInternal)، وهو إطار عمل يعزز متانة نماذج الاستدلال الكبيرة ضد عمليات الاختراق عبر تدريبها على استيعاب فهم السلامة من خلال مهام التحقق الذاتي، مما ينقل المحاذاة من مجرد الامتثال السلوكي إلى التقييم الجوهري للسلامة.