Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability
تقدم هذه الورقة مؤشر حساسية أخلاقية متعدد المستويات لتقييم التحيز السياقي في النماذج اللغوية الكبيرة، مما يكشف عن بصمات سلوكية متميزة عبر البنيات المختلفة ويثبت آلياً أن تقطير الاستدلال يمكن أن يؤدي دون قصد إلى إعادة تنشيط دوائر التحيز الإجرامي رغم زيادة القدرة.