Mechanistic Origin of Moral Indifference in Language Models
تحدد هذه الورقة حالة متأصلة من اللامبالاة الأخلاقية في النماذج اللغوية الكبيرة ناتجة عن ضغط المفاهيم الأخلاقية المتميزة في توزيعات موحدة، وتثبت أن تطبيق المحاذاة التمثيلية عبر المشفّرات التلقائية المتفرقة لإعادة بناء العلاقات الطوبولوجية في الميزات الأخلاقية الكامنة يعزز بشكل كبير من الاستدلال الأخلاقي والدقة، محققاً معدل فوز بنسبة 75% في الاختبارات المعيارية الخصومية.