Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models
تقدم هذه الورقة طريقة تسمى التوجيه التقاربي-التباعدي (Convergent-Divergent Routing) مقترنة بمعايرة اللوجيت المزدوجة (Dual Logit Calibration) لتحقيق تحكم دقيق وقابل للتفسير في الاستدلال الأخلاقي للنماذج اللغوية الكبيرة عبر توجيهها نحو أطر أخلاقية محددة مثل النفعية أو الواجبية مع الحفاظ على قدراتها العامة.