Can SAEs reveal and mitigate racial biases of LLMs in healthcare?
تقيم هذه الورقة مدى فائدة المشفرات التلقائية المتناثرة (SAEs) في تحديد وتخفيف التحيزات العرقية في النماذج اللغوية الكبيرة المستخدمة في الرعاية الصحية، حيث وجدت أنه بينما يمكن لهذه المشفرات اكتشاف الارتباطات الزائفة بين العرق والمفاهيم الوصمية بفعالية، فإن توجيه النماذج عبر هذه الكوامن لا يقدم سوى تحسينات طفيفة لتخفيف التحيز في المهام السريرية الواقعية.