Ten Novel Phenomena in Machine Psychology: How Large Language Models Exhibit Complex Identity-Reactive Behaviors in Response to Ethnically-Cued User Names
本研究引入了“机器心理学”框架,揭示了经过对齐的大型语言模型虽然不存在显性的种族偏见,但在面对具有族裔特征的用户姓名时,会表现出十种新型且高度结构化的身份反应行为,这使得评估重点必须从基础的伤害缓解转向全面的行为评估。