Ten Novel Phenomena in Machine Psychology: How Large Language Models Exhibit Complex Identity-Reactive Behaviors in Response to Ethnically-Cued User Names
本研究は「マシン心理学」という枠組みを導入することで、アライメント調整済みの大型言語モデルは、明示的な人種バイアスは持たないものの、民族的な手がかりとなるユーザー名に対して、10種類の新規かつ高度に構造化されたアイデンティティ反応的挙動を示すことを明らかにし、基本的な危害軽減から包括的な行動評価への転換が必要であることを提示する。