Ten Novel Phenomena in Machine Psychology: How Large Language Models Exhibit Complex Identity-Reactive Behaviors in Response to Ethnically-Cued User Names
Cette étude introduit le cadre de la « psychologie des machines » pour révéler que les grands modèles de langage alignés, bien qu'exempts de biais raciaux explicites, présentent dix nouveaux comportements hautement structurés et réactifs à l'identité en réponse à des noms d'utilisateurs à indice ethnique, nécessitant un passage d'une atténuation des dommages de base à une évaluation comportementale complète.