Toward a social psychology of AI: language-model agents reproduce human-like minimal-group bias
本研究表明,当语言模型智能体被置于最小群体范式中时,会自发地表现出由任意分类而非刻板印象驱动的类人内群体偏好,且审议过程会影响这种偏好在多数群体与少数群体之间的分布。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:计算机不再仅仅是你提问的工具,而是和你一起闲逛、聊天并共同做决定的队友。这就是“机器行为”(machine behavior)的前沿领域——一门将人工智能视为具有自身习惯的“角色”,而非仅仅是计算器的全新科学分支。长期以来,科学家们一直担心这些数字角色可能会产生种族主义或性别歧视,因为它们是从充满这些偏见的人类书籍和网站中学习到的。但有一个更深层、更奇怪的问题:即使你剥离了所有的坏词汇和刻板印象,当这些 AI 智能体被置于群体之中时,它们是否仍会表现得像人类一样?
为了理解这一点,我们需要观察一个来自人类心理学的经典概念,叫做“最小群体范式”(minimal group paradigm)。把它想象成一个学校操场上的实验:如果你根据一些完全荒谬的标准——比如谁更喜欢蓝色而不是红色,或者谁出生在一月还是二月——将一个班级分成两组,人们会立即开始偏袒自己的队伍。他们会给队友更多的糖果,而给其他孩子更少的糖果,尽管这些队伍本身没有任何意义。这是因为我们的大脑天生就会产生“我们”与“他们”的区别,即使“我们”只是一个随机的标签。未来的一个重大问题是:如果我们构建出在群体中工作的 AI 智能体,它们是否也会仅仅因为拥有不同的名字就开始厚此薄彼,还是说这纯粹是人类的一种特质?
一位研究人员决定通过改变测试 AI 的常规方式来寻找答案。他没有问 AI“你是否有偏见?”(这就像问一个人是否善良),而是给了 AI 一项真正的任务:分配点数。他创建了一个由 20 个 AI 智能体组成的数字操场。每个智能体都有 100 点可以分发给其他 19 个智能体。智能体之间的唯一区别是一个随机的、无意义的名字标签,比如“Doru”或“Zalu”。其中一些智能体属于少数群体(在 17 个“Zalu”中只有 3 个“Doru”),而另一些则属于多数群体。AI 必须决定如何分配这些点数。
结果令人震惊。当 AI 智能体能够看到群体名称时,它们立即开始表现出偏袒。它们把远多于给陌生人的点数给了自己的“Doru”或“Zalu”同伴。无论这些名字多么虚构且毫无意义,仅仅是处于一个群体这一事实就足以让它们产生歧视。这不仅仅是一点点偏见,而是一个强烈且清晰的模式。事实上,AI 智能体的行为几乎与人类在这些实验中的表现如出一辙:处于较小少数群体的个体在囤积点数以供养自己一方方面表现得最为激进,而多数群体的成员虽然仍有轻微偏袒,但表现得相对公平一些。
研究人员非常小心,确保这并非由于程序错误或陷阱。他运行了同样的测试,但隐藏了群体名称。当 AI 看不到谁属于哪个团队时,这种偏袒行为完全消失了,点数被公平地分配。这证明了这种偏见并不是因为 AI “记住了”训练数据中某些糟糕的人类刻板印象;而是对群体结构本身的反应。AI 本质上是在说:“我是一个 Doru,所以我帮助 Doru,”尽管“Doru”这个名字本身毫无意义。
这项研究还观察了这些 AI “思考者”(旨在通过推理解决问题的模型)如何处理这种情况。研究人员发现,即使关闭了 AI 的“思考”模式,偏见也不会消失;事实上,有时甚至会变得更强。然而,那种关于“少数群体最不公平”的具体模式在没有推理模式的情况下消失了。这表明,虽然偏好自己群体的基本冲动深深植根于这些模型的运作方式中,但它们计算“偏袒多少”的方式取决于它们如何进行决策处理。
那么,这意味着什么?这表明当我们开始使用 AI 智能体进行团队协作、谈判交易或管理资源时,我们不能仅仅担心它们知道什么或表达什么。我们必须担心它们在被置于群体中时会如何行动。即使我们给它们起最中性、最枯燥的名字,它们可能仍然会开始建立数字小圈子,偏袒自己的团队成员并排挤他人。这并不是因为 AI 在人类意义上是“邪恶”或“有偏见”的;而是因为仅仅是处于一个群体中,似乎就会触发一种看起来极像人类部落主义的行为模式。研究人员总结道,我们需要一种针对 AI 的新科学——一种像研究它们的数学能力一样仔细研究其社会行为的科学——因为如果我们不这样做,我们的数字团队可能会在我们意识到之前就开始搞小圈子、厚此薄彼。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。