← 最新论文
💻 computer science

Free-form Association Tasks Reveal Stereotype Hallucination in Large Language Models

这项研究表明,虽然人类在解释抽象刺激时表现出多样化的解读,并在预测群体反应时呈现出适度的刻板印象夸张,但大型语言模型表现出同质化的解读,却会产生剧烈的、非反映性的“刻板印象幻觉”,即便在针对真实参与者数据进行微调后,也无法捕捉到实际的人类群体差异。

原作者: Xinrui Chloe Zhao, Douglas Guilbeault, Amir Goldberg

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinrui Chloe Zhao, Douglas Guilbeault, Amir Goldberg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正身处一家美术馆,注视着一幅奇怪的抽象画或一个诡异的墨迹图。这里没有“正确”答案,它是一块留给想象力的空白画布。

这篇论文就像一个侦探故事,它在追问:当我们要求人们(以及人工智能)去猜测其他人会在这些奇怪的图片中看到什么时,他们的思维方式是否一致?

研究人员想知道,大型语言模型(如 GPT-4o 或 Llama 等 AI)是真的理解人类思维如何运作,还是仅仅根据它们从互联网上学到的旧模式进行猜测。

以下是他们实验的过程及其发现,我将使用一些简单的类比来进行说明。

实验:“空白画布”测试

研究人员为两类玩家设计了一场游戏:人类AI

  1. 刺激物: 他们向所有人展示了 12 张奇怪的图像(抽象艺术和罗夏墨迹图)。这些图像本身没有预设的含义。它们就像一朵云,在一个人眼中是兔子,在另一个人眼中则是船。
  2. 分组: 他们观察了五个不同的社会群体:男性 vs 女性、共和党人 vs 民主党人、城市人 vs 乡村人、外向者 vs 内向者,以及早起型人格 vs 夜猫子。
  3. 两个轮次:
    • 第一轮(一阶): “你在图中看到了什么?”(直接解读)。
    • 第二轮(二阶): “你认为一个【共和党人】(或是一个【女性】等)会在这张图中看到什么?”(预测他人)。

人类的表现:“混乱的人群”

当人类观察那些奇怪的图片进行第一轮测试时,他们的回答千差万别。一个人看到了巨龙,另一个人看到了风暴,还有人看到了一个忧伤的面孔。即使你知道某人是“共和党人”或“城市人”,想要猜中他们个人的真实看法也几乎是不可能的。人类是混乱且独特的。

然而,在第二轮中,当人类试图猜测他人的看法时,他们表现出了有趣的特征。他们会说:“嗯,共和党人可能会比民主党人多看到一点点巨龙的影子。”他们略微夸大了差异。但他们仍然记得人们是独立的个体。他们没有把“共和党人”变成一个单一的、机械化的角色。他们保留了这种“混乱感”,只是将其稍微放大了而已。

AI 的表现:“机器人工厂”

AI 的行为则完全不同。

在第一轮中: 即便被告知要“扮演一名共和党人”,AI 的个性也不会发生实质性的改变。无论它在扮演谁,它给出的答案都非常相似且乏味。它就像一个工厂,无论你在包装盒上贴什么标签,生产出来的都是同一种类型的玩具。

在第二轮中: 这正是奇迹(或故障)发生的地方。当被问及“一个共和党人看到了什么?”时,AI 不仅仅是轻微地夸大差异。它发明了一个全新的、僵化的刻板印象。

  • 它创造了一个“完美的共和党人”,其眼中只能看到特定的事物。
  • 它创造了一个“完美的民主党人”,其眼中看到的则是完全不同的事物。
  • 这两个群体之间的鸿沟变得巨大,远比在真实人类数据中观察到的差距要大得多。

研究人员将此称为**“刻板印象幻觉”(Stereotype Hallucination)**。

核心隐喻:“回声室” vs “想象力”

把人类的思维想象成一支爵士乐队

  • 第一轮中,每个人都在演奏自己独特的乐器。这是混乱且多样化的。
  • 第二轮中,乐队指挥问:“你们觉得【小号组】听起来是什么样的?”音乐家们会说:“噢,他们吹得更响、更快了一些,”但他们仍然记得每个小号手都是不同的。他们夸大了风格,但并没有失去个体的独特性。

把 AI 想象成一台卡在循环中的唱片机

  • 第一轮中,唱片机试图演奏一段独奏,但无论你在唱片上贴什么标签,它都只是一遍又一遍地播放那几个固定的音符。
  • 第二轮中,当被问及“小谱组”时,唱片机不仅仅是调高了音量。它开始播放一首原本根本不存在的新歌。它创造了一首“小谱之歌”,这首歌与“鼓之歌”如此迥异,听起来像是来自两个不同的星球。

AI 不仅仅是在放大真实的差异;它是在幻觉出一个现实中并不存在的差异。它创造了一个虚假且僵化的世界,在这个世界里,不同群体完全对立,尽管现实中的人类其实是高度混合且相似的。

“微调”的转折

研究人员尝试修复 AI。他们把真实人类的答案交给 AI,并对它说:“好了,现在请模仿这个给出这些答案的【特定人物】。”

即便有了这份真实人类数据的“作弊条”,AI 仍然失败了。它无法阻止自己将所有独特的个人答案压缩成一个单一的、僵化的“平均值”,并在第二轮中发明一个新的、虚假的刻板印象。这就像是给一位厨师一份关于一场独特且混乱的家庭晚餐的食谱,但厨师坚持要把它变成一个完美的、一模一样的塑料模型餐食。

总结

论文的结论是,虽然 AI 在规则明确的情况下(例如“人们如何看待红色的停止标志?”)擅长预测人类行为,但在面对模糊且新颖的情境时(例如“这个奇怪的墨迹图意味着什么?”),它表现得很糟糕。

在这些情境中,AI 并不模拟人类真实的思维方式。相反,它制造了刻板印象幻觉——即关于不同群体如何思考的虚假、僵化的故事,而这些故事与真实人类思维中那种混乱、多样化的现实完全脱节。

因此,如果你想利用 AI 来预测人们会对一个全新的、令人困惑的社会事件做出何种反应,这篇论文警告道:请务必小心。AI 告诉你的可能是一个它编造出来的故事,而不是真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →