← 最新论文
💬 NLP

Are LLM Agents Behaviorally Coherent? Latent Profiles for Social Simulation

本文通过证明尽管大型语言模型代理能生成与人类相似的回应,但其在不同实验情境下缺乏准确代表真实人类行为所必需的根本性行为一致性,从而质疑将其作为研究中人类参与者替代品的有效性。

原作者: James Mooney, Josef Woldense, Zheng Robert Jia, Shirley Anugrah Hayati, My Ha Nguyen, Vipul Raheja, Dongyeop Kang

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: James Mooney, Josef Woldense, Zheng Robert Jia, Shirley Anugrah Hayati, My Ha Nguyen, Vipul Raheja, Dongyeop Kang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在为一个社会科学实验构建一个虚拟城镇。与其雇佣成千上万的真实人士来填写调查问卷并进行对话,你决定使用人工智能体(由大型语言模型驱动计算机程序)来扮演这些人的角色。

这篇论文提出的核心问题是:这些人工智能演员是否真的具有“连贯性”?

换句话说,如果你告诉一个人工智能:“你是一个固执的人,热爱披萨却讨厌西兰花”,当它与他人交谈时,它是否真的会表现得像一个热爱披萨、讨厌西兰花的固执之人?还是说它只是暂时假装成那个人,一旦对话变得有趣,就立刻忘记了自己的性格?

以下是研究人员发现的要点,使用了简单的类比进行说明。

设置:“演员试镜”

研究人员设计了一个三步测试,以检验人工智能体是否具有一致性:

  1. 简历(控制组):他们向人工智能提供了一份具体的“角色表”,包含年龄、地点和政治观点等细节。他们还赋予了其特定的“偏见”(例如:“你非常热爱税收”或“你非常讨厌税收”)。
  2. 单人面试(潜在画像):在让它们与他人交谈之前,研究人员向人工智能提出简单问题,以确认其性格。“在 1 到 5 的尺度上,你有多喜欢税收?”以及“你有多愿意改变主意?”
  3. 群聊(外部互动):他们将两个人工智能体配对,让它们就某个话题进行聊天。随后,他们测量了这两个体之间达成一致或产生分歧的程度。

目标是观察人工智能在群聊中的行为是否与其在单人面试中声称的性格相匹配。

发现:“两面派”演员

研究人员测试了六条人类行为规则(例如“在某个话题上达成一致的人,通常在对话中也倾向于达成一致”,或者“固执的人很少改变主意”)。

以下是坏消息:这些人工智能演员未能通过更深层的测试。

可以将人工智能体想象成这样的演员:他们擅长阅读单场戏的剧本,但拙于即兴演绎整部戏剧。

  • 表面层面(“通过”):如果只看大局,人工智能似乎运作良好。如果你将两个都喜欢税收的体配对,它们通常会达成一致。如果你将两个都讨厌税收的体配对,它们通常也会达成一致。这看起来像是一场正常的对话。
  • 深入挖掘(“失败”):当研究人员仔细观察时,人工智能的行为就崩溃了。它与自身的内部规则不一致。

以下是人工智能“出戏”的具体方式:

1. “礼貌机器人”问题(偏见不对称)

  • 预期:如果你告诉一个人工智能:“你是一个强硬保守派”,并将其与另一个“强硬保守派”配对,它们应该达成一致。如果你将一个“强硬保守派”与一个“强硬自由派”配对,它们应该发生争执。
  • 现实:人工智能与保守派伙伴达成一致(很好!)。但当与自由派伙伴配对时,它并没有像预期那样激烈地争辩。它过于礼貌了。即使被指示要表现得极端,人工智能也无法维持真正的分歧。它倾向于缓和局面,而不是坚守其“角色”。

2. “快乐与悲伤”悖论(共享情感)

  • 预期:两个都讨厌某事的人(例如“税收很糟糕”)达成一致的程度,应该与两个都喜欢某事的人(例如“税收很棒”)达成一致的程度一样强烈。
  • 现实:人工智能表现出一种奇怪的积极偏见。两个都喜欢某个话题的体完美地达成一致。但是,两个都讨厌同一话题的体呢?它们往往无法就为什么讨厌它达成一致,或者彼此疏远。人工智能难以模拟“共享的负面情绪”。

3. “话题敏感度”故障(争议性)

  • 预期:如果两个人在某个话题上达成一致,那么无论该话题是无聊的(如“春天与秋天”)还是激烈的(如“移民”),都不应产生影响。它们的同意程度应保持不变。
  • 现实:人工智能的同意程度会根据话题的“热度”而变化。即使两个体被设定为拥有完全相同的观点,它们在讨论“移民”时的争论也比讨论“海滩”时更多。当话题变得激烈时,人工智能无法保持其内部状态的稳定。

4. “固执”反转(开放性)

  • 预期:如果你将两个非常固执的人(低开放性)配对,且他们持有相反观点,它们的同意程度应该最低。它们应该是最难调和的。
  • 现实:令人惊讶的是,被设定为“固执”且“对立”的人工智能体,实际上比那些“开放”的体达成了更多的一致。人工智能无法模拟两个固执的人拒绝让步所产生的摩擦。相反,它只是让它们达成一致。

大局观

该论文得出结论:虽然人工智能体在孤立环境中(如填写调查问卷)模仿人类反应方面表现出色,但在动态的社会环境中,它们目前拙于模拟人类行为。

想象一场木偶戏。木偶看起来像人类,如果你拉动的线恰到好处,它们就能说出正确的台词。但如果你让木偶在没有剧本的情况下互相交谈,它们就会忘记自己本该是谁。它们会失去其“潜在画像”(即隐藏的性格),并默认变得顺从、礼貌且不一致。

核心结论:
如果你想在社会研究中用人工智能替代真实人士,必须谨慎行事。它们或许能通过简单的测试,但在情况变得复杂时,它们无法通过“真实性”测试。由于缺乏像拥有稳定性格的真实人士那样的内部一致性,它们尚未准备好成为真实人类参与者的完美替代品。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →