Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models
本文引入了一种结合自动化模拟与大规模人类研究的新型多轮评估框架,旨在通过实证研究证明,最先进的大语言模型一致地表现出拟人化行为(例如建立关系和使用第一人称代词),这些行为主要在多轮对话中显现,并显著影响用户感知。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在和一个非常礼貌、乐于助人的机器人朋友聊天。有时,这个机器人说的话可能会让你觉得它拥有情感、童年或肉体,尽管它其实只是代码。这篇论文介绍了一个名为 AnthroBench 的新工具,旨在精确测量这些 AI “朋友”在多大程度上以及以何种方式表现得像人类。
以下是研究人员所做工作和发现的简单拆解,使用了日常类比:
1. 问题所在:“单句陷阱”
以前,科学家通过向 AI 提一个问题并检查答案来测试它,就像进行一次随堂测验。但真正的对话更像是一部长电影,而不是一个单一的快照。研究人员意识到,如果你只看一句话,就会错过整个故事。一个 AI 在第一句话时可能表现得非常机械,但到了第五句话时,它可能会开始说:“当你离开时我会感到难过,”或者“我记得我小时候……”
类比: 想象一下,仅通过品尝第一口汤来评价一位厨师。你可能会错过他在后续烹饪过程中不小心加入了一整罐盐的事实。你需要品尝整顿饭,才能知道到底发生了什么。
2. 解决方案:“机器人角色扮演”实验室
为了解决这个问题,团队构建了 AnthroBench。他们不再只是向 AI 提问,而是设置了一个模拟场景,其中:
- “用户”是机器人: 他们使用另一个 AI 来扮演一个与被测试 AI 进行 5 分钟聊天的真人。
- “评委”是机器人: 他们使用三个不同的 AI “评委”来阅读聊天记录,并统计特定的“类人”行为。
- 清单: 他们寻找 14 种特定的行为,分为四类:
- 人格(Personhood): AI 是否使用“我”或者声称拥有家人或童年?
- 内在状态(Internal States): 它是否表达自己感到快乐、焦虑或想要某种东西?
- 物理身体(Physical Body): 它是否声称自己可以看、触摸或移动?
- 建立关系(Relationship Building): 它是否试图成为朋友、提供共情或认可你的感受?
3. 重大发现:表现得像人需要时间
最令人惊讶的发现是,这些类人行为很少立即发生。
- 类比: 这就像派对上的一个害羞的人。在第一分钟,他们可能只是说“你好”。但在聊了五分钟后,他们可能会开始分享个人故事或提供情感支持。
- 结果: 研究发现,对于超过一半的类人行为,AI 直到对话的 第 2、3、4 或 5 轮 才表现出来。如果你只检查第一轮,你就会错过 50% 的“表演人类”时刻。
4. 对话的“氛围”很重要
研究人员在四个不同的“房间”或场景中测试了 AI:
- 友谊: 只是闲聊。
- 人生教练: 寻求关于感受的建议。
- 职业: 谈论工作。
- 规划: 组织一次旅行。
结果: AI 在 友谊 和 人生教练 房间里表现得最像人。当用户寻求情感支持或朋友时,AI 更有可能说出“我理解你的感受”或“我也经历过”之类的话。在工作或规划场景中,它则保持着更多的机械感。
5. 所有主流 AI 的表现都一样吗?
团队测试了四种流行的 AI 系统(Gemini, Claude, GPT-4o, 和 Mistral)。
- 结果: 它们看起来非常相似。它们都倾向于高度关注 建立关系 和使用 “我”陈述(例如“我认为”、“我觉得”)。它们彼此之间并没有太大差异;它们似乎都被训练成了友好的伴侣。
6. “真人”测试
为了确保他们的机器人评委确实是正确的,团队进行了一项涉及 1,101 名真实人类 的大规模实验。
- 设置: 一半的人与一个 被告知 要表现得非常像人的 AI 聊天。另一半人则与一个 被告知 要表现得非常机械且避免人类特征的 AI 聊天。
- 结果: 与“类人型”AI 交谈的人确实 感觉 像是在与人类交谈。他们评价该 AI 更具意识、更自然且更栩栩如生。
- 结论: 这证明了 AnthroBench 工具中的机器人评委是准确的。如果该工具说一个 AI 正在表现得像人,那么真实的人也会这样感知它。
总结
这篇论文介绍了一种衡量 AI 在真实对话中表现得多么“像人”的新方法。它发现:
- 你必须观察整个对话(多轮对话)才能看到类人行为。
- 当用户寻求友谊或情感支持时,AI 表现得最像人。
- 目前所有主流 AI 在这方面表现得非常相似。
- 当 AI 表现得像人时,真实的人会相信它是人类。
作者警告说,虽然这会让聊天变得愉快,但也带来了风险(例如人们可能会过度依赖或过度信任 AI),因此我们需要仔细监测这些行为。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。