← 最新论文
🤖 AI

Humans' ALMANAC: A Human Collaboration Dataset of Action-Level Mental Model Annotations for Agent Collaboration

本文介绍了 ALMANAC,这是一个包含 2,987 条动作级心理模型标注的数据集,这些标注源自人类在地图任务(Map Task)中的双人协作,旨在弥补在训练和评估大语言模型智能体维持对齐心理模型以及模拟人类协作行为能力方面的空白。

原作者: Jiaju Chen, Yuxuan Lu, Jiayi Su, Chaoran Chen, Songlin Xiao, Zheng Zhang, Yun Wang, Yunyao Li, Jian Zhao, Tongshuang Wu, Toby Jia-Jun Li, Dakuo Wang, Bingsheng Yao

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaju Chen, Yuxuan Lu, Jiayi Su, Chaoran Chen, Songlin Xiao, Zheng Zhang, Yun Wang, Yunyao Li, Jian Zhao, Tongshuang Wu, Toby Jia-Jun Li, Dakuo Wang, Bingsheng Yao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图和一位朋友一起画一张藏宝图,但你们身处不同的房间。你们只能通过文字聊天进行交流。其中一人是引导者(Guide),他手里拿着画有正确路径的原图;另一人是跟随者(Follower),他手里拿着一张只有地标(如山脉或桥梁)但没有路径的空白地图。

为了成功,他们必须通力合作:引导者描述路径,跟随者尝试绘制。

这就是名为 ALMANAC 的一项新研究项目的核心。以下是研究人员所做工作的简单拆解及其意义,并使用了日常类比。

1. 问题所在:机器人擅长“执行”,但不擅长“协同思考”

目前的 AI 智能体(如先进的聊天机器人)非常擅长听从指令。如果你说“订一张机票”,它们就能做到。但真正的真人协作不仅仅是听从命令,更是关于心理对齐(Mental Alignment)

把人类团队想象成一支爵士乐队。他们不仅仅是在阅读乐谱,他们还在不断倾听彼此,猜测队友即将演奏什么,并实时调整自己的节奏。他们拥有一个“共享心理模型”。

  • 自我推理: “我为什么要弹这个音符?”
  • 伙伴意图: “我的搭档想做什么?”
  • 团队目标: “我们是在继续演奏爵士乐,还是已经偏离到了摇滚乐?”

论文指出,目前的 AI 就像一个只会完美演奏自己乐器的机器人,却完全不知道乐队其他成员在想什么。现有的数据集只记录了人们“说了什么”以及“做了什么”,但忽略了他们脑海中的“为什么”。

2. 解决方案:ALMANAC(“读心术”数据集)

研究人员构建了一个名为 ALMANAC 的新数据集来解决这个问题。他们采用了上述的“地图任务”,并增加了一个特殊的观察层。

他们是如何收集数据的:

  1. 游戏过程: 50 人两人一组进行“地图任务”(共 25 对)。
  2. “检查点”: 每当玩家完成任务的 25%、50% 和 75% 时,游戏会短暂暂停。玩家必须快速对着麦克风回答:“你认为我们现在的目标是什么?”、“你认为你的搭档现在想做什么?”以及“你刚才为什么那样做?”
  3. 回放: 游戏结束后,玩家观看自己行为的回放。对于他们做出的每一个动作(画线、擦除错误、发送消息),他们都必须再次标注自己的心理状态。

结果:
他们最终得到了 2,987 个具体动作,并且对于每一个动作,都有如下记录:

  • 采取的动作(例如:“画了一条线”)。
  • 团队目标(例如:“我们正试图连接桥梁和山脉”)。
  • 伙伴意图(例如:“我觉得我的搭档对方向感到困惑”)。
  • 自我推理(例如:“我画这条线是因为我觉得山在左边”)。
  • 理由(对思维过程的自由形式解释)。

3. 实验:AI 能“读心”吗?

研究人员测试了六种不同的 AI 模型(包括像 GPT-5.5 和 Claude 这样的大型模型),以观察它们是否能利用这个新数据集表现得像人类协作伙伴一样。他们给了 AI 两项任务:

  1. 预测下一步动作: “根据目前发生的情况,人类接下来会做什么?”
  2. 预测心理状态: “根据目前发生的情况,人类现在正在想什么?”

研究发现:

  • “做什么”很容易,“为什么”很难: AI 模型在预测下一步动作(例如:“人类可能会画一条线”)方面表现得相当不错。
  • “思想”很棘手: 模型在预测内部想法(即心理模型)方面表现挣扎。它们可以较好地猜测共同目标(例如:“我们正在搭建一座桥”),但在猜测人类私密的、个人的推理过程(例如:“我之所以这么画是因为我很紧张”)方面表现得很差。
  • 角色很重要:
    • 引导者(负责给出指令的人)在心理预测上更难,因为他们的思维涉及复杂的空间规划,而这些规划并不总是通过语言表达出来的。
    • 跟随者(负责绘画的人)在心理预测上更容易,因为他们的思维直接受引导者明确指令的影响。
  • 训练有帮助: 当他们使用这个特定数据集来“教导”(微调)一个较小的 AI 模型时,该模型在模拟人类行为方面变得更好,几乎赶上了那些庞大且昂贵的巨型模型。

4. 底线结论

论文得出结论,要让 AI 成为真正的协作伙伴,我们不能只训练它们如何完成任务。我们需要训练它们人类在协作时是如何思考的

ALMANAC 是第一个将人类行为与这些“动作级心理模型”相匹配的数据集。它表明,尽管 AI 在模拟人类行为方面正在进步,但它仍然难以理解使人类团队协作生效的那些无形的、内在的推理过程。该数据集提供了所需的“辅助轮”,旨在教会 AI 如何将其心理模型与人类对齐,而不仅仅是盲目地听从命令。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →