← 最新论文
💻 computer science

Measuring Successful Cooperation in Human-AI Teamwork: Development and Validation of the Perceived Cooperativity and Teaming Perception Scales

本文通过三项实证研究,引入并验证了两个新量表——感知协作性量表(PCS)和团队组建感知量表(TPS),它们能够有效衡量跨不同情境下人机团队协作的主观质量。

原作者: Christiane Attig, Christiane Wiebel-Herboth, Patricia Wollstadt, Tim Schrills, Mourad Zoubir, Thomas Franke

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Christiane Attig, Christiane Wiebel-Herboth, Patricia Wollstadt, Tim Schrills, Mourad Zoubir, Thomas Franke

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图用一台全新的、高科技的机器人助手来烤蛋糕。有时,这台机器人棒极了:它知道何时该搅拌,会告诉你烤箱是否太热,让你觉得你们是一个完美的烘焙搭档。而有时,这台机器人却令人困惑:它把面糊烤焦了,无视你的指令,或者表现得好像完全不知道自己在做什么。

本文旨在创建两份特殊的“成绩单”(称为量表),以从你的角度精确衡量这种烘焙搭档关系究竟感觉如何。研究人员与本田公司(Honda)和吕贝克大学(University of Lübeck)合作,希望超越仅仅询问“你喜欢这个机器人吗?”,转而询问“我们实际上配合得有多好?”

以下是他们工作的简要拆解,使用了简单的类比:

两份成绩单

研究人员意识到,与人工智能(AI)的协作以两种不同的方式发生,因此他们构建了两种不同的测量工具:

1. “单次时刻”成绩单(感知协作量表 - PCS)

  • 测量内容: AI 在某一项具体任务中的表现如何。
  • 类比: 这就像评判一个舞蹈动作。你的舞伴是否清晰地引领了动作?是否跟随了你的引领?是否仅仅在这一首歌中保持了节奏?
  • 理论基础: 它基于“联合活动理论”(Joint Activity Theory)。它检查 AI 是否具有透明度(你知道它在想什么)、可靠性(它做了它所说的)以及响应性(它倾听了你)。
  • 结果: 他们在三个不同场景中对 409 人进行了测试:玩合作纸牌游戏、与文本聊天机器人聊天、以及使用汽车的行程规划器。这张“成绩单”效果极佳!它能清晰地区分人类搭档(得分高)、聪明但基于规则的可预测机器人(中等得分)以及通过试错学习却感到困惑的机器人(得分低)。

2. “长期团队”成绩单(团队感知量表 - TPS)

  • 测量内容: 你与 AI 在一段时间内是否已成为一个真正的团队的感觉。
  • 类比: 这不仅仅是关于一个舞蹈动作;而是关于你是否感觉自己属于一个舞蹈团。你是否觉得双方都在投入努力?你是否觉得你们拥有共同的目标?你是否觉得这个机器人是“队友”而不仅仅是一个工具?
  • 理论基础: 它基于“进化合作理论”(Evolutionary Cooperation Theory)。它考察双方是否都在付出“代价”(努力)以帮助对方成功。
  • 结果: 该量表包含三个部分:
    • 团队: “我们是一个整体。”
    • 伙伴: “你在帮助我。”
    • 自我: “我在帮助你。”
    • 转折: “自我”部分有些棘手。无论机器人表现得多差,人们往往都给自己打高分。这就像一个学生即使实际上没学习,也会想“我学习很努力!”。研究人员发现,量表的这一部分对情境很敏感;当人们有更多自由决定努力程度时,它效果更好。

他们如何测试(三项研究)

为了确保他们的“成绩单”准确无误,他们使用了三个不同的“训练场”:

  1. 纸牌游戏(Hanabi): 想象一个你无法看到自己手中的牌,必须依赖搭档提示的游戏。

    • 测试: 人们分别与人类、遵循严格规则的机器人以及自主学习的机器人进行游戏。
    • 发现: “成绩单”成功地对它们进行了排名:人类 > 基于规则的机器人 > 学习机器人。学习机器人经常令人困惑,因此人们感觉协作得不好。
  2. 聊天机器人(LLM): 人们使用文本机器人来核查文章事实。

    • 测试: 他们使用了有帮助的机器人、有帮助但添加了不必要更改的机器人,以及失败的机器人。
    • 发现: 这些量表捕捉到了机器人感觉上“协作性”的差异。
  3. 汽车行程规划器: 人们使用特斯拉行程规划器寻找充电站。

    • 测试: 这是一个“边界案例”。汽车并不是真正的“队友”;它只是一个工具。
    • 发现: “单次时刻”成绩单(PCS)在这里仍然运作良好。然而,“长期团队”成绩单(TPS)未被使用,因为汽车行程规划器并没有真正的“思维”或“目标”可供结盟。你很难与 GPS 感觉像是一个团队。

他们的收获(要点)

  • “单次时刻”成绩单非常可靠。 它是一种衡量 AI 在特定任务中表现如何的非常可靠的方法。它适用于从聊天机器人到游戏机器人的一切。
  • “团队”成绩单很强大,但需要谨慎使用。 它衡量的是深层的伙伴关系感觉。然而,人们评估自己贡献的部分存在一点偏差。人们倾向于认为自己是优秀的队友,即使 AI 表现得很糟糕。这表明在僵化的情境中(例如你必须合作的纸牌游戏),人们的自我评分变化不大。
  • 情境很重要。 如果你只是在使用一个工具(如计算器或 GPS),“团队”的感觉并不真正适用。但如果你正在从事一个复杂的项目,需要你和 AI 相互依赖,这些量表就能告诉你这种伙伴关系是否有效。

为什么这很重要

在此之前,我们主要拥有询问“你信任 AI 吗?”或“这个 AI 聪明吗?”的工具。这篇论文提供了一种方法,让我们可以问:“我们现在配合得有多好?”以及“我们感觉像一个团队吗?”

这有助于设计师构建更好的 AI。如果机器人在“可预测性”方面得分低,设计师就知道要让机器人的行动更清晰。如果“团队”得分低,他们就知道机器人需要展示更多的支持和共同目标。

简而言之: 研究人员制作了两把尺子。一把衡量机器人在一首歌中跳得有多好。另一把衡量你是否觉得你和机器人属于同一个舞蹈团。他们在 409 人身上测试了这些尺子,发现它们效果良好,尽管“舞蹈团”尺子需要根据人类拥有多少行动自由来谨慎使用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →