想象一下,你正试图用一台全新的、高科技的机器人助手来烤蛋糕。有时,这台机器人棒极了:它知道何时该搅拌,会告诉你烤箱是否太热,让你觉得你们是一个完美的烘焙搭档。而有时,这台机器人却令人困惑:它把面糊烤焦了,无视你的指令,或者表现得好像完全不知道自己在做什么。
本文旨在创建两份特殊的“成绩单”(称为量表),以从你的角度精确衡量这种烘焙搭档关系究竟感觉如何。研究人员与本田公司(Honda)和吕贝克大学(University of Lübeck)合作,希望超越仅仅询问“你喜欢这个机器人吗?”,转而询问“我们实际上配合得有多好?”
以下是他们工作的简要拆解,使用了简单的类比:
两份成绩单
研究人员意识到,与人工智能(AI)的协作以两种不同的方式发生,因此他们构建了两种不同的测量工具:
1. “单次时刻”成绩单(感知协作量表 - PCS)
- 测量内容: AI 在某一项具体任务中的表现如何。
- 类比: 这就像评判一个舞蹈动作。你的舞伴是否清晰地引领了动作?是否跟随了你的引领?是否仅仅在这一首歌中保持了节奏?
- 理论基础: 它基于“联合活动理论”(Joint Activity Theory)。它检查 AI 是否具有透明度(你知道它在想什么)、可靠性(它做了它所说的)以及响应性(它倾听了你)。
- 结果: 他们在三个不同场景中对 409 人进行了测试:玩合作纸牌游戏、与文本聊天机器人聊天、以及使用汽车的行程规划器。这张“成绩单”效果极佳!它能清晰地区分人类搭档(得分高)、聪明但基于规则的可预测机器人(中等得分)以及通过试错学习却感到困惑的机器人(得分低)。
2. “长期团队”成绩单(团队感知量表 - TPS)
- 测量内容: 你与 AI 在一段时间内是否已成为一个真正的团队的感觉。
- 类比: 这不仅仅是关于一个舞蹈动作;而是关于你是否感觉自己属于一个舞蹈团。你是否觉得双方都在投入努力?你是否觉得你们拥有共同的目标?你是否觉得这个机器人是“队友”而不仅仅是一个工具?
- 理论基础: 它基于“进化合作理论”(Evolutionary Cooperation Theory)。它考察双方是否都在付出“代价”(努力)以帮助对方成功。
- 结果: 该量表包含三个部分:
- 团队: “我们是一个整体。”
- 伙伴: “你在帮助我。”
- 自我: “我在帮助你。”
- 转折: “自我”部分有些棘手。无论机器人表现得多差,人们往往都给自己打高分。这就像一个学生即使实际上没学习,也会想“我学习很努力!”。研究人员发现,量表的这一部分对情境很敏感;当人们有更多自由决定努力程度时,它效果更好。
他们如何测试(三项研究)
为了确保他们的“成绩单”准确无误,他们使用了三个不同的“训练场”:
纸牌游戏(Hanabi): 想象一个你无法看到自己手中的牌,必须依赖搭档提示的游戏。
- 测试: 人们分别与人类、遵循严格规则的机器人以及自主学习的机器人进行游戏。
- 发现: “成绩单”成功地对它们进行了排名:人类 > 基于规则的机器人 > 学习机器人。学习机器人经常令人困惑,因此人们感觉协作得不好。
聊天机器人(LLM): 人们使用文本机器人来核查文章事实。
- 测试: 他们使用了有帮助的机器人、有帮助但添加了不必要更改的机器人,以及失败的机器人。
- 发现: 这些量表捕捉到了机器人感觉上“协作性”的差异。
汽车行程规划器: 人们使用特斯拉行程规划器寻找充电站。
- 测试: 这是一个“边界案例”。汽车并不是真正的“队友”;它只是一个工具。
- 发现: “单次时刻”成绩单(PCS)在这里仍然运作良好。然而,“长期团队”成绩单(TPS)未被使用,因为汽车行程规划器并没有真正的“思维”或“目标”可供结盟。你很难与 GPS 感觉像是一个团队。
他们的收获(要点)
- “单次时刻”成绩单非常可靠。 它是一种衡量 AI 在特定任务中表现如何的非常可靠的方法。它适用于从聊天机器人到游戏机器人的一切。
- “团队”成绩单很强大,但需要谨慎使用。 它衡量的是深层的伙伴关系感觉。然而,人们评估自己贡献的部分存在一点偏差。人们倾向于认为自己是优秀的队友,即使 AI 表现得很糟糕。这表明在僵化的情境中(例如你必须合作的纸牌游戏),人们的自我评分变化不大。
- 情境很重要。 如果你只是在使用一个工具(如计算器或 GPS),“团队”的感觉并不真正适用。但如果你正在从事一个复杂的项目,需要你和 AI 相互依赖,这些量表就能告诉你这种伙伴关系是否有效。
为什么这很重要
在此之前,我们主要拥有询问“你信任 AI 吗?”或“这个 AI 聪明吗?”的工具。这篇论文提供了一种方法,让我们可以问:“我们现在配合得有多好?”以及“我们感觉像一个团队吗?”
这有助于设计师构建更好的 AI。如果机器人在“可预测性”方面得分低,设计师就知道要让机器人的行动更清晰。如果“团队”得分低,他们就知道机器人需要展示更多的支持和共同目标。
简而言之: 研究人员制作了两把尺子。一把衡量机器人在一首歌中跳得有多好。另一把衡量你是否觉得你和机器人属于同一个舞蹈团。他们在 409 人身上测试了这些尺子,发现它们效果良好,尽管“舞蹈团”尺子需要根据人类拥有多少行动自由来谨慎使用。
以下是论文《衡量人机团队协作中的成功合作:感知协作性与团队化感知量表的开发与验证》的详细技术总结。
1. 问题陈述
随着人工智能(AI)日益融入日常生活和混合工作环境中,迫切需要可靠的工具来评估人机合作的主观质量。虽然现有的量表测量了对 AI 的一般态度或 AI 素养,但它们未能捕捉合作互动中具体的、以过程为导向的动态特征。
作者指出了在衡量人机整合的两个不同维度方面存在的空白:
- 同步整合(Synchronic Integration): 指单一任务序列(例如,特定的互动)内的相互依赖程度。
- 历时整合(Diachronic Integration): 指随时间推移在重复互动中合作的连续性和稳定性(例如,长期伙伴关系)。
目前的工具未能充分区分对代理在单一时刻的合作能力的感知与随时间发展而产生的“团队化”(teaming)涌现感。此外,还缺乏经过验证的工具,能够直接比较人与人之间的合作与人与 AI 之间的合作。
2. 方法论
理论框架
本研究引入了两个具有理论基础的量表:
- 感知协作性量表(PCS): 基于联合活动理论(Joint Activity Theory)。它测量代理在单次互动序列中被感知到的能力和实践。它将有效代理的八个特征操作化:可观察性、可监控性、可沟通性、自我评估、可靠性、可引导性、选择性和协调性。
- 团队化感知量表(TPS): 基于**进化合作理论(Evolutionary Cooperation Theory)**和共享行动框架。它测量源于相互贡献和支持而产生的团队化涌现感。其概念化为三个维度:
- 团队(Team): 作为一个整体的群体的涌现感。
- 自我(Self): 人类自身的合作投入和支持。
- 伙伴(Partner): 人类对 AI 的支持和贡献的感知。
量表构建
- 题目生成: 初始题目池源自理论构念。题目采用通俗易懂的语言表述(例如,“我有这样的感觉……"),以确保直观的反应。
- 改编: 两个量表均开发了针对 AI 伙伴(PCS-A, TPS-A)和人类伙伴(PCS-H, TPS-H)的平行版本,以便进行跨代理比较。
- 翻译: 采用了严格的翻译和回译程序,以确保德语和英语版本之间的语言等效性。
研究设计与样本
量表在三项独立研究中进行了验证,共涉及N = 409 名具有不同人口统计学特征和背景的参与者:
- 研究 1(Hanabi 纸牌游戏): 一种高相互依赖性的合作游戏。参与者分别与人类伙伴、基于规则的 AI 代理(RB)和强化学习 AI 代理(RL)进行游戏。这测试了量表区分具有不同合作透明度和可预测性的伙伴的能力。
- 研究 2(大语言模型互动): 参与者使用四个具有不同自主程度和目标一致性(专注、增强、冲突、失败)的大语言模型(LLM)聊天机器人版本对文章进行事实核查。这测试了在低相互依赖情境下对不同合作质量的敏感性。
- 研究 3(特斯拉行程规划器): 与决策支持系统(低代理性)的真实世界互动。这作为一个边界案例,用于测试 PCS 在“伙伴”是工具而非代理的情境中的适用性。
心理测量分析
作者采用了标准的量表评估程序:
- 维度性: 探索性因子分析(EFA)和验证性因子分析(CFA)以确定因子结构。
- 信度: Cronbach's α 和 McDonald's ω。
- 效度: 区分效度(与 SIPA、信任、温暖、能力、接受度的相关性)和准则效度(区分不同伙伴类型的能力)。
3. 主要贡献
- 开发两种新量表: 创建了专门为人机团队协作设计的PCS(经修订后为 14 个题目)和TPS(9 个题目,3 个子量表)。
- 理论基础: 量表明确关联到联合活动理论(同步)和进化合作理论(历时),为未来研究提供了坚实的理论基础。
- 跨代理可比性: 包含人类伙伴版本,使研究人员能够使用相同的指标直接将 AI 性能与人类性能进行基准比较。
- 实证验证: 在三种不同情境(游戏、LLM 聊天、现实世界导航)和不同人群(学生、Prolific 工作者、电动汽车驾驶员)中进行了全面验证。
4. 结果
维度性与题目分析
- PCS: CFA 和 EFA 支持单维结构。题目PCS14(“我有这样的感觉,即该人/代理能够意识到我们采用了不同的方法……")在不同情境下显示出较差的区分度和较低的置信度评分,因此被排除,最终形成 14 个题目的量表。
- TPS: 虽然 EFA 结果不一,但作者保留了理论的三因子结构(团队、自我、伙伴)。
- 团队和伙伴子量表显示出良好的内部一致性和题目区分度。
- 自我子量表显示出较差或存疑的信度(特别是在游戏情境中)以及较低的题目区分度。分析表明,该子量表可能捕捉到一种稳定的、带有积极偏差的自我评价,而非特定互动的动态特征,特别是在任务结构限制了行为变异的情况下。
信度
- PCS: 在所有样本和情境中均表现出极佳的内部一致性(α≈.93)。
- TPS: 复合量表以及团队/伙伴子量表显示出良好至极佳的信度(α≈.88−.96)。在非游戏情境(LLM 研究)中,由于参与者拥有更多自主权,自我子量表的信度有所提高。
效度
- 构念效度: 两个量表均显示出与感知能力、系统可信度和主观信息处理意识(SIPA)的预期正相关。
- 区分度(准则效度): 两个量表成功区分了不同质量的合作伙伴:
- 排序: 人类伙伴 > 基于规则的 AI > 强化学习 AI(研究 1);目标一致的 LLM > 目标不一致/失败的 LLM(研究 2)。
- 效应量: 在不同伙伴类型之间发现了巨大的效应量,证实了量表对合作质量的敏感性。
- 边界案例: 在研究 3(特斯拉行程规划器)中,即使面对低代理性系统,PCS 仍然具有意义,但 TPS 未予实施,因为未满足“团队化”的条件。
5. 意义与启示
- AI 设计的诊断工具: PCS 题目直接映射到特定的合作能力(例如,可观察性、可靠性)。特定题目的低分可以为设计者提供可操作的反馈,指出哪些代理行为需要改进。
- 区分“工具”与“队友”: 这些量表有助于区分 AI 仅作为工具(由 PCS 良好测量)的互动与产生真实团队感(由 TPS 测量)的互动。
- 对研究人员的指导: 论文提供了关于量表使用的具体建议,包括:
- 在选择量表之前评估同步/历时整合的程度。
- 在互动 episodes 结束后立即施测量表,而不是事后回顾。
- 由于可能存在积极偏差,需谨慎解释 TPS 的“自我”子量表。
- 未来研究的基础: 这些量表使得对混合团队动态、信任校准以及人机伙伴关系长期演变的严格实证研究成为可能。
结论: 本研究成功验证了感知协作性量表和团队化感知量表是稳健的、具有理论基础的工具。它们填补了人机互动研究中的关键空白,提供了可靠的指标来评估合作的主观质量,适用于多种情境,并能够区分不同水平的人机合作性能。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。