How can we assess human-agent interactions? Case studies in software agent design
本文介绍了 PULSE,这是一个以人为中心的评估框架,它将用户反馈与机器学习预测相结合,用于评估真实软件工程场景中的大语言模型(LLM)智能体设计,并证明了这种协作式评估能够产生更稳健的见解,且与传统的基于基准测试的评估相比,揭示了显著的差异。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在构建一个能够帮助人们编写计算机代码的机器人助手。长期以来,衡量你的机器人是否“优秀”的唯一方法是给它进行标准化测试,比如选择题考试。如果机器人的得分很高,开发者就会认为它是一名明星员工。
但本文的作者认为,这就像仅仅通过一个人能否遵循食谱书来评判一位厨师,却从未见过他在真实的、饥肠辘辘的顾客面前烹饪。在现实世界中,人类和 AI 智能体是在作为一个团队共同工作的。有时人类必须介入,纠正机器人,或者改变计划。一个获得完美测试成绩的机器人可能仍然让人在协作时感到沮丧;而一个得分稍低的机器人,却可能是一个令人愉悦的合作伙伴。
这篇论文介绍了一种衡量人类与机器人团队实际协作效果的新方法。他们将这个新系统称为 PULSE。
问题所在: “考试” vs. “真实工作”
把目前的 AI 基准测试想象成一次在空旷赛道上的驾驶测试。汽车(AI)必须完美地保持在车道内并停在红灯前。如果它做到了,就算通过。
但现实生活更像是在高峰期的交通流中带着一名乘客驾驶。乘客可能会说:“嘿,换条路走,”或者“等等,我得先去趟超市。”汽车必须倾听、适应并让乘客感到满意。旧有的“空旷赛道”测试无法衡量汽车是否会让乘客感到烦躁,或者乘客是否感到安全。
解决方案: PULSE(“反馈循环”)
研究人员构建了一个名为 PULSE 的框架来衡量这种现实世界的团队协作。他们使用了一个名为 OpenHands 的软件智能体(机器人代码编写员)进行了测试,共有 15,000 名真实用户使用它来编写代码。
以下是 PULSE 的工作原理,使用了一个简单的三步配方:
1. “网约车”评分(数据收集)
他们没有等到项目结束才问“这个机器人怎么样?”,而是在完成每一个小任务后就请求反馈,就像你在单次行程结束后为一名 Uber 司机评分一样。
- 运作方式: 当机器人完成一小块工作(如修复一个 bug)时,会弹出一个窗口,请用户给出 1 到 5 星的评分。
- 难点: 大多数人都很懒,不想每次都停下来给机器人评分。因此,他们只获得了大约 5% 任务的评分。其余 95% 的交互是“沉默”的,用户只是继续工作,没有说话。
2. “读心术”(预测模型)
由于他们只有 5% 任务的真实评分,因此需要一种方法来猜测另外 95% 任务中用户的感受。
- 他们训练了一个名为“读心者”的机器学习模型。该模型观察对话中的线索,例如:
- 用户情绪: 用户在消息中是愤怒还是开心?
- 机器人错误: 机器人是否误解了指令?
- 进度: 用户是否真的保存了他们编写的代码?
- 利用这些线索,该模型可以预测用户在面对那些“沉默”任务时原本会给出怎样的评分。
3. “超级统计学家”(高效结果)
这是其中的神奇之处。通过将少量的真实评分与大量的预测评分相结合,他们可以更快、更确定地计算出结果。
- 类比: 想象你想知道一种新口味的冰淇淋是否比旧口味更好。
- 旧方法(标准 A/B 测试): 你请 100 个人品尝两种口味并评分。这需要很长时间,且结果可能模糊不清。
- PULSE 方法: 你请 100 个人品尝,但你也拥有一个“口味预测器”,它通过观察他们舔勺子的动作、吃得有多快以及他们的面部表情,来预测另外 1,000 个甚至没品尝过的人的评分。
- 结果: PULSE 提供的确定性水平与标准测试相当,但其噪声(不确定性)减少了 40%。这就像是用更短的曝光时间拍到了更清晰的照片。
他们的发现(令人惊讶的结果)
当他们使用 PULSE 来测试不同的机器人设计时,他们发现了一些旧有的“考试成绩”所遗漏的东西:
- “大脑”最为关键: 决定人类是否喜欢该机器人的最主要因素是它使用了哪种“大脑”(底层的 AI 模型)。更换一个更聪明的大脑会对用户满意度产生巨大影响。
- “身体”影响较小: 改变机器人组织思路的方式(例如展示待办事项列表或更好地记忆信息)对用户幸福感的影响要小得多。
- 考试会撒谎: 这是最大的冲击。他们将真实的现实世界人类评分与标准的 AI 基准测试进行了对比。
- 结果: 基准测试显示机器人 A 比机器人 B 更好。但人类实际上更喜欢机器人 B!
- 教训: 一个机器人可以考出完美的笔试成绩,但在真实的对话中却可能是一个糟糕的伙伴。
总结
论文得出结论,如果我们想要构建真正能帮助人类的 AI,我们不能仅仅看测试分数。我们必须观察人类与机器人如何在野外进行互动。PULSE 是一个工具,它通过结合真实反馈和智能预测,帮助开发者高效地进行开发,从而构建出人们真正乐于与之共事的机器人。
他们还指出,虽然他们目前专注于编程领域,但这种相同的“PULSE”方法也可以用于任何与人类协作的机器人(如旅行规划师或购物助手),只需更改“读心者”所观察的“线索”即可。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。