← 最新论文
💻 computer science

How Users Understand Robot Foundation Model Performance through Task Success Rates and Beyond

本文研究了非专家用户如何解读机器人基础模型的性能指标,发现虽然他们能有效利用任务成功率,但同时也高度重视失败案例的细节,并渴望能够获取历史评估数据以及机器人在处理新任务时的自身评估结果。

原作者: Isaac Sheidlower, Jindan Huang, James Staley, Bingyu Wu, Qicong Chen, Reuben Aronson, Elaine Short

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Isaac Sheidlower, Jindan Huang, James Staley, Bingyu Wu, Qicong Chen, Reuben Aronson, Elaine Short

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你刚刚买了一个全新的、超级智能的厨房机器人。你想让它把一个花瓶放到高高的架子上。但问题在于,你从未见过这个特定的机器人完成这项特定的任务。你如何知道它是会成功,还是会撞掉花瓶使其碎裂?

这篇论文就像是一本“信任使用手册”。研究人员想要了解普通人(非专家)是如何理解机器人科学家给这些机器人的“成绩单”的。

“成绩单”问题

目前,当科学家测试这些机器人时,他们主要给出一个单一的分数:任务成功率 (Task Success Rate, TSR)。

  • 类比: 把 TSR 想象成棒球中的打击率。如果一个机器人的成功率是 80%,这意味着它在 10 次尝试中有 8 次完成了工作。
  • 研究发现: 研究发现,普通人完全能理解这个数字。如果数字很高,人们就会有信心让机器人单独工作;如果数字很低,人们就会感到紧张并想要近距离观察。

拼图中的缺失部分

然而,研究人员发现,仅仅有一个打击率是不够的。想象一下,如果一位棒球教练只告诉你:“他的打击率是 80%,”却从未告诉过你他如何失败。

  • 类比: 如果你知道那个球员在跑向一垒时总是被自己的脚绊倒,你就会知道要退后一点。但如果你只知道平均值,你可能会被球砸中。
  • 研究发现: 研究表明,人们非常想了解关于失败的信息。他们希望听到一段通俗易懂的故事,比如:“这个机器人通常很成功,但有时它会抓错瓶子。”这有助于人们为最坏的情况做好准备。

“真实数据” vs. “机器人的猜测”

研究人员测试了两种不同的信息提供方式:

  1. 真实数据(过去): “我们尝试过这项精确的任务 5 次,其中 4 次成功了。”
  2. 机器人的猜测(估计值): “我认为我完成这项任务的概率是 80%。”

令人惊讶的是: 人们都喜欢这两种方式,但稍微更偏好真实数据。

  • 类比: 这就像买二手车。比起汽车电脑猜测“我觉得今天我会运行良好”(估计值),你更信任修理工的报告说“这辆车在没有故障的情况下行驶了 5 万英里”(真实数据)。
  • 然而,人们仍然觉得机器人自己的估计值非常有用,尤其是对于机器人从未尝试过的任务。

“亲临现场”的影响因素

研究人员进行了两项研究:一项是人们通过电脑观看视频,另一项是人们站在大厅里观察一个真实的机器人尝试将汤罐头放到架子上。

  • 研究发现: 在现实生活中观察机器人并不会改变人们想要什么样的信息。他们仍然想要成功率和失败案例。
  • 新的转折: 当站在机器人旁边时,人们会对物理安全更加担心。他们会问:“如果它掉下罐头,会弄坏我的地板吗?”或者“它会撞到我吗?”他们想要了解机器人的力量和速度,这些是他们在仅仅观看视频时不太会考虑的事情。

核心结论

论文得出结论,为了让这些机器人在我们的家庭中既安全又实用,我们不能只向用户展示一个数字(比如“80%”)。我们需要提供一份完整的“档案”,其中包括:

  1. 分数: 它成功的频率。
  2. “恐怖故事”: 对它可能如何失败的清晰描述。
  3. 证据: 它执行类似任务的真实视频。
  4. 预测: 机器人对自己完成新任务能力的诚实猜测。

通过提供这样一个全面的图景,人们可以做出更明智的决定:是在何时让机器人独立工作,以及在何时准备好安全保障。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →