想象一下,你刚刚买了一个全新的、超级智能的厨房机器人。你想让它把一个花瓶放到高高的架子上。但问题在于,你从未见过这个特定的机器人完成这项特定的任务。你如何知道它是会成功,还是会撞掉花瓶使其碎裂?
这篇论文就像是一本“信任使用手册”。研究人员想要了解普通人(非专家)是如何理解机器人科学家给这些机器人的“成绩单”的。
“成绩单”问题
目前,当科学家测试这些机器人时,他们主要给出一个单一的分数:任务成功率 (Task Success Rate, TSR)。
- 类比: 把 TSR 想象成棒球中的打击率。如果一个机器人的成功率是 80%,这意味着它在 10 次尝试中有 8 次完成了工作。
- 研究发现: 研究发现,普通人完全能理解这个数字。如果数字很高,人们就会有信心让机器人单独工作;如果数字很低,人们就会感到紧张并想要近距离观察。
拼图中的缺失部分
然而,研究人员发现,仅仅有一个打击率是不够的。想象一下,如果一位棒球教练只告诉你:“他的打击率是 80%,”却从未告诉过你他如何失败。
- 类比: 如果你知道那个球员在跑向一垒时总是被自己的脚绊倒,你就会知道要退后一点。但如果你只知道平均值,你可能会被球砸中。
- 研究发现: 研究表明,人们非常想了解关于失败的信息。他们希望听到一段通俗易懂的故事,比如:“这个机器人通常很成功,但有时它会抓错瓶子。”这有助于人们为最坏的情况做好准备。
“真实数据” vs. “机器人的猜测”
研究人员测试了两种不同的信息提供方式:
- 真实数据(过去): “我们尝试过这项精确的任务 5 次,其中 4 次成功了。”
- 机器人的猜测(估计值): “我认为我完成这项任务的概率是 80%。”
令人惊讶的是: 人们都喜欢这两种方式,但稍微更偏好真实数据。
- 类比: 这就像买二手车。比起汽车电脑猜测“我觉得今天我会运行良好”(估计值),你更信任修理工的报告说“这辆车在没有故障的情况下行驶了 5 万英里”(真实数据)。
- 然而,人们仍然觉得机器人自己的估计值非常有用,尤其是对于机器人从未尝试过的任务。
“亲临现场”的影响因素
研究人员进行了两项研究:一项是人们通过电脑观看视频,另一项是人们站在大厅里观察一个真实的机器人尝试将汤罐头放到架子上。
- 研究发现: 在现实生活中观察机器人并不会改变人们想要什么样的信息。他们仍然想要成功率和失败案例。
- 新的转折: 当站在机器人旁边时,人们会对物理安全更加担心。他们会问:“如果它掉下罐头,会弄坏我的地板吗?”或者“它会撞到我吗?”他们想要了解机器人的力量和速度,这些是他们在仅仅观看视频时不太会考虑的事情。
核心结论
论文得出结论,为了让这些机器人在我们的家庭中既安全又实用,我们不能只向用户展示一个数字(比如“80%”)。我们需要提供一份完整的“档案”,其中包括:
- 分数: 它成功的频率。
- “恐怖故事”: 对它可能如何失败的清晰描述。
- 证据: 它执行类似任务的真实视频。
- 预测: 机器人对自己完成新任务能力的诚实猜测。
通过提供这样一个全面的图景,人们可以做出更明智的决定:是在何时让机器人独立工作,以及在何时准备好安全保障。
技术摘要:用户如何通过任务成功率及其他信息理解机器人基础模型的性能
问题陈述
机器人基础模型(RFMs)承诺提供能够执行任意任务的通用家用机器人。然而,在非专家用户请求新颖任务(即 RFM 未经显式训练或评估的任务)时,如何解读性能指标存在关键性的差距。虽然任务成功率(TSR)是评估 RFM 的标准指标,但目前尚不清楚新手是否能按预期解读这些概率数据。此外,物理环境中失败的高昂代价要求用户不仅要了解机器人是否会成功,还要了解它可能如何失败。目前的评估往往缺乏对失败模式的透明度,这可能导致意外失败并削弱信任。本文研究了非机器人专家如何解读 RFM 的性能信息,特别关注了 TSR、失败案例描述,以及真实历史数据与内部性能估计之间的相互作用。
研究方法
作者进行了一项两部分的研究,以评估用户对 RFM 性能数据的解读情况:
在线研究 (n=112): 参与者被展示了来自三个已发表的 RFM 研究项目(OpenVLA、Baku 和 Multimodal Diffusion Transformer)的真实评估数据,涉及 16 个不同的操纵任务。研究采用了受试者内设计,用户根据以各种排列组合方式呈现的四种信息类型来评估机器人能力:
- 估计任务成功率 (ETSR): 机器人对所请求任务成功概率的内部估计。
- 估计失败案例 (EFC): 对所请求任务最可能失败模式的自然语言描述。
- 相关任务 - 任务成功率 (RT-TSR): 来自被认为与用户请求“相似”任务的历史 TSR 数据。
- 相关任务 - 失败案例 (RT-FC): 来自相似任务的历史失败描述。
参与者在观看任务视频(视频采样反映了实际的成功/失败率)前后,对信任度、舒适度和信息充分性进行了评分。
线下研究 (n=14): 为了考察具身性(embodiment)的影响,参与者观察了一台 Kinova Gen3 Lite 机器人在大学大厅内自主尝试放置汤罐的任务。他们被提供了相同的四种信息类型,并被要求评估该机器人在家庭环境中的效用和可靠性。
核心贡献
本文提出了三个主要贡献:
- 验证了 TSR 的解读能力: 研究实证验证了非专家用户对 TSR 的解读方式与专家预期一致。报告的 TSR 值与用户报告的系统信任度和信心之间存在显著的正相关关系。
- 失败信息的价值: 作者证明了失败案例的自然语言描述深受非专家用户的青睐。这些描述有助于用户理解风险并为潜在失败做准备,这表明在 RFM 评估中需要实现失败案例报告的标准化。
- 对真实数据与估计的双重需求: 研究强调,用户既渴望来自相似任务的真实历史数据(植根于现实),也渴望机器人对新颖任务的自身估计。这表明 RFM 在部署时必须具备访问大规模评估历史的能力,并具备准确估计未测试任务性能的能力。
结果
- 信息充分性: 任何信息类型的存在都显著增加了用户感知的信息充分性。然而,成功率(TSR)对感知充分性的影响效应量大于失败案例。
- 舒适度与信任: 用户舒适度和信任度受高成功率(包括 ETSR 和 RT-TSR)的强烈预测。相反,失败案例描述(EFC 和 RT-FC)的存在并未显著增加报告的舒适度,尽管用户仍认为它们有用。
- 效用排名: 大多数用户发现所有信息类型都有用。定量分析显示,ETSR 被认为比 EFC 更有用,RT-TSR 比 RT-FC 更有用。然而,ETSR 并不比所有其他类型结合起来的效用显著更高。
- 预测准确性: 只有 ETSR 显著提高了用户正确预测二元成功/失败结果的能力(准确率为 61.9%),这表明它是最重要的即时结果预测指标。
- 定性洞察: 用户采用了多样化的策略,例如使用阈值(例如,拒绝 ETSR < 70% 的任务)或将估计值与真实数据进行交叉验证。许多人对缺乏现实证据支持的估计表示怀疑。
- 具身效应: 线下研究在很大程度上证实了在线研究的发现。然而,具身交互引发了更多关于物理安全(如损坏地板或物体)以及速度和工作空间要求等实际约束的具体担忧。
意义与主张
本文主张,虽然 TSR 是一个必要的指标,但对于在家庭环境中安全有效地部署 RFM 而言,仅靠 TSR 是不够的。作者主张转向以用户为中心、具有可解释性的评估,其中包括:
- 标准化报告失败案例(包括常见场景和最坏情况场景)。
- 同时提供真实的历史数据和针对新颖任务的可靠性能估计。
- 使 RFM 能够表现得具有可预测性,或能够对新任务的行为进行预测。
作者强调,知情的用户更有能力与机器人协作、教学并给予适当的信任。通过弥合专家评估指标与用户理解之间的鸿沟,这项工作旨在为未来的 RFM 评估标准和部署策略提供参考,确保用户可以就何时进行监督、教学或避免特定的机器人任务做出明智的决定。论文谦虚地指出,虽然这些发现源自特定的任务领域(厨房家务、操纵),但信息透明度的原则很可能推广到不同的机器人形态和任务类型。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。