← 最新论文
💻 computer science

REPAIR-Bench: A Benchmark for Robot Error Perception And Interaction Recovery

REPAIR-Bench 是一个源自 214 次人机交互试验的新型基准测试,它通过提供同步的多模态数据和三项新颖的评估任务,解决了先前失效建模中的局限性,旨在推进相互依赖失效的检测、失效类型的视觉分类以及以用户为中心的恢复策略预测。

原作者: Giuliano Pioldi, Yashika Batra, Arman Ibrayeva, Yuanchen Bai, Purnjay Maruur, Promise Ekpo, Angelique Taylor

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Giuliano Pioldi, Yashika Batra, Arman Ibrayeva, Yuanchen Bai, Purnjay Maruur, Promise Ekpo, Angelique Taylor

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在一家繁忙的医院里与一个机器人助手一起工作。你要求机器人去取一种特定的药物,但出了差错。也许是机器人搞混了,或者说话说错了,又或者动作太慢了。

REPAIR-Bench 是一个新的“培训手册”和“考试”,旨在教机器人如何意识到自己搞砸了,更重要的是,如何以一种让用户感到舒适的方式来修复错误。

以下是研究人员所做工作的简单拆解,使用了日常类比:

1. 问题所在:机器人不知道自己在失败

把机器人想象成一个非常礼貌但意识不到自己正在犯错的新员工。

  • 旧方法: 以前的研究将每一次错误视为一个单一、孤立的事件(就像一次“随堂测试”),并且只询问:“它失败了吗?是或否?”它们还依赖于预先写好的、僵化的道歉规则。
  • 新方法: 研究人员意识到,人类对错误的反应是非常复杂的。如果机器人失败了一次,人类会感到有点烦恼;如果它连续失败三次,人类就会感到挫败。机器人需要理解这种“历史记录”,并能在人类开口说话之前,读懂人类细微的肢体语言(比如皱眉或困惑的神情)。

2. 数据集: “急救车”模拟

为了构建这个系统,团队创建了一个名为 RFM-HRI 的特殊数据集。

  • 场景: 他们设置了一个模拟场景,人们需要在机器人的引导下使用一个“急救车”(带有紧急用品的移动医疗推车)。
  • 故障: 研究人员故意让机器人出现了四种特定的故障:
    1. 语音: 机器人说了错误的话。
    2. 时机: 机器人动作太慢。
    3. 理解: 机器人没听懂请求。
    4. 搜索: 机器人找不到物品。
  • 数据: 他们记录了 41 个人进行该任务各 5 次的过程。他们不仅记录了音频,还记录了面部表情(使用一种可以追踪微小肌肉运动的工具)、头部动作以及视线注视。他们还在任务结束后询问参与者:“你感觉如何?”以及“你希望机器人如何修复这个问题?”

3. 三个“考试”(任务)

论文引入了三个具体的挑战,来测试机器人是否足够聪明,能够处理这些情况:

  • 任务 1:“发现故障”计时器

    • 目标: 机器人能否通过观察你的脸,在故障发生的精确时刻说出:“噢不,我刚才搞砸了”?
    • 技巧: 机器人必须在你开口说话之前观察你的脸。这就像服务员注意到你看起来很困惑,就在他掉落托盘的那一刻,甚至在你还没喊出“嘿!”之前。
    • 结果: 他们构建了一个“层级化”的大脑(一种能够记住过去交互的计算机模型)。这个模型在识别失败方面比只看当前时刻的模型表现得更好。它能在约 3 秒内精准定位失败。
  • 任务 2:“诊断”分类

    • 目标: 机器人能否仅通过观察你,就判断出它犯了哪种错误?
    • 类比: 如果医生看到病人咳嗽,他们需要知道这是过敏、感冒还是其他原因。同样,机器人需要知道:“我是说话太快了(时机问题),还是说错了抽屉编号(搜索问题)?”
    • 结果: 机器人在区分“成功”和“语音”错误方面做得相当不错,但在区分“时机”和“理解”错误方面仍然很吃力。这就像一个学生知道自己考试不及格,但不确定是因为没复习还是因为题目太难。
  • 任务 3:“道歉”生成器

    • 目标: 一旦机器人知道自己失败了,它应该说什么或做什么?
    • 类比: 想象你把咖啡洒在了朋友身上。你可以说“抱歉”、“让我拿块毛巾过来”,或者“我会给你买件新衬衫”。不同的人对修复方式的偏好也不同。机器人需要猜出你具体想要什么。
    • 方法: 他们使用了一种叫做“小型语言模型”(类似于智能聊天机器人)的 AI 类型,并对其进行了“微调”(根据这些数据进行专门训练),以建议最佳的恢复策略。
    • 结果: 与未经训练的版本相比,经过微调的机器人能更好地猜中用户偏好的修复方式。它学会了对于某些错误,道歉是有效的,但对于另一些错误,用户其实只是想要一个完成任务的逐步指南。

4. 为什么这很重要

论文认为,为了让机器人在医院等高风险场所获得信任,它们不能仅仅是“笨拙的机器”,在崩溃后只能等待人类重启。它们需要:

  1. 察觉通过肢体语言感知到的失败。
  2. 理解失败的类型。
  3. 适应其恢复策略,以符合人类的实际需求。

研究人员发现,通过赋予机器人“记忆”以及训练它读取细微的面部线索,它会变得更加可靠。他们还发现,仅仅给机器人一套规则是不够的;它需要从人类反馈中学习,才能知道如何正确地道歉或修复问题。

简而言之: REPAIR-Bench 是一个新工具,它帮助机器人通过学习如何观察环境、承认错误,并以一种能让人们保持冷静并产生信任的方式来修复问题,从而成为更好的队友。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →