ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions
本文介绍了 ERR@HRI 3.0 挑战赛,该挑战赛引入了两个自然主义的众包视频数据集,旨在推进用于检测旁观者对机器人错误反应及预测潜在故障的端到端多模态机器学习,并证明了提交的模型表现优于基准系统。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观察一个机器人尝试制作三明治。有时,机器人会掉落面包;有时,它会试图把烤面包机放进冰箱里。过去,科学家们试图通过给机器人一份“特征”清单(比如“面包是否在地上?”)并让它观察已经过清洗和整理的数据,来教会机器人注意到这些错误。但本文的作者说:“等等!这就像是通过看一张在完美灯光摄影棚里的自行车图解来学习骑自行车一样。现实生活是混乱的!”
本文介绍了 ERR@HRI 3.0,这是一个旨在帮助机器人更好地发现自身失误——甚至在失误发生前进行预判——的挑战赛,其方法是通过观察人类真实的、混乱的反应来实现。
两个重大任务
该挑战赛为研究人员提供了两个不同的“视频游戏关卡”来解决,使用的是人们观看机器人(以及人类)失败时的原始、未经编辑的网络摄像头视频。
第一关:“哎呀!”检测器(BAD 数据集)
想象一下,45 个人坐在屏幕前,观看机器人或人类犯错的视频。这里的目标是反应性的:计算机能否在错误发生之后,通过观察人的脸部表情并说出:“噢,他们刚刚看到了一个失败案例!”?
- 难点: 视频是原始的。光线在变化,摄像机角度很奇怪,而且人们坐的位置各不相同。这是真实世界,而不是实验室。
- 数据: 总共有 46 种失败场景和 1,645 个视频片段。每个片段的时长约为 15.5 秒。
- 结果: 该挑战赛有 3 支队伍 提交了模型。所有模型的表现都优于论文自带的“基准(baseline)”模型(该模型基本上是一个尽力而为的标准神经网络)。基准模型的得分是 0.502 macro F1(这是一个衡量模型平衡检测失败与非失败情况能力的特定分数,而非简单的准确率百分比),但新的模型成功超越了它。
第二关:“这主意真糟!”预测器(Bad Idea 数据集)
这是更酷、更巧妙的部分。想象 29 个人正在观看一段机器人开始做某事的视频,但在我们看到它是成功还是失败之前,视频就切断了。这些人必须猜测:“这会有一个好结果还是坏结果?”
- 目标: 计算机能否在观察人进行猜测的过程中,通过观察其面部表情来判断他们认为将会发生什么?这是预判性的。它的核心在于在“撞车”发生前捕捉到那种“糟糕”的神情。
- 数据: 共有 30 种场景和 865 个片段。这些片段非常短,仅为 1.95 秒 左右。
- 结果: 同样,参加这一关的 3 支队伍 都击败了基准模型。基准模型的 AUC-ROC 得分 为 0.564(一种衡量模型区分“好猜测”与“坏猜测”能力的指标,其中 0.5 代表随机猜测),这表明根据瞬间的面部表情来预测未来是极其、极其困难的。
本文对什么说“不”
作者非常明确地指出了哪些方法在处理此类问题时效果不佳,并明确排除了旧有的做法:
- 拒绝“预清洗”数据: 论文指出,以往的大多数工作都依赖于预先提取的特征,这限制了研究人员可以使用的方法类型。为了解决这个问题,挑战赛发布了原始视频数据。这种设计选择并不是为了禁止特征工程,而是为了让研究人员能够直接在像素数据上应用现代的端到端学习方法,并观察它们是否能比旧方法更好地应对现实生活的混乱。
- 拒绝“实验室完美”设置: 他们拒绝了机器人应该只在完美灯光的受控房间里学习的观点。他们想要的是来自众包数据的混乱感(不同的摄像机、奇怪的角度),因为这才是机器人将来在现实世界中真正会面临的情况。
- 拒绝“仅仅是反应”: 他们认为,等到错误发生后再去修复已经太晚了。他们推动了预判——在错误完全发生之前就察觉到不对劲。
他们有多确定?
论文并未声称他们已经永久解决了机器人安全问题。相反,他们建议这些新的数据集和方法是一个更好的起点。
- 他们使用特定的数学评分(如 macro F1 和 AUC-ROC)在团队从未见过的测试集上测量了结果。
- 他们发现,虽然新模型比旧的基准模型更好,但“预判”任务(第二关)仍然非常棘手。基准模型在视频片段时间中花费了 35.6% 的时间才开始检测到信号,而对于反应性任务(第一关)则是 8.8%。这表明,读懂一张“坏主意”的脸比读懂一张“哎呀”的脸要难得多。
- 作者指出,有三支队伍提交了有效的模型,且所有模型都超越了基准模型。他们并没有说模型是完美的,只是说它们向前迈进了一步。
核心启示
可以将这篇论文看作是那些科学竞赛的组织者在说:“别再制造只能在玻璃盒子里工作的机器人了。让我们看看它们能否应对现实客厅里的混乱。”他们提供了两组混乱的、真实的视频,并向最聪明的程序员们发起挑战,看他们能否构建出既能识别机器人错误,又能预判灾难的模型。结果表明,虽然做得比旧方法更好是可能的,但拥有“水晶球”般的预判错误能力仍处于开发阶段。作者希望这些工具能帮助构建更加敏锐、更值得信赖、且准备好应对人类混乱现实的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。