Evaluating Uncertainty and Quality of Visual Language Action-enabled Robots
本文提出并实证验证了一套针对视觉-语言-动作(VLA)机器人的不确定性与质量指标,通过一项大规模研究表明,这些指标与人类专家的判断高度相关,并且相比于传统的二元成功率,能为任务执行提供更细致的评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:机器人不再是仅仅遵循严格的“如果……那么……”指令的盲目机器,而是像充满好奇心、超级聪明的助手一样,能够观察世界、理解你的话语,并懂得如何控制自己的身体来帮助你。这就是*视觉-语言-动作(VLA)*机器人的激动人心的前沿领域。把它们想象成终极的“智能管家”:它们能看到凌乱的房间,听到你说“请把红色的杯子放到篮子里”,然后真的去执行。但问题在于:仅仅因为机器人完成了*任务,并不意味着它做得好*。它可能撞倒了另外三个杯子,两次掉落了那个红色的杯子,或者在最终成功之前,由于晃动得太厉害,看起来像是在进行一场恐慌发作。
长期以来,科学家们一直用一个简单的二元开关来评判这些机器人:它成功了吗?是或否。这就像是在给学生的作文评分时,只给出一个表示“完成”的对勾,却不对其字迹是否潦草或拼写是否错误发表任何评论。本文认为,这种“通过/失败”的系统是失效的。这就像说一位厨师很棒,仅仅因为他为你端上了一个汉堡,即便这个汉堡被烤焦了、掉在了地上,并且是用叉子重新组装起来的。为了解决这个问题,研究人员需要一种方法,不仅要衡量机器人是否完成了工作,还要衡量它在执行过程中的感受——它是平稳自信,还是摇晃犹豫?
机器人的“恐慌计”与“流畅度得分”
在这项研究中,研究人员决定不再询问机器人“你做到了吗?”,而是开始询问:“你有多确定,以及你有多优雅?”他们将机器人的大脑视为一个正在参加考试、紧张不安的学生。他们引入了两种新的方式来为机器人评分:不确定性(机器人对其选择的信心程度)和质量(动作的平滑度和安全性)。
为了衡量不确定性,他们观察了机器人的“内心独白”。想象一下,机器人正试图抓取一个杯子。一个自信的机器人会想:“我 99% 确定那是杯子,我会就在这里抓取它!”而一个困惑的机器人可能会想:“那是杯子吗?还是个罐子?也许我应该在这里抓……不,也许那里?噢不,我不确定!”研究人员创建了八种不同的“恐慌计”来捕捉这种困惑。其中一些计器监听机器人的数字思维(检查其概率预测是否分散),而另一些则观察其物理运动。如果机器人的手臂开始抖动、震颤或做出突然的、剧烈的修正,计器就会将其标记为“高不确定性”,这意味着机器人正在纠结于该做什么。
为了衡量质量,他们观察了机器人的舞蹈动作。他们使用了五种不同的“流畅度得分”来观察机器人移动起来像是一位优雅的芭蕾舞者,还是一位笨拙的幼儿。他们检查了诸如突然的震动、异常的加速度,或者机器人是否不得不回溯并重新规划路径等情况。高质量的执行就像是平滑、流动的动作,机器人清楚地知道自己的去向。而低质量的执行则充满了停顿、起伏和险些出错的情况。
伟大的机器人现实检验
团队不仅仅是在凭空猜测;他们通过一次大规模实验进行了测试。他们选取了目前最聪明、最先进的三种机器人大脑(称为 OpenVLA、SpatialVLA 和 ),并要求它们执行 908 项不同的任务,例如拿起物体、将物体移动到其他物体附近、堆叠物品或将物品放入容器内。
这里有一个巨大的惊喜:那些通过了测试的机器人往往在“质量”测试中失败了。
当他们查看结果时发现,一个机器人模型可以成功完成一项任务(比如拿起一个杯子),但其执行方式却很糟糕。例如,其中一个机器人模型 () 非常擅长完成工作,但当人类专家观看视频时,他们发现这个机器人经常表现得笨拙、掉落物品,或者以一种摇晃、不确定的方式移动。事实上,对于某些任务,超过一半的“成功”尝试都被专家标记为“低质量”。这证明了旧有的“通过/失败”测试在欺骗我们。机器人可以通过运气或蛮力通过测试,即使它实际上并没有做得很好。
这些计器告诉了他们什么
研究人员随后检查了他们的“恐慌计”和“流畅度得分”是否真的能预测人类专家的看法。
好消息: 几种新的指标表现得非常出色。具体而言,衡量动作速度不稳定性(机器人速度变化有多突然)和动作加速度不稳定性(动作有多颠簸)的指标与人类的观点有着强烈的联系。如果机器人动作抖动,人类就会认为其质量低;如果机器人动作平滑,人类也会表示赞同。这表明我们可以使用这些数学公式来自动判断机器人是否做得好,而无需让人类去观看每一段视频。
“你在移动吗?”的小技巧: 他们还发现了一种识别完全失败的巧妙方法。他们使用了一个名为最优轨迹差异 (OT) 的指标,这个指标基本上是在问:“机器人是否正在接近目标?”如果机器人卡住了或者根本没有移动,这个指标能瞬间识别出这是一个失败。这是区分“成功完成任务的机器人”与“完全失败的机器人”的最佳工具。
坏消息: 其中一个名为执行变异性 (EV) 的指标——它试图通过多次运行机器人的大脑来观察是否会给出不同的答案,从而衡量不确定性——在现实生活中使用起来过于缓慢且成本过高。它消耗了太多的计算资源,导致在实时使用中并不实用。此外,他们发现某些指标无法区分“还可以”(中等质量)和“完全失败”之间的区别,这表明随着机器人表现变差,它们看起来会越来越像彻底的失败。
总结
本文的核心教训是,我们不能再像对待简单的及格/不及格考试那样去评判机器人。仅仅因为机器人完成了任务,并不意味着它是安全、高效或可靠的。研究人员展示了通过使用这些新的“信心”和“流畅度”得分,我们可以更清晰地了解机器人的实际表现。
他们建议,在未来,我们应该使用这些指标来构建更好的“测试预言机”(即决定机器人是否通过的规则)。与其仅仅检查杯子是否在篮子里,我们还应该检查机器人到达的过程是否平稳且自信。这对于未来至关重要,因为如果我们希望机器人在我们的家中或医院工作,我们需要知道它们不仅仅是运气好——它们需要是持续优秀、平稳且笃定的。论文总结道,虽然我们现在已经拥有了衡量这些指标的工具,但我们需要开始利用它们,以确保我们未来的机器人助手真正准备好进入现实世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。