← 最新论文
💻 computer science

Where Success Breaks: Failure-Boundary Learning for Robust Vision-Language-Action Models

本文提出了 DLS,一种通过利用数字孪生展开(rollouts)和特权模拟器状态来发现、定位并定向塑造可恢复偏差与任务失败之间边界的失效边界学习(Failure-Boundary Learning)框架,旨在增强视觉-语言-动作模型的鲁棒性,从而在性能上超越了标准的监督微调和在线强化学习基准。

原作者: Yanzhe Chen, Zhijun Cao, Mike Zheng Shou

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanzhe Chen, Zhijun Cao, Mike Zheng Shou

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

机器人长期以来一直是工厂车间的专家,在那里它们在受控环境中重复同样的精确动作。但当我们要求它们进入我们的家庭或办公室时,它们面临的是一个充满变化的光线、意外障碍物和随机放置物体的混乱世界。为了弥补这一差距,科学家们开发了一种被称为“视觉-语言-动作模型”的新一代人工智能。这些系统充当机器人的大脑,接收机器人通过摄像头看到的内容并理解人类的口头指令,然后决定下一步进行怎样的物理运动。教导这些机器人最常用的方法是模仿:向它们展示数百段人类成功完成任务(如拿起杯子或清扫地板)的视频,并要求机器人复制这些精确的动作。虽然这在简单、可预测的情况下效果很好,但它有一个致命的盲点。机器人学会了如何精确地成功,但它从未学会成功的界限在哪里。它不知道如果它偏离杯子仅一毫米会发生什么,或者如果光线发生轻微变化会怎样。由于缺乏这种知识,一个小小的错误就可能让机器人陷入一个它从未见过的状态,导致其陷入困惑并无法恢复。

新加坡国立大学的一个研究小组提出了一种新的教学方式,不仅关注成功,还关注事情出错的精确时刻。他们认为,要让机器人真正具有鲁棒性(稳健性),它必须学会识别从“可恢复的错误”转变为“完全任务失败”的边界。为此,他们开发了一种被称为“失败边界学习”(Failure-Boundary Learning)的方法。研究人员并没有仅仅依赖于人类演示,而是使用了一个“数字孪生”——一个高度精确的、关于真实机器人及其环境的虚拟模拟系统。他们首先通过少量的现实世界演示来教导机器人一套基础技能,足以给它打下坚实的基础。然后,他们让机器人在虚拟世界中进行练习,在那里机器人被允许犯下数千次错误。在这个数字空间里,机器人尝试完成诸如将方块放在杯垫上、将立方体扫入簸箕或将连接器插入插座等任务。由于模拟过程是完美的,研究人员可以精确地看到机器人的路径何时偏离轨道。他们可以精准定位机器人停止向目标移动并开始远离目标的那个瞬间。

他们的发现核心在于如何分析这些失败。传统方法通常将一次失败尝试视为简单的“否”,而不提供关于为何失败或距离成功有多近的细节。然而,研究人员将任务分解为一系列阶段,例如寻找物体、抓取物体、移动物体和放置物体。当机器人在虚拟世界中失败时,他们的系统会识别出失败发生在哪个具体阶段。是机器人错过了抓取?是在移动过程中掉落了物体?还是在最后阶段未能正确对准物体?通过标记这些特定时刻,他们创建了一张失败边界图。随后,他们利用这张图来引导机器人的学习。如果机器人在抓取阶段失败,系统会发送信号,专门针对该阶段调整机器人的内部决策过程,将其从错误中推开,引向成功的抓取。这个过程不断重复,机器人在模拟中探索任务的新变体,不断精炼其对“安全区”结束与“危险区”开始之处的理解。

这种方法的成果在实验室环境下的真实机械臂上得到了测试。研究人员将他们的新方法与仅依赖人类演示的标准训练技术进行了对比。他们发现,该方法产生了一个可靠性显著提高的机器人,尤其是在环境发生变化时。当光线变暗、背景改变或物体位置随机分布时,接受新方法训练的机器人完成任务的成功率约为72%。相比之下,仅接受人类演示训练的机器人在这些困难条件下的成功率低于55%。当研究人员使用更先进、更强大的机器人“大脑”版本时,这种提升更为明显:他们的法达到了84%的成功率,而标准方法仅为54%。至关重要的是,研究人员仅使用50次现实世界演示就达到了这些结果,而标准方法需要100次演示才能达到较低的性能水平。这表明,从模拟失败中学习的能力比单纯收集更多成功案例要高效得多。

研究人员还探讨了为什么其他教学方法往往表现不佳。许多当前的方法试图通过一个“评论家”(critic)来修复错误,即一个判断机器人动作好坏的独立AI程序。研究人员发现,这种增加的复杂性经常会导致问题,例如评论家学会了偏离其预定功能或变得不可靠。他们的方法通过直接利用来自模拟的反馈来塑造机器人的运动,从而完全避免了这个问题,无需一个单独的评判者。他们还测试了仅仅通过计算机器人采取的步数或测量到目标的距离是否足以引导学习。他们发现这些简单的度量标准并不有效;机器人需要理解其失败的具体阶段才能学会如何自我纠正。通过专注于失败的具体时刻,机器人学会了从那些此前会导致其彻底放弃的错误中恢复过来。

这项工作凸显了我们教导机器人在现实世界中运行方式的一个根本转变。与其试图向机器人展示每一种可能的成功方式(这在复杂环境中是不可能的),研究人员证明,教导机器人了解其能力极限更为有效。通过使用数字孪生来安全地探索失败的边缘,机器人学会了在问题发生前识别迹象。这使得它能够实时调整动作,即使在周围世界发生意外变化时,也能保持对任务的掌控。这项研究并不声称已经解决了机器人学习的所有问题,同时也承认数字孪生必须足够精确以反映现实。然而,它提供了一条清晰的前行路径:通过使成功与失败之间的无形边界变得可见且可理解,我们可以构建出不仅仅是擅长执行指令,而且真正能够应对人类世界不可预测性的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →