← 最新论文
💻 computer science

Calibrated Predictive Safety for Heterogeneous Robots: An Action-Conditioned JEPA Framework with Model-Based Safety Shields

本文提出了一种用于异构机器人的可部署安全框架,该框架结合了一个用于校准风险与进度预测的动作条件型 JEPA 世界模型,以及一个确定性的基于模型的安全屏蔽器和退避阶梯,在仿真中展示了更高的成功率并减少了碰撞漏报,同时保持了执行时的保证。

原作者: Kaiming Zhong, Tianhua Liu, Yue Wang

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaiming Zhong, Tianhua Liu, Yue Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人站在一个杂乱的货架前,任务是取回一件特定的物品。对于人类来说,这个决定是直觉性的:伸手,抓取物体,然后将其拉出。但对于机器而言,这一时刻充满了未知的陷阱。手臂会撞到附近的盒子吗?夹持器会在光滑的表面上打滑吗?这个动作真的能推动任务进展,还是仅仅会导致机械卡死?现代机器人通常依赖两种截然不同的方法来解决这个问题。一种方法利用海量数据通过模仿来学习如何移动,就像孩子通过观察他人来学习走路一样。这些系统具有极高的灵活性,能够处理新的指令,但它们本质上是在“猜测”;它们在行动发生之前,并不真正理解物理后果。另一种方法则依赖于严格的物理和几何数学模型。这些系统严谨且安全,但却很僵化,在面对现实世界中混乱、不可预测的环境时往往会失效。

当今机器人领域的核心挑战在于弥合这一差距:创造一种既具有学习模型的适应性,又具有数学模型的可靠性的系统。广东彼方智能控制科技有限公司的研究人员提出了一种旨在解决这种张力的新架构。他们的工作并非试图强迫单一模型完美地完成所有工作,而是将“猜测可能有效的方案”与“确保不发生危险行为”的任务进行了分离。他们构建了一个系统,其中一个灵活的学习模型会提出一系列可能的动作,而一个独立的、不可更改的安全卫士则根据物理定律和机器人的特定形态对每个建议进行检查。学习模型可以对选项进行排序以寻找最优解,但它绝不允许覆盖安全卫士的决策。如果卫士判定某个动作不安全,那么无论学习模型的置信度有多高,该动作都会被拒绝。

为了测试这一想法,团队开发了一个框架,其功能类似于一个快速反应的模拟引擎。当机器人考虑一个动作时,系统会对当前场景和机器人的状态进行快照。一个灵活的“提议者”(proposer)组件(可以是一个学习策略或一个数学规划器)会生成一组候选动作。这些动作可能包括伸手拿取物体、转动旋钮或移动底座。系统并不会立即执行这些动作,而是将它们在隐藏的抽象空间中通过一个“世界模型”进行运行。该模型会预测如果机器人在接下来的几秒钟内执行每个候选动作,将会发生什么。至关重要的是,这种预测是基于特定机器人的物理限制(如关节角度和停止距离)进行条件的约束。随后,系统会根据两个因素对每个预测的未来进行评分:一是该动作在多大程度上推动了目标的实现,二是该动作携带了多少风险(例如碰撞或卡死的概率)。

该设计中最关键的创新在于将评分与安全检查分离。学习模型提供一个分数来对候选方案进行排序,暗示哪一个最有可能成功。然而,一个确定性的安全屏蔽层充当了最终的守门员。这个屏蔽层是一套针对机器人硬件的硬性规则。它会检查动作是否违反了关节限制、机器人是否会倾覆,或者是否会与已知障碍物发生碰撞。该屏蔽层不是学习而来的,而是一组固定的约束条件。如果屏蔽层拒绝了一个候选方案,那么该方案就会被剔除,无论其得分有多高。如果屏蔽层拒绝了所有候选方案,系统不会进行猜测或强行执行动作,而是遵循预定义的备选方案阶梯:安全停止、尝试返回到之前的安全状态、尝试以更广泛的选项进行重新规划,或者最终请求人类帮助。这确保了机器人永远不会进入无法恢复的状态。

研究人员在名为 LIBERO-Long 的模拟环境中测试了该框架,该环境包含各种需要长序列动作的任务。他们将全套系统与几种基准模型进行了对比,其中包括仅使用安全屏蔽而没有智能排序的机器人,以及仅使用智能排序而没有硬性屏蔽的机器人。结果表明,结合这两个要素是必不可少的。与仅使用安全屏蔽相比,全套系统将完成任务的成功率提高了七个百分点。更重要的是,它将“漏检碰撞”的比例(即系统未能预测到实际发生的碰撞)从 21% 降低到了 14%,同时保持了同样的谨慎程度。该系统还展示了其在真实机器人硬件上的高效运行能力,决策时间不到一秒,足以满足许多控制循环的需求。

然而,论文也谨慎地指出了这些发现的局限性。改进是在模拟环境中测得的,虽然结果令人鼓舞,但尚未在现实世界的物理机器人上得到证实。研究人员还发现,虽然安全屏蔽显著减少了碰撞,但在本次测试规模下,智能排序组件并未表现出比简单排序方法更具统计学意义的改进,尽管趋势是积极的。这表明,虽然安全卫士是可靠性的主要来源,但学习模型对选项进行排序的能力仍有待进一步完善。该研究明确拒绝了“学习模型可以独立保证安全性”的观点。相反,它认为安全性必须来自一个与学习模型无关的、由规则构成的独立层。

这项工作还强调了校准的重要性。在许多机器学习系统中,模型可能会预测一个很高的碰撞风险,但这个数字本身可能并不代表其实际含义。研究人员对系统进行了训练,使其在预测有 10% 的碰撞概率时,实际发生的碰撞频率确实接近 10%。这种校准使得系统能够更好地决定何时进行干预。如果没有这一点,系统可能会过于谨慎,不断停顿而无法完成任务,或者过于鲁莽,从而忽略真实的危险。通过确保风险数值的准确性,系统可以更有效地平衡安全性与进度。

最终,这项研究为构建能够在复杂、非结构化环境中安全运行的机器人提供了蓝图。它提出了一个愿景:未来的机器人不仅在学习如何移动,还配备了一个独立于其学习过程之外的、永久且不可破坏的“安全意识”。该系统并不依赖于机器人本身是完美的,而是依赖于机器人拥有一套清晰、不可更改且无法逾越的边界。通过将“什么是最好的动作?”与“什么是安全的动作?”这两个问题分离,研究人员创建了一个既灵活又稳健的框架,准备好迎接下一代异构机器人的测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →