← 最新论文
🤖 machine learning

DiRecT: Safe Diffusion-Based Planning via Receding-Horizon Denoising

DiRect 是一种无需训练的算法,它通过利用后退时界去噪(receding-horizon denoising)仅对最终的清晰轨迹施加约束,从而确保扩散模型中的安全规划,进而避免了现有方法中常见的因过度约束中间步骤而导致样本质量下降的问题。

原作者: Paolo Giaretta, Zeyang Li, Navid Azizan

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Paolo Giaretta, Zeyang Li, Navid Azizan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人穿过拥挤的房间去拿一杯咖啡。你有一个非常聪明的机器人,它已经看过了成千上万段人们这样做过程的视频。它知道如何运动的大致规律,但它并不知道现在这个房间里具体的椅子或桌子在哪里。

如果你只是要求机器人“去拿咖啡”,它可能会因为试图表现得很有“创造力”而直接撞上一张桌子。如果你试图在它规划路径的每一步都去阻止它撞到桌子,你可能会导致机器人变得僵硬、停顿,或者走出一条奇怪、颠簸的路径,因为你在过度微观管理它的每一个念头。

这就是 DiRecT 这篇论文所要解决的问题。

问题所在:“过度纠正”陷al(The "Over-Correction" Trap)

作者解释说,现有的让 AI 规划器变得安全的方法,就像是一个过度紧张、抓得太紧的家长在牵着孩子的手。

  • 旧方法: 当机器人规划路径(分步进行)时,计算机会检查:“这一步安全吗?”如果不对,它会立即强迫机器人改变那一个特定的步骤。
  • 缺陷: 机器人的规划过程包含大量的“噪声”或草稿。在这些草稿阶段就检查安全性,就像是在画家还在调色盘上混合颜色时,告诉他:“不要画出任何看起来像树的笔触。”这限制了机器人的创造力,并且往往导致最终结果很丑陋、动作颠簸,或者无法达到目标。

解决方案:DiRecT(“收缩时界”教练)

作者引入了 DiRecT,它更像是一位睿智的教练,而不是一个紧张的家长。

1. “清晰轨迹”的愿景(The "Clean Trajectory" Vision)
DiRecT 不会在每一个粗糙的草稿阶段检查安全性,而是等待机器人心中形成一个最终的、清晰的计划后,再问:“如果完全按照这个计划执行,我会撞到桌子吗?”

  • 类比: 想象机器人在纸上画一条路径。旧方法试图在铅笔触碰纸面的那一刻,只要线条看起来稍微有点歪就立刻擦掉。DiRecT 则让铅笔自由绘制,然后观察完成后的画作。如果完成后的画作撞到了桌子,它才会整体地轻轻推动整个图形,使其避开障碍。

2. “收缩时界”技巧(The "Receding Horizon" Trick)
论文使用了一个叫做“收缩时界”(Receding-Horizon,受模型预测控制启发)的概念。

  • 类比: 想象你在黑夜中开车,只有雾蒙蒙的前照灯。你只能看到前方几英尺的路。
    • 旧方法: 你试图现在就为整个 100 英里的旅程规划完美的路线,尽管你根本看不清路。
    • DiRect: 你观察眼前的路,为接下来的几秒钟规划一条安全的路径,行驶这段路,然后重新规划接下来的几秒钟。你根据当下所见不断更新你的计划,确保你永远不会撞墙,但你也不会强迫汽车在路面弯曲时非要走直线。

3. “无需训练”的超能力(The "Training-Free" Superpower)
最棒的部分是?DiRect 不需要重新教导机器人。它利用机器人现有的知识(“预训练模型”),只是在其规划过程之上增加了一个安全层。

  • 类比: 这就像给一位经验丰富的司机配备了一个会提醒障碍物的 GPS。你不需要重新教司机如何开车,你只是给了他们一个工具来避开这座城市特有的坑洼。

实际应用效果

论文在多个机器人任务上测试了这一点:

  • 迷宫导航: 一个小球在有新的、意料之外的墙壁的迷宫中滚动。DiRect 成功地导航了迷宫而没有撞墙,而其他方法则会陷入困境或发生碰撞。
  • 机械臂: 一个机械臂在移动去抓取物体的同时避开柱子。即使柱子被放置在棘手的位置,DiRect 也确保了机械臂从未触碰到柱子。
  • 多机器人集群: 一组机器人一起移动而不互相碰撞。即使在机器人数量增加的情况下,DiRect 也能保持它们的安全性与高效性。

核心结论

DiRect 是一种让 AI 规划器变得安全的新方法。它不是通过不断中断 AI 的思考过程来检查安全性(这会让 AI 变得笨拙),而是让 AI 自由思考,然后轻轻修正其最终计划以确保安全。这就像是允许学生在写草稿时不受恐惧束缚,然后在最后编辑版本时帮助他们完善,以确保完美,而不是在他们写完每一句话后就去打断他们。

其结果是,机器人既是安全的(不会发生碰撞),又是熟练的(动作流畅且能完成任务)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →