← 最新论文
🤖 machine learning

Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction

该论文提出了 Diffusion ReRoll,一种用于机器人序列预测的新型基于扩散的框架,它通过对局部稳定区域进行选择性重噪来实现迭代式的跨时界修正,在长时界规划、策略学习以及统一视频-动作建模方面显著优于现有方法。

原作者: Seonsoo Kim, Seongil Hong, Jun-Gill Kang

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Seonsoo Kim, Seongil Hong, Jun-Gill Kang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何穿越复杂的迷宫,或者执行一项精细的任务,比如堆叠杯子。为了做到这一点,机器人需要一次性预测一整串未来的动作序列,而不仅仅是走一步看一步。在人工智能领域,一种用于进行此类预测的流行工具被称为“扩散模型”(diffusion model)。你可以把扩散模型想象成一位雕塑家,从一块充满噪声和静电感的粘土块开始工作。雕塑家通过一步步剔除噪声,最终展现出一尊平滑、完美的雕像,而这尊雕像正是机器人未来的路径。通常情况下,这个过程是单向的:雕塑家从序列的开头一直雕刻到结尾,一旦某个部分变得平滑,他们就再也不会再去触碰它了。

这种“一锤定音”的方法存在一个问题:如果雕塑家在早期犯了一个小错误——比如把一面墙刻错了位置——他们就会被困在其中。因为他们无法回头,雕像的其余部分可能会崩塌,或者机器人可能会规划出一条直通死路的路径。这对于机器人技术来说是一个大问题,因为一个无法纠正自己错误猜测的机器人是既危险又低效的。科学家们一直试图研究如何让这些 AI 模型在不破坏整个序列结构的前提下,“撤销”它们的错误并随着进程不断优化计划。

这就是名为 Diffusion ReRoll 的新方法发挥作用的地方。来自国防研究院(Agency for Defense and Development)的研究人员针对标准的雕塑过程提出了一个巧妙的变体。他们不再是一口气将整尊雕像从头到尾完成,而是让雕塑家停下来,观察已经完成的部分,然后意识到:“等等,那面墙看起来有点歪。”当这种情况发生时,雕塑家并不会忽视它;他们会将那个特定的部分重新变回充满噪声的粘土,然后再次进行平滑处理,但这一次会结合整个雕像的上下文信息来确保准确。

论文将这个过程称为“ReRoll”(重掷/重演)。想象一下你在写故事。在旧的方法中,你写完第一章,接着写第二章,一旦完成了第一章,你就再也不会去修改它,即使你在第一章留下的剧情漏洞会导致结局崩盘。有了 Diffusion ReRoll,当你写故事时,你可能会意识到开头与你刚刚构思的结尾并不契合。于是,你对开头进行“ReRoll”:你将那些文字重新打乱成混乱的草稿,然后重新编写它们,而此时你已经知道了故事的结局。这使得机器人的计划保持了灵活性。如果机器人预测的一个动作在局部看起来不错,但在全局来看却很糟糕,系统可以“ReRoll”那个特定的动作,不断优化它,直到整个序列都合理为止。

研究人员在几个模拟环境中测试了这个想法,这些环境就像是设计用来模拟真实机器人任务的电子游戏世界。他们将这种新的“ReRoll”方法与标准的“单向”扩散模型以及其他现有技术进行了对比。结果非常令人振奋。在长距离迷宫导航任务中,与名为 Diffusion Forcing 的领先方法相比,ReRoll 方法将机器人的成功率提高了约 21%;与另一种名为 Diffuser 的方法相比,成功率提高了 23%。在机器人需要学习一系列动作来操纵物体(如拿起杯子)的任务中,其成功率相比标准 Diffusion Policy 的提升更为显著,达到了 56.5%。

论文指出,这种选择性地“打乱并优化”计划的能力是一个强大的工具。它允许机器人更长时间地保持选择的余地,防止其过早地锁定在一个错误的计划上。作者提到,虽然这些结果来自计算机模拟而非尚未在现实世界物理机器人上的测试,但该方法表明,赋予 AI 模型一种能够修正自身思考的方式,可以带来更聪明、更可靠的行为。这是迈向让机器人不再仅仅遵循僵化剧本,而是能够思考、意识到自己犯错并能即时纠正的进程中迈出的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →