← 最新论文
🤖 machine learning

TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

本文介绍了 TMRL,这是一个通过使用上下文平滑预训练(Context-Smoothed Pre-training)来注入扩散噪声以实现广泛动作覆盖,并利用时间步调制强化学习(Timestep-Modulated Reinforcement Learning)来动态控制探索,从而显著提高样本效率并实现在不到一小时内成功进行现实世界机器人策略微调的统一框架,该框架桥接了行为克隆与强化学习。

原作者: Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下正在教一个机器人做一项新工作,比如做三明治或寻找丢失的玩具。通常教导它的方式是两步走的舞步。首先,你向机器人展示成千上万段人类完美完成任务的视频;机器人试图完全模仿他们,就像学生背诵教科书一样。这被称为“模仿学习”。但问题在于,如果机器人遇到了它从未见过的场景——比如三明治放在了一个形状奇怪的盘子里——它就会陷入恐慌。因为它死记硬背了针对“教科书式”盘子的精确动作,它会僵住,或者尝试做出不可能完成的动作,因为它从未学过在混乱局面下该如何应对。

为了解决这个问题,科学家们经常尝试通过添加随机噪声来教机器人“探索”,比如告诉它随机晃动一下手臂来看看会发生什么。但这就像是通过随机转动方向盘来学习开车;这种方法最终可能会奏效,但既危险又低效。机器人科学领域的一个大问题是:我们如何教机器人既能精准地遵循指令,又能具备足够的灵活性,以便在陷入困境时尝试新事物,而不是仅仅盲目地乱挥乱舞?

这就是名为 TMRL(时间步调制强化学习)的新想法出现的地方。华盛顿大学和亚马逊的研究人员提出了一个巧妙的转折。他们并没有仅仅让机器人死记硬背完美的动作,也没有单纯地添加随机混乱,而是教机器人有意识地去“模糊”它对世界的视觉感知。

想象一下:你正在学习烤蛋糕。如果你只学过用正好 2 杯面粉来烤蛋糕,那么如果你不小心用了 2.1 杯,你可能就会失败。但如果在练习过程中,有人告诉你,假设你有 2.1 杯、2.2 杯甚至 3 杯面粉,会发生什么?通过使用这些“模糊化”后的配方进行练习,你会明白即使配料不完美,蛋糕依然可以成功。你学到的是烘焙的“精髓”,而不仅仅是精确的数字。

在机器人的世界里,“配方”就是指令(比如“拿起红色的积木”),而“配料”则是机器人的传感器(它所看到或感觉到的东西)。论文中的方法被称为上下文平滑预训练(CSP),它会对机器人的指令添加一点“数字雾气”。它教机器人即使在指令略显模糊的情况下也能行动。这迫使机器人学习更广泛的动作范围。如果机器人看到了一个“模糊版”的“拿起红色积木”,它可能会尝试去拿一个稍微远一点或稍微倾斜一点的红色积木。它学到的是目标是“拿到那个红色的东西”,而不仅仅是“在坐标 X 处抓取那个红色的东西”。

一旦机器人完成了这种“模糊”训练,神奇的第二部分就来了:TMRL。这就像是给了机器人一个可以在实际工作中旋转的特殊旋钮。当机器人确定该做什么时(比如它正握着积木),它会将旋钮转到“锐利聚焦”模式,进行精确操作。但如果它被卡住了或者情况很奇怪(比如积木在一个新的位置),它就会将旋钮转到“模糊模式”。这告诉机器人:“好了,先忘掉那些精确的教科书动作;尝试一下你在练习中学到的那些更宽泛、更模糊的动作吧。”

研究人员在计算机模拟和真实机器人上测试了这种方法。他们发现,与旧方法相比,通过这种“模糊”方法训练的机器人能更好地解决新谜题。在模拟实验中,这种新方法帮助机器人学习任务的速度极快,通常能达到其他方法完全失败时近乎完美的成功率。更令人印象深刻的是,他们展示了这在现实世界中的真实机器人身上同样有效。在一次测试中,一个机械臂在不到一小时的实际实验时间内,就学会了把香肠放入锅中以及把虾放入抽屉中。如果没有这种方法,机器人只会盯着这些物体发呆,无法弄清楚该如何移动它们。

论文指出,过去那种仅仅添加随机动作噪声的方法既笨拙又低效。相反,通过教机器人处理“模糊”指令,它学会了如何聪明地进行探索。它知道何时该精准,何时该富有创造力。作者认为,这种方法可能会成为让机器人适应混乱、不可预测的现实世界的游戏规则改变者,将它们从刻板的规则执行者转变为灵活的问题解决者。虽然目前仍需努力确保这些机器人在各项工作中足够安全且高效,但目前的成果表明,“模糊化”指令或许正是解锁真正机器人智能的秘诀。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →