← 最新论文
🤖 AI

WAM-OPD: On-Policy Distillation for World Action Models

该论文介绍了 WAM-OPD,这是一种通过在自身生成的历史记录上进行密集教师监督训练,从而修复以视频为先的动作世界模型(World Action Models)的后训练方法,该方法在不需要稀疏奖励强化学习的情况下,显著提高了任务成功率。

原作者: Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng, Zezhi Tang

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng, Zezhi Tang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

机器人正在学习以一种全新的智能进行观察和移动,这种智能试图理解世界,不仅是反应当前的发生,更是通过想象接下来会发生什么。多年来,研究人员利用海量的视频和指令数据训练机器人,教它们将所见到的景象与手臂应有的动作联系起来。这些系统通常被称为视觉-语言-动作模型(vision-language-action models),它们功能强大,但在要求实时执行复杂任务时,往往显得缓慢且笨拙。为了提高速度,科学家们开发了一种称为“蒸馏”(distillation)的技术,这就像是将一位缓慢但博学的老师,训练出一个能够模仿其行为的快速学生版本。其目标是创造出一种能够以单一、流畅动作进行思考并行动的机器人。然而,这里有一个难点:当你加速机器人的大脑时,它有时会忘记如何处理棘手的情况,或者在它初始训练中从未见过的状态中迷失方向。机器人变得很快,却失去了完成工作的能力。

这正是名为 WAM-OPD 的新方法发挥作用的地方,该方法旨在修复这些快速运行的机器人,而无需让它们通过试错的方式重新开始学习。研究人员在使用一个通过预测未来视频帧来规划动作的系统时,意识到这些加速后的机器人标准的训练方式存在缺陷。问题在于,快速机器人被教导要基于“慢速老师”的完美预测来行动,但在现实世界中,快速机器人必须基于它自己那略显不完美的预测来行动。这就像是通过展示一段完美驾驶员的视频来教学生开车,但随后又把方向盘交给他们,并期望他们能像老师那样对路面做出反应,尽管学生的车行驶状态并不一样。机器人预期的景象与其实际看到的景象之间的这种不匹配,导致了它的失败。

为了解决这个问题,团队创建了一个训练循环,让快速机器人实际上进入模拟环境并自行移动。在移动过程中,它会记录下自己所见所为的历史轨迹。随后,一个冻结状态下的、缓慢且高度准确的“老师机器人”会观察这些特定时刻,并为接下来应该发生什么提供正确答案。至关重要的是,快速机器人随后被教导根据它自己那并不完美的视角来预测未来并选择动作,同时仍努力去匹配老师的正确答案。这确保了机器人学会处理它实际遇到的特定情况,而不是仅仅死记硬背一份它可能永远见不到的教科书式场景清单。研究人员在模拟环境中的两个特定任务上测试了这种方法:将麦克风从一只机械手传递给另一只机械手,以及将物体放入橱柜抽屉。

结果显示,这种方法可以显著提高机器人完成这些任务的能力。对于麦克风传递任务——这是一个快速机器人最初完全失败的任务——新的训练方法帮助它在超过一半的尝试中取得了成功。对于橱柜任务——在此任务中机器人原本已有一定的成功率——改进幅度较小但依然显著,将成功率从大约六分之一提升到了三分之一。这些数字来自于使用少量模拟场景进行的非常具体的测试,因此研究人员谨慎地表示,这只是一个概念验证,而非通用解决方案。他们发现,该方法在应对这些特定挑战时表现良好,这表明让机器人通过其实时经验进行学习,并由一位睿智但静态的老师进行引导,是修复快速、加速型人工智能弱点的有效途径。这项工作并不声称已经解决了所有情况下的机器人学习问题,但它为使这些高速系统在实际投入使用时更加可靠提供了一条清晰的前进路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →