← 最新论文
🤖 AI

ResWM: Residual-Action World Model for Visual RL

该论文提出了一种名为 ResWM 的残差动作世界模型框架,通过将控制变量从绝对动作重构为相对于上一步的增量调整,并配合观测差分编码器,在 DeepMind 控制套件中实现了比 Dreamer 和 TD-MPC 等基线更优的样本效率、平滑控制及长期规划稳定性。

原作者: Jseen Zhang, Gabriel Adineera, Jinzhou Tan, Jinoh Kim

发布于 2026-03-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Jseen Zhang, Gabriel Adineera, Jinzhou Tan, Jinoh Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 ResWM(残差动作世界模型)的新方法,旨在让 AI 机器人更聪明、更平稳地学习如何从“看”视频画面中学会控制身体。

为了让你轻松理解,我们可以把 AI 学习控制机器人的过程想象成教一个刚学开车的新手,或者教一个学跳舞的孩子。

1. 以前的难题:让新手“从零开始”乱指挥

在传统的 AI 学习方法中,AI 每次做决定时,都要像新手司机一样,直接告诉机器人:“把手往左打 30 度,脚踩油门 50%!”

  • 问题出在哪? 这种“绝对指令”太难了。因为环境一直在变,最优的“绝对位置”每时每刻都在变。AI 就像在茫茫大海里找一根针,经常因为指令波动太大,导致机器人动作抽搐、像喝醉了一样晃来晃去(论文里叫“振荡”),既浪费体力又容易出事故。

2. ResWM 的核心妙招:只教“微调”,不教“重来”

ResWM 换了一种更聪明的思路:不要每次都重新定义“怎么动”,而是只告诉机器人“和上一秒相比,需要怎么微调”。

  • 生活类比:
    • 旧方法(绝对动作): 老师每秒钟都大喊:“手抬到 30 度!手抬到 45 度!手抬到 20 度!”学生听得晕头转向,手忙脚乱。
    • ResWM 方法(残差动作): 老师只说:“比刚才再抬高一点点"或者“比刚才稍微放低一点"。
    • 好处: 这样机器人的动作就会像流水一样顺滑,不会突然抽搐。这就好比开车时,你不需要每次都重新计算方向盘的角度,只需要根据路况“微调”方向即可。这不仅让动作更稳,还大大减少了机器人“思考”和“搜索”正确动作的范围,学起来快得多。

3. 眼睛的进化:只看“变化”,不看“背景”

为了配合这种“微调”策略,ResWM 还升级了机器人的“眼睛”(视觉编码器),叫作 ODL(观察差异编码器)。

  • 生活类比:
    • 普通 AI 的眼睛: 像是一个拿着相机的游客,每一帧画面都拍得清清楚楚,包括背景里的树、云、墙壁。这导致它被大量无关信息淹没,分不清什么是重要的。
    • ResWM 的眼睛: 像是一个老练的侦探或动态捕捉专家。它不看静止的背景,只盯着哪里动了。
    • 原理: 它把“上一秒的画面”和“这一秒的画面”做减法。如果背景没变,就抵消了;只有那个正在摆动的机械臂、正在滚动的球,才会被高亮显示。
    • 效果: 机器人瞬间就抓住了重点(比如关节怎么动),忽略了干扰(比如背景里的树影),从而能更精准地做出“微调”指令。

4. 在“梦境”里练习(世界模型)

ResWM 还有一个强大的功能:它能在脑子里“做梦”(Imagination)。

  • 它不需要真的去撞墙、去摔倒,而是在内部构建一个虚拟世界,模拟未来的画面。
  • 因为它的动作是“微调”且“平滑”的,所以它在梦里模拟出来的未来轨迹也非常稳定、真实。这让它在真正去执行任务前,就已经在脑海里演练了成千上万次,大大节省了在现实世界试错的成本(也就是论文里说的“样本效率”)。

5. 实验结果:不仅快,而且“省电”

在著名的机器人测试场(DeepMind Control Suite)和复古游戏(Atari)中,ResWM 的表现吊打了之前的顶尖选手(如 Dreamer 和 TD-MPC):

  • 学得更快: 用更少的数据就学会了高难度任务。
  • 动作更帅: 机器人的动作像行云流水,没有那种抽搐的抖动。
  • 更省电: 因为动作平滑,没有多余的无效摆动,就像开车时少踩急刹车,非常节能。这对于真实的机器人(比如工厂机械臂或自动驾驶汽车)至关重要,因为真实的电机和电池都很宝贵。

总结

这篇论文的核心思想就是:教机器人做事,不要教它“绝对位置”,要教它“相对变化”;不要让它盯着静止的背景,要让它盯着“变化的瞬间”。

这种“微调 + 抓变化”的策略,让 AI 从“笨拙的醉汉”变成了“优雅的舞者”,既学得快,动作又稳,非常适合未来应用到真实的机器人身上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →