这篇论文介绍了一种名为 MQE (多步准度量估计) 的新方法,旨在解决人工智能(特别是机器人)在长距离、复杂任务中“走不到终点”的难题。
为了让你轻松理解,我们可以把训练机器人做任务想象成教一个刚出生的孩子学会“找东西”和“拼积木”。
1. 核心难题:为什么以前的机器人“走不远”?
想象一下,你教孩子从卧室走到厨房拿苹果。
- 以前的方法 A(像走一步看一步): 孩子每走一步,你只告诉他“离苹果还远吗?”。这种方法很稳,但孩子容易迷路,因为每一步的微小误差积累起来,走到最后可能完全偏了(就像在迷宫里转晕了)。
- 以前的方法 B(像看全景图): 你直接给孩子看一张从卧室到厨房的完整地图,告诉他“终点在那”。这种方法在大方向上很准,但孩子很难理解中间具体的每一步该怎么走,而且如果地图画错了(数据有噪音),孩子就彻底懵了。
痛点: 现有的机器人要么太“短视”(只看眼前),要么太“理想化”(只看全局),导致它们在面对超长任务(比如要走几千步,或者要把好几个动作连起来做)时,经常失败。
2. MQE 的绝招:把“距离”变成一种特殊的“尺子”
MQE 的核心思想是发明了一种特殊的“心理尺子”(论文里叫“准度量”,Quasimetric)。
- 普通尺子: 只能量直线距离,而且必须遵守“三角形不等式”(A 到 C 的距离 ≤ A 到 B + B 到 C)。
- MQE 的尺子(准度量): 它更灵活!它允许“走弯路”或者“有方向性”。比如,从“打开抽屉”到“拿出苹果”很容易,但从“拿出苹果”倒着回到“打开抽屉”可能很难。MQE 的尺子能理解这种不对称性。
关键创新:多步“跳格子”学习
以前的方法教机器人,通常是“走一步,学一步”。MQE 则像是一个聪明的教练,它不只看下一步,而是让机器人**“跳着看”**:
- 它随机在路线上选几个**“路标”**(Waypoints)。
- 它告诉机器人:“别只盯着下一步,试着直接跳到那个路标,看看离终点还有多远。”
- 通过这种**“多步跳跃”**,机器人能更快地把“终点很成功”这个好消息,传递回起点。这就好比在黑暗中,以前只能摸黑走一步,现在 MQE 给了你几盏远处的探照灯,让你一眼就能看到路。
3. 三大超能力
这篇论文证明了 MQE 有三个厉害的地方:
超长距离的“耐力”:
在模拟的迷宫测试中,以前的机器人走几百步就晕了。MQE 训练的机器人能轻松走完4000 步的超长迷宫,而且还能在没见过的巨大迷宫里(比训练时大 50%)成功找到路。
- 比喻: 就像教孩子认路,以前只能教他认家门口的路,MQE 让他学会了认整个城市的地图,哪怕路变长了,他也能认出来。
“拼积木”般的组合能力(Stitching):
这是最酷的一点。假设训练数据里只有“拿香蕉”和“放香蕉”两个单独的动作,MQE 能让机器人把这两个动作无缝拼接起来,完成“拿香蕉 -> 走到桌子 -> 放香蕉”的长任务。
- 比喻: 以前机器人只能学会“单句”(拿香蕉),MQE 让它学会了“写文章”(把几个单句连成一段通顺的话)。
真·机器人实战:
论文不仅在电脑模拟里跑分,还在真实的机械臂上做了实验。
- 任务: 让机械臂连续做 4 次“抓取并放置”不同物体的动作,或者“打开抽屉 -> 把蘑菇放进去”。
- 结果: 以前的方法做这种连续动作经常失败,而 MQE 成功完成了这些复杂的“连环计”。
4. 它是如何做到的?(简单版原理)
MQE 做了三件事:
- 画地图(准度量架构): 用一种特殊的数学结构来定义“距离”,让机器人理解任务进度的真实逻辑。
- 跳着学(多步回报): 不只看下一步,而是随机抽取未来的几个状态作为“路标”,让价值(成功的可能性)能迅速传播到整个任务链条。
- 管住手(动作不变性): 确保机器人明白,只要状态对了,做什么动作都不影响“离目标有多远”这个核心判断,防止它被无关的动作干扰。
总结
MQE 就像给机器人装上了一套“超级导航系统”和“时间望远镜”。
它不再让机器人死记硬背每一步怎么走,而是教会它理解任务的整体结构和长远的目标。这使得机器人不仅能走得更远(长视野),还能把学会的小技能灵活组合起来(拼积木),甚至在真实的物理世界里也能完成以前不敢想的复杂任务。
这篇论文的意义在于,它让离线强化学习(只用旧数据训练,不试错)真正具备了处理现实世界复杂长任务的能力,是通往通用机器人助手的重要一步。
这是一篇发表于 ICLR 2026 的论文,题为《Multistep Quasimetric Learning for Scalable Goal-Conditioned Reinforcement Learning》(用于可扩展目标条件强化学习的多步准度量学习,简称 MQE)。
以下是对该论文的详细技术总结:
1. 研究背景与问题 (Problem)
- 核心挑战:在强化学习(RL)中,如何让智能体在长视界(Long-horizon)任务中有效地到达目标是一个长期存在的难题。现有的离线目标条件强化学习(Offline GCRL)方法在处理长序列任务时,往往难以进行有效的“拼接”(Stitching,即组合多个子任务)和视界泛化。
- 现有方法的局限性:
- 时序差分(TD)方法:虽然理论上能保证最优性(通过局部更新),但在长视界任务中容易因误差累积而表现不佳。
- 蒙特卡洛(MC)方法:虽然能进行全局价值传播(Global updates),通常表现更好,但缺乏理论上的最优性保证,且往往只能恢复行为策略的价值函数(Qβ),而非最优价值函数(Q∗)。
- 准度量学习(Quasimetric Learning):之前的工作(如 Wang et al., 2023; Myers et al., 2024)要么仅使用单步 TD 更新,要么仅使用基于对比学习的 MC 更新,未能有效结合两者的优势,导致在真实世界机器人任务中的长视界泛化能力不足。
2. 方法论 (Methodology)
作者提出了 MQE (Multistep Quasimetric Estimation),这是一种无需显式分层结构的离线 GCRL 方法。其核心思想是将**多步回报(Multistep Returns)与准度量架构(Quasimetric Architectures)**相结合。
2.1 核心定义与架构
- 准度量距离表示:利用 Metric Residual Network (MRN) 架构参数化状态(或状态 - 动作对)与目标之间的准度量距离 d(s,g)。该距离满足非负性、同一性和三角不等式。
- 价值函数定义:将目标条件的 Q 函数和价值函数定义为距离的指数衰减形式:
Qg(s,a)=Vg(g)e−d((s,a),g),Vg(s)=Vg(g)e−d(s,g)
这意味着距离越短,到达目标的概率(价值)越高。
2.2 多步备份 (Multistep Backup)
- 传统单步 vs. 多步:传统的 TD 更新仅考虑下一步状态 s′。MQE 引入了**路点(Waypoints, stw)**的概念,这些路点是当前状态与目标状态之间的未来状态。
- 采样策略:路点 stw 通过结合伯努利分布和几何分布进行采样(公式 8)。以概率 p 采样单步(k′=1),以概率 1−p 采样几何分布的步数。
- 多步目标函数 (Tβ):优化目标从单步扩展为多步,即让当前状态的距离等于采样路点距离的折扣值:
e−d((s,a),g)←E[γk′⋅e−d(stw,g)]
使用 LINEX 损失(Bregman 散度的一种)来优化此目标,避免梯度消失。
2.3 动作不变性约束 (Action Invariance)
- 理论依据:如果数据来自马尔可夫策略,最优 Critic 应满足动作不变性:Vg∗(s)=maxaQg∗(s,a)。
- 实现:在准度量网络中,这要求 d(s,(s,a))=0。MQE 通过最小化一个平滑的损失函数 LI 来强制这一性质,防止模型收敛到平凡解(如所有距离为 0),从而稳定训练并提取出更有意义的距离度量。
2.4 策略提取
- 使用行为正则化的深度确定性策略梯度(DDPG + BC),通过最小化学习到的距离来最大化 Q 值:
πminE[d((s,π(s,g)),g)−αlogπ(a∣s,g)]
3. 主要贡献 (Key Contributions)
- 首创性结合:MQE 是首个成功将多步 TD 回报与准度量架构相结合的离线 GCRL 方法,实现了局部更新与全局价值传播的统一。
- 理论保证:证明了在表格设置下,该方法能在行为策略之上进行策略改进(Policy Improvement),即提取的策略价值 Vπ≥Vπβ。
- 无需显式分层:与现有的分层 RL 方法不同,MQE 通过随机采样路点和单一 Critic 实现了长视界任务的分解,简化了架构。
- 真实世界验证:首次在真实世界机器人操作(BridgeData)中,从无标签的离线视觉数据集中实现了端到端的**多步拼接(Multistep Stitching)**能力。
4. 实验结果 (Results)
4.1 模拟环境 (OGBench)
- 数据集:在 OGBench 基准上测试,包括状态空间和像素空间(视觉)环境。特别设计了一个比现有最大迷宫大 50% 的 "Colossal" AntMaze(需 4000 步)。
- 性能:
- MQE 在 90 个挑战任务中取得了**最先进(SoTA)**的性能,平均成功率显著高于 GCIQL, TMD, CRL, HIQL 等基线。
- 视界泛化:在训练集仅包含 4 米长轨迹的情况下,MQE 在"Colossal"迷宫(视界是训练的 1000% 长)中仍能保持非零的成功率,而其他方法几乎完全失败。
- 拼接能力:在
humanoidmaze-giant-stitch 任务中,MQE 的表现比之前的最佳方法(如 HIQL)高出 10 倍。
4.2 真实世界机器人 (BridgeData)
- 任务:在 BridgeData 上测试多阶段操作任务,包括连续执行 4 次“抓取 - 放置”(Quadruple Pick and Place)以及“打开抽屉并放入物品”(Open Drawer and Place)。这些任务需要组合数据集中从未同时出现过的子任务。
- 结果:
- MQE 是唯一能在四连抓放和开抽屉放物这两个最复杂任务中取得显著成功率的方法。
- 其他方法(如 GCBC, GCIQL, TRA)在任务数量增加时性能急剧下降,无法完成多步组合。
- 证明了 MQE 具备真正的**组合泛化(Compositional Generalization)**能力。
4.3 消融实验
- 多步采样:使用几何分布采样路点比均匀分布或固定步数效果更好。
- 超参数 p:需要平衡单步(p)和多步(1−p)更新。仅使用单步(p=1)或仅使用多步都无法达到最佳效果,证明了结合两者的必要性。
- 动作不变性:引入动作不变性损失 LI 将成功率从 7.9% 提升至 26.5%,证明了其对学习高质量 Critic 的关键作用。
5. 意义与影响 (Significance)
- 解决长视界难题:MQE 为离线 RL 中的长视界推理问题提供了解决方案,证明了通过准度量学习结合多步回报,可以克服传统 TD 方法的误差累积问题。
- 机器人学习的突破:这是首个在真实世界机器人操作中,仅凭无标签离线视觉数据就能实现复杂多步任务拼接(Stitching)的端到端方法。这为利用海量历史机器人数据训练通用机器人策略开辟了新路径。
- 理论到实践的桥梁:该方法不仅在理论上证明了策略改进的可能性,还在高维、随机且复杂的真实环境中得到了验证,展示了极强的鲁棒性和泛化能力。
总结:MQE 通过巧妙地将多步价值传播引入准度量距离学习,成功解决了离线目标条件强化学习中长视界泛化和任务拼接的瓶颈,在模拟和真实机器人任务中均展现了超越现有最先进方法的性能。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。