想象一下,你正试图仅利用其他狗活动的视频库,来教一只机器狗如何奔跑、跳跃和行走。你还无法让机器狗在现实世界中练习;它必须完全从这些“离线”视频数据中学习。
目标是让机器狗变得足够智能,以至于当你最终给它一个它从未见过的新指令(例如“做一个后空翻”)时,它能立即理解并执行,而无需更多练习。这被称为零样本离线强化学习。
问题所在:“随机箭头”的错误
为了训练机器狗,现有方法使用了一个巧妙的技巧。它们将每一项可能的任务想象为在一个巨大的多维空间中指向特定方向的箭头。
- 旧方法:为了训练机器狗,研究人员会向一个巨大的高维球体盲目地投掷飞镖,以此挑选这些“任务箭头”。他们假设,只要挑选了足够多的随机箭头,最终就能覆盖所有重要的方向。
缺陷:作者认为,这就像试图通过向一个巨大的地球仪投掷飞镖来学习游泳。大多数飞镖会落在陆地上(那里无法游泳),或者指向水流不流动的方向。
- 在高维数学中,如果你随机挑选箭头,它们几乎总是指向与机器狗实际能做的事情正交(成 90 度角)的方向。
- 结果:机器狗感到困惑。“奖励”信号(即对其表现好坏的评分)变得如此微弱且充满噪声,以至于看起来所有事情都同样糟糕。机器狗无法区分好动作和坏动作,因此学习速度非常缓慢,表现也很差。作者将这种现象称为**“信号稀释”**。
解决方案:“行为任务分布”(BTD)
与其盲目投掷飞镖,作者提出了一种更聪明的方法:观察机器狗(或数据)实际做了什么。
- 提取真实任务:他们查看视频数据(离线数据集),识别机器狗已经执行过的实际动作。他们将这些真实动作转化为“任务箭头”。
- 绘制地图:他们利用这些真实箭头构建一张地图(概率分布),显示“好”任务实际存在的区域。
- 有目的地训练:他们不再挑选随机箭头,而是从这张地图中挑选训练任务。这确保了每一个训练任务都是机器狗在物理上能够完成的。
类比:
- 旧方法:试图通过随机大喊食材名称(如“牙膏”、“沙子”和“彩虹”)来教一位厨师。厨师会感到困惑,因为这些不是真正的食物。
- 新方法:观察厨师过去成功的菜肴,弄清楚他们实际使用了哪些食材(面粉、鸡蛋、糖),然后仅基于这些真实食材创造新食谱。
他们的发现
作者在多个机器人模拟(如猎豹、行走机器人和四足机器人)中测试了这一想法。
- 性能提升:通过使用他们的“现实世界”任务采样,机器人处理新任务(未见过的任务)的能力平均提高了20%。
- 高维环境:随着任务空间复杂度的增加(使“球体”变大),旧的随机方法完全失效。而新方法则保持强劲和可靠。
- 鲁棒性:无论机器人使用何种类型的“大脑”(表征学习方法),该方法都能有效工作。
核心结论
该论文声称,在离线学习中,你选择教智能体什么,与如何教它同样重要。
通过停止对任务进行“随机猜测”的练习,转而基于数据中实际可实现的内容进行训练,机器人学习得更快,并且在应对新挑战时表现得更好。这是一个简单的转变:停止训练那些不可能的幻想,转而训练数据中发现的现实可能性。
以下是论文《通过行为任务采样改进零样本离线强化学习》的详细技术总结。
1. 问题陈述
离线零样本强化学习(ZSRL) 旨在训练智能体,使其能够在不与环境进一步交互的情况下优化未见过的奖励函数,仅依赖预先收集的离线数据集。
- 标准方法: 当前最先进的方法(例如后继特征、前向 - 后向表示)学习状态嵌入 ϕ(s),并训练一个以任务向量 z 为条件的策略。奖励函数被线性定义为 Rz(s)=ϕ(s)⊤z。
- 缺陷: 为了训练这些策略,现有算法通常从高维单位超球面(Sd−1)中均匀采样任务向量 z。
- 核心问题: 作者认为,这种均匀采样造成了任务空间的几何结构与环境的物理特性之间的不匹配。在高维空间中,“测度集中”现象导致均匀采样的向量几乎与智能体能够产生的实际行为(即行为空间)正交。这导致了**“信号稀释”**,即对于几乎所有行为,奖励信号都变得微乎其微,使得智能体无法区分最优动作与次优动作。这导致了糟糕的零样本泛化能力。
2. 方法论:行为任务分布(BTD)
作者提出用一种名为行为任务采样的数据驱动方法取代均匀任务采样。
A. 理论洞察
- 特征占用: 他们将策略的特征占用 ψπ 定义为沿其轨迹的状态特征的折扣和。
- 方差消失: 他们证明(命题 4.1),随着潜在维度 d 的增加,在均匀任务采样下,不同策略回报的期望方差收敛于零。这意味着学习信号崩溃,阻碍了有效的策略优化。
B. 提出的算法
该方法不是从均匀分布中采样 z,而是直接从离线数据集中提取任务向量:
- 提取: 从离线数据集 D 中,作者提取子轨迹 τ。对于每个子轨迹,他们计算经验特征占用 ψ~τ=∑γtϕ(st)。
- 任务向量定义: 轨迹的任务向量定义为归一化的占用:zτ=ψ~τ/∥ψ~τ∥2。该向量代表了在特征空间中最大化该特定观测行为奖励的方向。
- 分布建模: 所有提取向量的集合构成了经验分布 pdata。作者将参数化密度模型(具体为高斯混合模型或 GMM)拟合到该数据上,从而创建行为任务分布(BTD),记为 pθ(z)。
- 训练: 在策略训练期间,任务向量从学习到的 BTD 中采样(z∼pθ(z)),而不是从单位超球面采样。这确保了智能体是在物理上可实现且基于环境动力学的任务上进行训练的。
3. 主要贡献
- 识别信号稀释: 本文从理论和实证上证明,高维空间中的均匀任务采样会导致学习信号因与行为空间正交而崩溃。
- 行为任务分布(BTD): 一种新颖的、与具体方法无关的框架,直接从离线数据中提取并建模可实现任务的分布。
- 集成: 该方法可作为现有 ZSRL 算法(后继特征和前向 - 后向)中任务采样步骤的即插即用替代品,无需修改底层的表示学习目标。
- 全面评估: 在多个基准测试、表示学习方法和潜在维度上进行了广泛的实验。
4. 实验结果
作者在标准 ZSRL 基准测试(Cheetah、Walker、Quadruped)上评估了他们的方法,使用了通过随机网络蒸馏(RND)收集的数据集。他们在各种潜在维度下与七个基线方法(包括自动编码器、转换模型、LRA 和 BYOL)进行了比较。
- 性能提升: 在所有环境和基线中,BTD 采样将零样本性能平均提高了20%。
- 对维度的鲁棒性:
- 基线失效: 随着潜在维度的增加(高达 1000),标准的均匀采样方法性能急剧下降,通常崩溃至接近随机性能。
- BTD 稳定性: BTD 采样即使在较高维度(例如 1000)下仍保持高性能,证明其有效缓解了信号稀释问题。
- 降低方差: BTD 采样显著降低了不同表示学习方法在测试性能上的方差,表明学习更加一致和可靠。
- 消融研究:
- 混合策略: 将均匀采样与 BTD 采样混合(在两者之间插值)会降低性能,证实了引入任意、不可实现的任务会损害学习信号。
- GMM 组件: 性能在约 20 个 GMM 组件后趋于平稳,表明行为任务空间可以用相对简单的分布来捕捉。
- 可视化: UMAP 投影显示,均匀采样覆盖了整个超球面,而实际的行为任务仅占据一个小而特定的流形,验证了数据驱动采样的必要性。
5. 意义与结论
这项工作从根本上将离线 ZSRL 的范式从任意任务生成转变为行为 grounded(基于行为)。
- 实际影响: 它强调了在离线设置中,选择哪些任务进行训练与策略如何学习这些任务同样关键。
- 可扩展性: 通过将任务分布与均匀采样固有的维度灾难解耦,该方法使得在高维潜在空间中训练通用智能体成为可能。
- 泛化性: 该方法兼容各种表示学习技术(SF、FB、自动编码器等),使其成为迈向更稳健、更具泛化能力的强化学习智能体的可扩展路径,适用于任务受物理约束的现实世界部署场景。
总之,该论文认为,要在离线强化学习中实现真正的零样本泛化,智能体必须基于反映环境实际能力和动力学的任务进行训练,而不是基于抽象的、均匀分布的数学可能性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。