想象一下教机器人走路、跑步或保持平衡。这不像教狗做把戏;它更像是试图在一个巨大的控制面板上找到数百万个微小旋钮的完美组合,以使机器人平稳移动。这就是机器人策略学习的挑战。
本文介绍了一种名为TFM-S3的新方法,旨在帮助机器人更快、更少错误地学习这些技能。以下是通过简单类比对其工作原理的解释。
问题:陷入泥潭
当前教机器人的方法通常陷入两个陷阱:
- “局部徒步者”:这些方法就像一个只盯着脚下地面的徒步者。他们迈着小步爬山(提升机器人技能)。但如果他们起始于一个小山谷,可能会被困在那里,永远意识不到附近有一座更高的山峰。他们需要花费大量时间和精力才能找到最佳路径。
- “盲目搜索队”:其他方法则一次性派出数百个机器人,尝试旋钮的随机组合。这对于发现新的高峰很有用,但成本极高。这就像雇佣一支军队去尝试每一条可能的路径,只为看看哪条行得通。这浪费了大量资源。
解决方案:智能地图与侦察兵
作者提出了TFM-S3,这是一种混合方法,就像一个拥有魔法地图的智能侦察兵。它将“局部徒步者”的谨慎攀登与“搜索队”的广阔视野相结合,但效率极高。
以下是逐步过程:
1. 寻找“主干道”(子空间)
机器人的控制面板上有数十万个旋钮。试图同时调整所有旋钮是不可能的。
- 类比:想象机器人的学习过程是一辆在巨大平坦平原上行驶的汽车。汽车不需要向每个方向行驶;它主要需要在少数几条特定的“主干道”上行驶,因为主要的进展就发生在这里。
- 方法:系统查看机器人最近的学习历史,并利用数学方法(称为 SVD)找到这些“主干道”。它忽略数百万个无关的旋钮,只专注于当下真正重要的几十个。这将一个混乱的迷宫变成了一条简单笔直的道路。
2. “魔法预测器”(表格基础模型)
现在机器人已经在“主干道”上了,它需要决定往哪个方向走。
- 类比:通常,为了知道一条路是否好走,你必须实际开上去,看看它是否通向悬崖,然后再掉头。这既缓慢又危险。
- 创新:作者使用了一个预训练的“魔法预测器”(一种表格基础模型)。将其想象为一个超级聪明的天气预报员。与其开车去检查天气,不如让这位预报员查看几个最近的数据点(“上下文集”),并瞬间预测出数百条其他潜在路径的天气状况。
- 结果:系统可以在脑海中“模拟”行驶 256 条不同的路径,预测哪条能带来最佳回报,然后仅在此之后才实际行驶那条最佳路径进行确认。这节省了巨大的时间和能量。
3. 循环:攀登、扫描、重复
该方法按循环运作:
- 攀登:机器人迈着小而谨慎的步伐(局部更新)以变得更好。
- 扫描:每隔一段时间,系统暂停。它构建其“主干道”地图,请求“魔法预测器”筛选数百个潜在动作,选出优胜者并进行测试。
- 重复:机器人利用这个新的、更好的位置继续攀登。
为何效果更好
该论文在标准的机器人模拟游戏(如让虚拟猎豹奔跑或让人类行走)中测试了这种方法。
- 速度:机器人学习基础的速度比传统方法快得多。
- 质量:到训练结束时,机器人的任务表现优于使用标准方法的机器人,尽管它们都使用了完全相同数量的“练习时间”(rollouts)。
- 可靠性:该方法更加稳定。无论机器人从哪个随机起点开始,它几乎总能找到出色的解决方案。
核心结论
TFM-S3就像给机器人配备了一个只关注最重要道路的 GPS,以及一个在你开车前就能预测交通状况的水晶球。它阻止机器人在巨大的选项领域中漫无目的地徘徊,也防止它被困在小山谷里。通过使用预训练的“大脑”来预测结果,它用极少的试错就能找到最佳动作,从而使机器人学习更快、更便宜、更有效。
以下是论文《表格基础模型能否指导机器人策略学习中的探索?》的详细技术总结:
1. 问题陈述
本文探讨了在利用深度强化学习(RL)进行机器人高维连续控制时,面临的样本效率与优化稳定性挑战。
- 局部与全局的权衡:标准的基于梯度的方法(如 TD3、SAC)在高维参数空间中执行局部更新。虽然具有可扩展性,但由于非凸景观的影响,它们往往陷入次优区域或收敛缓慢。相反,全局搜索方法(如进化策略、基于种群的训练)探索更广泛的区域,但由于“维数灾难”,其产生的** rollout 成本**(环境交互)过高。
- 代理模型的局限性:贝叶斯优化(BO)试图利用代理模型降低 rollout 成本。然而,由于数据稀疏性,经典 BO 在高维空间(数万至数十万参数)中失效。此外,RL 中的策略景观是非平稳的(在训练过程中演变),这违反了传统 BO 的固定域假设。
- 差距:亟需一种方法,既能结合代理引导搜索的样本效率,又能适应高维、演变的 RL 策略所需的灵活性,同时无需巨大的交互预算。
2. 方法论:TFM-S3
作者提出了TFM-S3(表格基础模型引导的子空间搜索),这是一个混合框架,将标准的基于梯度的局部更新与周期性的、代理引导的全局搜索轮次交错进行。
A. 动态低维子空间构建
TFM-S3 不搜索完整的高维参数空间(RD),而是将全局搜索限制在一个动态更新的低维子空间(Rr)内。
- 梯度信息基:在每次搜索轮次 t,该方法收集最近的 Q 个策略梯度快照(G(t))。
- SVD 分解:对 G(t) 执行截断奇异值分解(SVD),提取前 r 个左奇异向量(Ur)。这些向量构成一个正交基 A(t),捕捉了近期训练中观察到的主导更新方向。
- 适应性:随着训练进展,子空间不断演变,确保搜索几何结构适应变化的策略景观,而不是依赖静态的随机投影。
B. 代理引导的全局搜索
在低维子空间内,TFM-S3 执行迭代搜索,以最小的 rollout 次数找到高性能的策略候选者。
- 上下文初始化:在子空间中采样一小部分候选策略,并通过真实环境 rollout 进行评估,形成上下文集(C)。
- 表格基础模型(TFM):使用预训练的表格基础模型(具体为TabPFN-v2)作为代理。与传统的 Gaussian Process 不同,TFM 在多样化的回归任务上进行预训练,提供了强大的归纳偏置,并能从极小的样本量(例如 K=16)中实现鲁棒的泛化。
- 迭代细化循环:
- TFM 预测围绕当前最佳候选者采样的大量新候选者(N=256)的回报。
- 选择预测回报最高的候选者。
- 仅通过真实 rollout评估这一个最佳候选者。
- 将结果添加到上下文集中,更新 TFM 的下一轮迭代条件。
- 该循环在每轮搜索中重复 T 次(例如 16 次迭代)。
- 策略更新:搜索轮次中发现的最佳候选者被投影回原始高维空间,并用于初始化下一阶段基于梯度的局部训练。
3. 主要贡献
- 动态子空间搜索:作者引入了一种基于梯度的 SVD 过程来构建低维策略子空间,使其适应演变的优化轨迹,从而解决了 RL 固有的非平稳性问题。
- 基础模型代理:他们证明了预训练的表格基础模型可以作为 RL 中回报预测的有效、免调优代理,能够在数据极少(小样本泛化)的情况下可靠地筛选候选者。
- 样本高效的混合框架:TFM-S3 成功桥接了基于梯度的 RL 与全局搜索,在相同的 rollout 预算下,比基线方法实现了更快的收敛和更好的最终性能。
4. 实验结果
该方法在三个 MuJoCo 连续控制基准测试上进行了评估:HalfCheetah-v5、Ant-v5 和 Humanoid-v5,使用TD3作为骨干网络。
- 性能:与 vanilla TD3、同一子空间内的随机搜索以及“一次性”变体(无迭代细化)相比,TFM-S3 始终加速了早期阶段的收敛,并实现了更高的最终回报。
- 效率:在 100 万环境步的固定预算下,TFM-S3 显著更快地达到目标性能阈值(例如,Humanoid 在约 38% 的步数内达到最终性能的 90%,而 vanilla TD3 需要 48%)。
- 稳定性:该方法降低了随机种子之间的变异性,表明策略更新更加稳定。
- 内部动态:
- 排序一致性:在初始预热阶段后,TFM 在预测回报与真实回报之间显示出较高的 Spearman 秩相关系数(高达 0.97)。
- 选择质量:TFM 选择的 top-1 候选者有 63.5% 的时间落在真实回报的**前 20%**内,而随机选择仅为 20%。
- 迭代收益:“一次性”变体的表现不如完整的迭代版本,证明了序列细化(用新的真实数据更新代理)对于成功至关重要。
5. 意义
- RL 的新范式:这项工作确立了表格基础模型作为机器人策略学习的强大工具,将其应用从传统的静态表格数据扩展到动态、高维的控制问题。
- 弥合差距:它为机器人领域的“样本效率”瓶颈提供了切实可行的解决方案。通过结合降维(SVD)与数据高效先验(TFM),它实现了全局探索,而无需基于种群方法那样巨大的计算成本。
- 模块化:该框架与底层 RL 算法正交(以 TD3 为例,但同样适用于 SAC、PPO 等),使其成为现有策略优化管道的通用增强方案。
总之,TFM-S3 证明了在动态重构的低维流形中利用预训练基础模型,可以显著提高机器人策略学习的样本效率和鲁棒性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。