这篇论文介绍了一种名为 LIFT(Large-scale pretraIning and efficient FineTuning,即“大规模预训练与高效微调”)的新方法,旨在让人形机器人(比如像人一样的机器人)能更快、更安全地学会走路和适应新环境。
为了让你更容易理解,我们可以把训练机器人想象成培养一名职业运动员。
1. 核心问题:为什么现在的机器人“学”得慢且怕摔?
2. LIFT 的解决方案:三阶段“特训营”
作者提出了一个三步走的策略,把“大规模模拟训练”和“安全高效微调”完美结合。
第一阶段:在虚拟世界里“疯狂”练基本功(大规模预训练)
- 做法: 使用一种叫 SAC 的算法,在超级计算机上同时运行成千上万个虚拟机器人。
- 比喻: 这就像让运动员在虚拟健身房里,同时有 1000 个分身在进行高强度、高重复的体能训练。
- 创新点: 作者发现,通过调整训练参数(比如一次更新看很多数据),可以让这个虚拟训练既快又稳。
- 成果: 训练好的机器人可以直接走到真实的户外(草地、斜坡),不需要任何额外调整就能站稳走路(零样本部署)。这就像运动员在虚拟训练馆练好后,直接去真赛场就能跑。
第二阶段:在脑子里建立“物理引擎”(世界模型预训练)
- 做法: 机器人把第一阶段在虚拟世界跑过的所有数据记录下来,用来训练一个**“物理世界模型”**。
- 比喻: 这就像让教练根据运动员的跑步数据,画出了一本**《人体运动物理法则手册》**。这本手册不仅知道肌肉怎么动,还知道摩擦力、重力、接触地面的力是怎么变化的。
- 关键点: 这本手册不是纯靠死记硬背(纯神经网络),而是结合了真实的物理公式(比如拉格朗日方程)。这就像给 AI 装上了一个“物理直觉”,让它知道“如果脚滑了会怎样”,从而更准确地预测未来。
第三阶段:在真实世界里“安全”微调(高效微调)
这是最精彩的部分,解决了“怕摔”的问题。
- 做法:
- 真实世界只走“直线”: 当机器人去新环境(比如要跑 1.5 米/秒)时,它在真实世界里只执行最确定的动作(不随机乱动),就像运动员在真赛场上只按既定战术跑,绝不乱试错。
- 在“梦”里疯狂试错: 所有的“乱试”和“探索”都发生在刚才那本《物理手册》(世界模型)里。机器人在脑子里模拟:“如果我往左偏一点会怎样?如果我用力大一点会怎样?”
- 结果: 如果模拟中发现会摔倒,就立刻停止;如果模拟发现能跑更快,就把这个经验学下来。
- 比喻: 就像运动员在脑子里模拟各种高难度动作和意外情况,一旦在脑子里想通了,就在真实赛场上稳稳地做出来。这样既安全(不会真摔),又省样本(不需要在真实世界里摔几百次才能学会)。
3. 为什么要这么做?(核心优势)
- 又快又稳: 第一阶段利用大规模并行计算,像“闪电战”一样快速打好底子。
- 安全高效: 第三阶段把“危险”的试错关在“虚拟模型”的笼子里,只把“安全”的结论放到现实世界。
- 适应性强: 无论是换了一个新场地,还是要求跑得更快,这个框架都能快速适应,而不会像以前的方法那样直接“崩溃”。
4. 总结与展望
这篇论文就像给机器人训练设计了一套**“虚拟特训 + 物理直觉 + 安全模拟”**的完整方案。
- 以前: 机器人要么练得慢,要么在真实世界里摔得惨。
- 现在 (LIFT): 先在虚拟世界练成“肌肉记忆”,再在脑子里用“物理直觉”模拟各种突发状况,最后自信满满地走到真实世界去挑战新任务。
未来的挑战:
虽然效果很好,但目前还需要人工帮忙(比如用摄像头捕捉高度数据),而且电池续航是个问题。未来的目标是让机器人能完全自主地在真实世界里安全地反复练习,甚至学会更复杂的任务(比如踢球、拿东西)。
简单来说,LIFT 就是让人形机器人**“在梦里练千遍,在现实中走一遍”**,既聪明又安全。
这篇论文提出了一种名为 LIFT (Large-scale pretraIning and efficient FineTuning) 的框架,旨在解决人形机器人控制中大规模预训练与高效微调之间的鸿沟。该论文发表于 ICLR 2026。
以下是对该论文的详细技术总结:
1. 研究背景与问题 (Problem)
- 现状: 基于策略的强化学习(如 PPO)在大规模并行仿真中表现 robust,能够实现零样本(zero-shot)部署到真实机器人,但其样本效率低,难以在收集到有限的真实世界数据或新环境数据时进行安全适应。
- 挑战:
- 离线策略(Off-policy)算法的局限: 虽然 SAC 等离线策略算法样本效率更高,但在大规模并行仿真中的大规模预训练应用较少,且直接在新环境中进行随机探索(Stochastic Exploration)对单支撑相的人形机器人极其危险,容易导致跌倒。
- 基于模型的方法(Model-based)的局限: 虽然基于世界模型(World Model)的方法能提高样本效率,但通常需要从零开始训练,耗时极长且容易陷入局部最优。此外,纯数据驱动的世界模型在分布外(OOD)动作下容易产生预测偏差,导致策略优化不稳定。
- 核心问题: 如何结合大规模仿真的训练速度(Wall-clock efficiency)与基于模型学习的样本效率(Sample efficiency),实现人形机器人在新环境中的安全、高效微调?
2. 方法论 (Methodology)
LIFT 框架包含三个关键阶段,核心思想是**“大规模预训练 + 物理感知世界模型 + 确定性执行与模型内探索分离”**。
阶段 (i):大规模策略预训练 (Large-scale Policy Pretraining)
- 算法选择: 采用 Soft Actor-Critic (SAC) 而非 PPO。SAC 的离线特性使其在有限样本下收敛更稳定,且其状态依赖的随机策略(State-dependent stochastic actor)更适合在世界模型中进行多样化探索。
- 实现细节:
- 使用 JAX 实现 SAC,支持大规模并行仿真(MuJoCo Playground)。
- 采用大批次更新(Large-batch updates)和高更新 - 数据比(High UTD ratio,如 10),在单张 NVIDIA RTX 4090 GPU 上实现了极快的收敛(约 30 分钟)。
- 通过域随机化(Domain Randomization)增强鲁棒性,实现了在真实机器人上的零样本部署。
阶段 (ii):物理感知世界模型预训练 (Physics-Informed World Model Pretraining)
- 模型架构: 结合已知的刚体动力学(拉格朗日方程)与学习到的残差网络。
- 已知部分: 质量矩阵 M、科里奥利/离心力项 C、重力项 G 等物理先验。
- 学习部分: 一个残差网络 τϕ 用于预测未知的接触力(Contact forces)和耗散力(Dissipative torques),以及状态预测的不确定性 σϕ。
- 训练方式: 在 SAC 预训练完成后,离线利用收集到的轨迹数据训练世界模型,避免在线训练拖慢大规模仿真速度。
- 优势: 相比纯神经网络模型,物理先验显著减少了模型偏差,提高了合成轨迹(Synthetic Rollouts)的保真度。
阶段 (iii):策略与世界模型的高效微调 (Efficient Finetuning)
这是 LIFT 的核心创新点,采用了**“确定性执行,随机探索”**的分离策略:
- 真实环境执行(Deterministic Execution): 在真实环境或新仿真环境中收集数据时,仅执行确定性策略(即动作均值 μθ(s),无随机噪声)。这消除了随机探索带来的跌倒风险,保证了安全性。
- 模型内探索(Stochastic Exploration in World Model): 策略的改进完全通过在物理感知世界模型内部进行随机采样(Rollouts)来完成。
- 利用 SAC 的随机策略在世界模型中生成多样化的合成轨迹。
- 世界模型预测的状态用于计算奖励和更新策略。
- 迭代循环: 收集少量真实数据 -> 微调世界模型 -> 在世界模型中生成大量合成数据 -> 更新策略 -> 再次收集真实数据。
3. 主要贡献 (Key Contributions)
- 可扩展的 SAC 实现: 提供了基于 JAX 的 SAC 实现,支持大规模并行仿真,实现了在单卡 GPU 上 1 小时内完成人形机器人运动策略的预训练,并成功实现零样本真机部署。
- 安全的微调策略: 提出了一种混合微调策略,在真实环境中仅执行确定性动作,将随机探索限制在物理感知的世界模型内。这种方法在保证安全的同时,显著提高了样本效率。
- 开源管道: 发布了涵盖预训练、零样本部署和微调的完整开源代码库,为人形机器人控制提供了实用的基准。
4. 实验结果 (Results)
实验在 Booster T1(12/23 自由度)和 Unitree G1(29 自由度)人形机器人上进行。
- 预训练性能: LIFT 在 MuJoCo Playground 中的预训练性能与 PPO 和 FastTD3 相当或更优,收敛速度更快,且能直接零样本部署到真实机器人(Booster T1)在草地、斜坡等复杂地形上行走。
- 微调性能(Sim-to-Sim):
- 在 Brax 仿真器中进行微调(目标速度超出预训练分布,如 1.5 m/s)。
- LIFT 能够稳定收敛,准确跟踪目标速度,身体振荡小。
- 对比基线: 纯 SAC 在确定性数据下迅速过拟合发散;PPO 在有限数据下性能逐渐退化甚至崩溃;FastTD3 出现剧烈振荡;从零训练的 SSRL 无法在高速下收敛。
- 真实世界微调(Real-world Finetuning):
- 在真实 Booster T1 上,仅使用 80-590 秒 的真实数据,LIFT 就能将原本不稳定的策略调整为平稳、直立的步态。
- 证明了该方法能用极少的真实数据显著提升策略性能。
- 消融实验:
- 预训练的重要性: 没有大规模 SAC 预训练,模型容易陷入局部最优(如原地站立);没有世界模型预训练,微调效率显著下降。
- 物理先验的重要性: 相比纯神经网络的 MBPO 模型,物理感知世界模型在分布外动作下表现更稳定,MSE 更低,避免了 Critic Loss 爆炸。
5. 意义与局限性 (Significance & Limitations)
- 意义:
- 解决了人形机器人“训练慢”和“适应难”的矛盾,为从大规模仿真到真实世界的高效迁移提供了一条可行路径。
- 证明了在真实环境中进行确定性执行,配合模型内的随机探索,是解决高维连续控制中安全性与探索性冲突的有效方案。
- 物理先验的引入显著提升了基于模型强化学习在接触丰富任务(如行走)中的可靠性。
- 局限性:
- 传感器依赖: 当前实机微调依赖外部动捕系统(Vicon)获取基座高度,限制了自主性。
- 工程限制: 实机微调过程是串行的(收集数据->更新模型->更新策略),导致墙钟时间(Wall-clock time)较长,且需要频繁更换电池。
- 感知范围: 目前仅基于本体感知(Proprioception),未整合视觉等外部传感器,限制了其在复杂导航或操作任务中的应用。
总结: LIFT 框架通过巧妙结合大规模离线预训练、物理感知世界模型以及“真机确定性执行 + 模型内随机探索”的机制,成功实现了人形机器人控制的高效、安全适应,是迈向通用物理智能体(Generalist Physical Agents)的重要一步。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。