✨ 要点🔬 技术摘要
机器人正在学习以一种全新的智能方式进行运动,这种智能模仿了人类通过观察来学习的方式。这些机器不再是被编写用于应对每种可能情况的僵化规则,而是利用生成模型,根据它们所见所闻来预测最佳的下一步动作。想象一下,一个机械臂正试图将蔬菜从一个小碗倒入一个大箱子中。它并不会预先计算出一条完美的路径;相反,它从一个随机的猜测开始,并逐渐优化这个猜测,直到找到一个平滑且成功的动作。这个过程依赖于一个起点,即机器人开始寻找正确动作时的一个基于随机性的基准。多年来,工程师们一直使用一种标准的、简单的随机形式作为这个起点,就像一张白纸。然而,最近的研究表明,如果你能从一个已经与解决方案比较接近的猜测开始,机器人的学习速度会更快,表现也会更好。这个想法激发了一种新的思考方式:如果我们能教会机器人从一个更聪明的猜测开始,会怎样呢?
丰田研究院(Toyota Research Institute)的一个研究小组,与其来自 Woven by Toyota 和康奈尔大学(Cornell University)的同事们,决定在一种新一代的大型机器人模型上测试这个想法。这些被称为“大型行为模型”(Large Behavior Models)的模型,就像是存储着各种运动技能的海量图书馆,它们已经在数千小时的多样化机器人数据上进行了预训练。使用这些模型的标准方法是,利用这个预训练好的库,针对特定的新任务进行微调,例如打开柜门或组装零件。研究人员提出了一个简单但深刻的问题:如果他们用一个更复杂、更“聪明”的、源自机器人自身预训练知识的起点,取代标准的、简单的起点,微调过程是否会变得更有效?逻辑上似乎是成立的:从离目标更近的地方开始,会有助于机器人更快地达到目标。为了找到答案,他们在四十个不同的任务中运行了超过十万次模拟,并在实验室中通过真实的机器人硬件测试了他们的发现,观察这些机器体的实际表现。
结果令人惊讶且违反直觉。研究人员发现,使用一个更聪明、信息量更大的起点并不能帮助机器人更好地学习新任务。事实上,在许多情况下,与使用简单的标准起点相比,使用复杂起点时的机器人表现同样出色,有时甚至略逊一筹。无论是在计算机模拟中,还是在移动真实物体的物理机器人手臂上进行测试,这一结果都成立。该团队在三种不同类型的大型机器人模型上进行了测试,并发现到处都呈现出同样的模式。唯一一次“聪明”的起点显示出明显优势的情况,是当机器人获得的训练数据极其稀少时——少到机器人几乎无法从中学习任何东西。在这种特定的、数据匮乏的情景下,有信息的猜测提供了一个有益的推动。但在绝大多数情况下,即机器人有足够示例可以学习时,起点的复杂性对最终结果没有任何影响。
为了理解为什么会发生这种情况,研究人员在学习过程中深入观察了机器人的“大脑”。他们发现,尽管机器人开始的猜测各不相同,但它们最终对如何运动做出的预测都是一样的。机器人处理视觉信息的部件——视觉编码器(visual encoder)——在微调过程中发生了显著变化,无论使用哪种起点都是如此。正是这个视觉处理部分,而非初始猜测,决定了机器人学习的好坏。研究人员发现,视觉处理的质量是成功的决定性因素。如果视觉部分训练得好,机器人就会成功,无论它从哪里开始。如果视觉部分训练得不好,机器人就会挣扎,即使它有一个完美的初始猜测。这表明,起点会影响机器人在学习过程中内部表征的转变方式,但它不会改变机器人最终的表现质量。
这一发现为机器人开发的未来指明了清晰的方向。它表明,工程师们不需要花费时间和计算能力去为这些大型模型设计复杂的、定制化的起点。标准的、简单的方法已经足够且有效。相反,重点应该放在确保机器人的视觉感知和理解世界的能力是稳健且经过良好训练的。这项研究证实,对于大型预训练机器人模型而言,旅程本身并不那么重要,重要的是终点,而旅程中最关键的部分是机器人解释其所见内容的能力,而不是它在开始之前所做的随机猜测。
技术摘要:高斯分布足以进行大型行为模型微调
问题陈述 现代机器人模仿学习越来越多地利用基于扩散(diffusion)或流匹配(flow-matching)模型的生成式策略。这些模型通过将样本从先验分布 p 0 p_0 p 0 传输到以观测为条件的特定动作分布来生成动作。虽然近期的研究已经证明,将标准的各向同性高斯先验替换为非高斯的、“更接近目标”的先验,可以显著提升从零开始训练策略时的性能,但目前尚不清楚这种优势是否能迁移到预训练大型行为模型(LBMs)的微调过程中。LBMs(如 LBM 1.0、π 0.5 \pi_{0.5} π 0.5 和 GR00T N1.5)通常在多样化的数据上进行预训练,然后针对特定任务进行微调。本文探讨的核心问题是:使用一个经过信息化的、非高斯的动作先验(例如,从预训练模型本身采样的动作)进行初始化微调过程,是否比使用标准的高斯先验能获得更好的性能?
方法论 作者进行了一项大规模实证研究,涉及在两个仿真平台(LBM Eval 和 RoboCasa365)上的 40 多个任务中的 100,000 次以上的仿真展开,以及在五个双臂操作任务上的 1,250 次硬件展开。
先验变体: 研究对比了七种不同的先验构建方式:
标准基准: 各向同性高斯 Z ∼ N ( 0 , I ) Z \sim \mathcal{N}(0, I) Z ∼ N ( 0 , I ) 。
提议的先验(源自预训练 LBM π p r e \pi_{pre} π p r e ):
A p r e A_{pre} A p r e :由冻结的预训练策略生成的动作(部分去噪)。
A p r e + σ A Z A_{pre} + \sigma_A Z A p r e + σ A Z :在动作空间中加入高斯噪声后的 A p r e A_{pre} A p r e 。
E p r e + σ E Z E_{pre} + \sigma_E Z E p r e + σ E Z :在预训练编码器嵌入中加入高斯噪声,用于生成动作。
文献基准: Cocos(条件相关高斯)、BRIDGER(基于 CVAE 的先验)和 Retrieval(基于 k-NN 的先验)。
实验设置:
设置 A: 使用人工构建的强先验(在 50% 数据上微调过的检查点)进行受控比较,以确保该先验在 ℓ 2 \ell_2 ℓ 2 距离上确实比标准先验更接近目标。
设置 B(仿真与现实): 在不同数据比例(5% 到 100%)下,在仿真环境和物理硬件(Franka FR3 手臂)上对 LBM 1.0 进行微调。
设置 C: 在 RoboCasa 基准测试中,跨不同 LBM 架构(π 0.5 \pi_{0.5} π 0.5 和 GR00 1.5)进行验证。
分析与诊断:
性能指标: 使用严格的统计检验(针对二元结果的 STEP 框架,针对连续指标的 Welch's t-检验,并进行 Bonferroni 校正)评估成功率和部分任务进度。
内省指标: 用于衡量无训练特征质量的 LogME、每观测值的 ℓ 2 \ell_2 ℓ 2 距离,以及动作空间和嵌入空间的余弦相似度。
消融实验: 进行了学习率消融实验,以分离编码器训练与先验选择的影响。
关键结果 研究一致发现,即使是非高斯先验(即便其在数学上明显更接近目标分布),也无法提高微调性能 ,其表现与标准高斯先验相当。
性能等效性: 在所有架构、所有数据比例(除一个特定的极低数据情况外)以及所有环境(仿真和硬件)中,使用非高斯先验微调得到的策略,其成功率在统计学上与使用高斯先验微调得到的策略没有显著差异,甚至偶尔表现更差。
“更接近”的先验悖论: 在设置 A 中,非高斯先验 A p r e A_{pre} A p r e 比高斯先验在距离目标动作方面近了 3 倍。虽然这在从零开始训练时带来了显著收益,但在微调过程中却未能提供任何优势。
低数据例外: 仅在极低数据量级(5% 的演示数据,约 10–20 个样本)下观察到了边际收益,此时嵌入空间抖动先验(E p r e + σ E Z E_{pre} + \sigma_E Z E p r e + σ E Z )的表现优于高斯先验。
架构泛化性: 这一负面结果在 LBM 1.0、π 0.5 \pi_{0.5} π 0.5 和 GR00T N1.5 上均成立。
诊断发现:为什么先验并不重要 作者通过三种诊断手段提供了对此现象的机制性解释:
特征质量: 无论使用何种先验,微调后的编码器产生的特征在预测能力上(通过 LogME 衡量)是相等的。
动作收敛: 微调后的动作预测在与真实值的距离上,对于所有先验都趋于相似。
表示差异: 尽管输出相似,但其内部表示 存在显著差异。高斯先验使得编码器相对于其预训练状态的变化最小;而非高斯先验(尤其是 A p r e A_{pre} A p r e )则迫使编码器进行大幅度的重构,以补偿偏移的先验。
主导因素: 学习率消融实验证实,**观测编码器(observation encoder)**的质量是决定性能的主导因素。降低编码器的学习率会导致成功率大幅下降(15–17%),而即使在固定的学习率范围内改变先验,其影响也微乎其微。
意义与结论 本文得出结论:对于大型行为模型的微调,标准的各向同性高斯先验是一个充分且得到支持的选择。研究挑战了“更接近”的先验可以通过减少动作空间的传输距离来促进微调的直觉。相反,结果表明:
预训练编码器是微调成功的核心驱动力。
先验的选择会影响优化轨迹和编码器重构的程度,但不会影响最终的策略性能。
在微调阶段实现复杂的学习型先验会增加工程开销,却无法带来可衡量的收益。
作者将这项工作定位为首个针对 LBM 微调中非高斯先验的大规模研究,通过一个负面结果引导未来的研究方向转向理解编码器的学习动力学,以及在何种条件下(如极低数据量级)先验可能仍然发挥作用。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。