← 最新论文
💻 computer science

The Gaussian Is Enough: Flow-Matching Priors Do Not Help When Fine-Tuning Large Behavior Models

本文表明,与预期相反,在广泛的仿真和硬件基准测试中,使用非高斯替代方案取代标准高斯先验并不能提高预训练大行为模型的微调性能,因为编码器训练动态对先验选择的影响占据了主导地位。

原作者: Chen Xu, Rishi Shah, Hadas Kress-Gazit, Haruki Nishimura, Masha Itkina

发布于 2026-09-24✓ Author reviewed ⓘ
📖 1 分钟阅读☕ 轻松阅读

原作者: Chen Xu, Rishi Shah, Hadas Kress-Gazit, Haruki Nishimura, Masha Itkina

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

机器人正在学习以一种全新的智能方式进行运动,这种智能模仿了人类通过观察来学习的方式。这些机器不再是被编写用于应对每种可能情况的僵化规则,而是利用生成模型,根据它们所见所闻来预测最佳的下一步动作。想象一下,一个机械臂正试图将蔬菜从一个小碗倒入一个大箱子中。它并不会预先计算出一条完美的路径;相反,它从一个随机的猜测开始,并逐渐优化这个猜测,直到找到一个平滑且成功的动作。这个过程依赖于一个起点,即机器人开始寻找正确动作时的一个基于随机性的基准。多年来,工程师们一直使用一种标准的、简单的随机形式作为这个起点,就像一张白纸。然而,最近的研究表明,如果你能从一个已经与解决方案比较接近的猜测开始,机器人的学习速度会更快,表现也会更好。这个想法激发了一种新的思考方式:如果我们能教会机器人从一个更聪明的猜测开始,会怎样呢?

丰田研究院(Toyota Research Institute)的一个研究小组,与其来自 Woven by Toyota 和康奈尔大学(Cornell University)的同事们,决定在一种新一代的大型机器人模型上测试这个想法。这些被称为“大型行为模型”(Large Behavior Models)的模型,就像是存储着各种运动技能的海量图书馆,它们已经在数千小时的多样化机器人数据上进行了预训练。使用这些模型的标准方法是,利用这个预训练好的库,针对特定的新任务进行微调,例如打开柜门或组装零件。研究人员提出了一个简单但深刻的问题:如果他们用一个更复杂、更“聪明”的、源自机器人自身预训练知识的起点,取代标准的、简单的起点,微调过程是否会变得更有效?逻辑上似乎是成立的:从离目标更近的地方开始,会有助于机器人更快地达到目标。为了找到答案,他们在四十个不同的任务中运行了超过十万次模拟,并在实验室中通过真实的机器人硬件测试了他们的发现,观察这些机器体的实际表现。

结果令人惊讶且违反直觉。研究人员发现,使用一个更聪明、信息量更大的起点并不能帮助机器人更好地学习新任务。事实上,在许多情况下,与使用简单的标准起点相比,使用复杂起点时的机器人表现同样出色,有时甚至略逊一筹。无论是在计算机模拟中,还是在移动真实物体的物理机器人手臂上进行测试,这一结果都成立。该团队在三种不同类型的大型机器人模型上进行了测试,并发现到处都呈现出同样的模式。唯一一次“聪明”的起点显示出明显优势的情况,是当机器人获得的训练数据极其稀少时——少到机器人几乎无法从中学习任何东西。在这种特定的、数据匮乏的情景下,有信息的猜测提供了一个有益的推动。但在绝大多数情况下,即机器人有足够示例可以学习时,起点的复杂性对最终结果没有任何影响。

为了理解为什么会发生这种情况,研究人员在学习过程中深入观察了机器人的“大脑”。他们发现,尽管机器人开始的猜测各不相同,但它们最终对如何运动做出的预测都是一样的。机器人处理视觉信息的部件——视觉编码器(visual encoder)——在微调过程中发生了显著变化,无论使用哪种起点都是如此。正是这个视觉处理部分,而非初始猜测,决定了机器人学习的好坏。研究人员发现,视觉处理的质量是成功的决定性因素。如果视觉部分训练得好,机器人就会成功,无论它从哪里开始。如果视觉部分训练得不好,机器人就会挣扎,即使它有一个完美的初始猜测。这表明,起点会影响机器人在学习过程中内部表征的转变方式,但它不会改变机器人最终的表现质量。

这一发现为机器人开发的未来指明了清晰的方向。它表明,工程师们不需要花费时间和计算能力去为这些大型模型设计复杂的、定制化的起点。标准的、简单的方法已经足够且有效。相反,重点应该放在确保机器人的视觉感知和理解世界的能力是稳健且经过良好训练的。这项研究证实,对于大型预训练机器人模型而言,旅程本身并不那么重要,重要的是终点,而旅程中最关键的部分是机器人解释其所见内容的能力,而不是它在开始之前所做的随机猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →