← 最新论文
🤖 AI

EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models

EXPO-FT 是一种新颖的系统,它能够实现预训练视觉 - 语言 - 动作模型的稳定且高度样本高效的强化学习微调,仅需极少的在线机器人数据即可在复杂操作任务中达成完美的成功率。

原作者: Perry Dong, Kuo-Han Hung, Tian Gao, Dorsa Sadigh, Chelsea Finn

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Perry Dong, Kuo-Han Hung, Tian Gao, Dorsa Sadigh, Chelsea Finn

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于EXPO-FT论文的通俗化解读,通过类比用日常语言进行解释。

核心难题:“聪明但笨拙”的机器人

想象你雇佣了一个机器人,它读遍了图书馆里的每一本书,也观看了数百万段人们做家务的视频。这个机器人(被称为VLA,即视觉 - 语言 - 动作模型)极其聪明。它知道什么是“杯子”,明白“倾倒”是什么意思,也大致懂得如何握勺。

然而,当你要求这个机器人在厨房里实际执行一项具体且棘手的任务时——比如在不打碎的情况下翻动一枚脆弱的鸡蛋,或者穿针引线——它往往会失败。这就像一位博览群食谱的天才厨师,却从未在真正的厨房里做过饭;它懂理论,但双手笨拙。

在现实世界中,如果机器人打碎了花瓶或洒了汤,那就是代价高昂的错误。我们需要一种方法,将这种“聪明但笨拙”的机器人迅速训练得可靠,而无需花费数月的试错时间。

解决方案:EXPO-FT(“导师”系统)

研究人员创建了一个名为EXPO-FT的系统。你可以把它想象成一位坐在机器人身旁、在它练习时进行指导的私人导师

以下是其工作原理,借助几个比喻来说明:

1. “编辑”机制(机器中的幽灵)

通常,当你试图教一个超级聪明的机器人新技能时,你必须重新训练它的整个大脑,这既缓慢又充满风险。这就像为了修正一个拼写错误而试图重写整部百科全书。

EXPO-FT 的做法更聪明。它保持机器人的“大脑”(预训练模型)完全不变。相反,它在顶部添加了一个微小的、轻量级的“幽灵”层。

  • 比喻:想象机器人正在驾驶汽车。机器人的大脑知道如何在高速公路上行驶。“幽灵”则是一位手持小方向盘的乘客。如果机器人试图转弯过急,幽灵会轻轻推动方向盘以修正路径。
  • 结果:机器人学会了进行微小而精确的修正,而无需从头重新学习如何驾驶。这使得学习变得极其迅速。

2. “人在回路”(保护员)

有时,机器人会陷入困境或尝试危险的动作。在过去,机器人必须完全靠自己解决这个问题,这需要很长时间。

  • 比喻:想象一名体操运动员正在练习一个新的空翻。如果她开始摔倒,一名保护员(人类教练)会接住她,或者轻轻推一把帮助她安全落地。
  • 结果:在 EXPO-FT 中,人类可以实时介入,手动纠正机器人的动作。机器人会立即从这次纠正中学习。这阻止了机器人浪费时间探索糟糕的想法,并显著加快了学习进程。

3. “动作块”(舞蹈动作)

现代机器人并非一次只移动一个关节;它们会规划一系列动作(就像一套舞蹈编排)。

  • 比喻:EXPO-FT 不是教机器人“向左移,然后向右移,然后抬起”,而是教它整个“动作块”,就像教一整段舞步。
  • 结果:这符合机器人自然的思考方式,使训练更加顺畅和高效。

结果:从“可能”到“完美”

研究人员在 8 项极具挑战性的任务上测试了该系统,例如:

  • 在平底锅中翻动鸡蛋而不将其弄破。
  • 台球击入袋中。
  • 花茎插入狭窄的葡萄酒瓶中。
  • 布置串灯并插上电源。

结果如下:

  • 之前:其他方法(如从头训练机器人或仅向其展示视频)表现挣扎。它们的成功率可能仅为 50% 到 70%,或者需要数小时的数据才能达到这一水平。
  • 使用 EXPO-FT 后:机器人在每一项任务上都实现了100% 的成功率(30 次尝试全部成功)
  • 速度:这仅平均花费了19 分钟的真实世界练习时间。

为何这很重要

该论文声称,EXPO-FT 弥合了“懂理论的聪明 AI"与“能胜任工作的可靠机器人”之间的鸿沟。通过将机器人现有的知识与一个智能、轻量级的修正系统以及人类的少量帮助相结合,他们可以在不到 20 分钟的时间内将笨拙的机器人转变为大师级工匠。

他们也已免费发布了代码,希望其他研究人员能利用这种“导师”系统,使他们的机器人更加可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →