← 最新论文
💬 NLP

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

该论文提出了 EmbodiedMidtrain 方法,通过构建数据引擎筛选与具身领域高度对齐的视觉语言模型(VLM)数据进行中间训练,从而有效弥合 VLM 与具身视觉语言动作模型(VLA)之间的分布差距,显著提升了机器人操作任务的性能。

原作者: Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

发布于 2026-04-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 EmbodiedMidtrain 的新方法,旨在解决机器人“大脑”升级中的一个关键难题。

为了让你轻松理解,我们可以把机器人控制模型想象成一位正在学习做菜的学徒厨师

1. 核心问题:学徒的“食谱”不匹配

  • 现状(VLM): 现在的机器人模型(叫 VLM,视觉 - 语言模型)就像是一位读过万卷书、看过无数美食图片的理论大师。他懂很多关于“红烧肉”、“切菜”的词汇,也能识别图片里的食材。但是,他没怎么下过厨,不知道手该怎么动,也不知道刀该怎么握。
  • 目标(VLA): 我们想要的是机器人模型(叫 VLA,视觉 - 语言 - 动作模型),它不仅要懂理论,还要能真正动手把菜做出来。
  • 痛点: 目前的做法通常是直接拿这位“理论大师”去微调,让他学做菜。但问题在于,大师读的书(通用数据)和厨师需要的实操经验(机器人数据)差别太大了。
    • 比喻: 这就像让一个只看过《米其林指南》和《世界美食地图》的人,突然去学怎么在拥挤的厨房里切洋葱。虽然他知道洋葱长什么样,但他不知道手该怎么用力,容易切到手或者切得乱七八糟。这就是论文里说的**“分布差距”**。

2. 解决方案:EmbodiedMidtrain(中间训练)

作者没有直接让大师去学做菜,也没有让他重新读一遍所有的书,而是发明了一个聪明的**“选书策略”**,叫 EmbodiedMidtrain

第一步:建立“试吃员”(Proximity Estimator)

作者训练了一个轻量级的“试吃员”(一个小型的分类器)。

  • 它的工作: 这个试吃员手里拿着“机器人实操手册”(VLA 数据)作为标准。它会去翻阅“理论大师”读过的海量书籍(VLM 数据)。
  • 它的判断: 它会问:“这本书里讲的内容,跟‘切洋葱’、‘拿勺子’这些实操动作有关吗?”
    • 如果书里讲的是“如何识别洋葱的产地”或者“洋葱的历史”,试吃员会打低分(因为这对动手操作帮助不大)。
    • 如果书里讲的是“如何握刀”、“如何判断食材软硬”、“空间位置关系”,试吃员会打高分。

第二步:精选“特训教材”(Data Selection)

试吃员把所有高分的章节挑出来,剔除那些虽然精彩但跟动手无关的“纯理论”内容。

  • 比喻: 就像是从图书馆里把那些讲“美食哲学”的书先放一边,只把那些讲“烹饪技巧”、“厨房空间布局”、“手部动作指南”的章节挑出来,汇编成一本**《机器人实操特训教材》**。

第三步:中间训练(Mid-training)

让“理论大师”先读这本《特训教材》。

  • 这不是让他直接去炒菜(那是最后的微调),而是让他先转变思维模式。让他从“只会看”转变为“开始思考怎么动”。
  • 读完这本教材后,他的“大脑”已经做好了准备,内部的知识结构更贴近实际操作了。

第四步:最终微调(Fine-tuning)

最后,再用真正的机器人实操数据(VLA 数据)对他进行最后的强化训练。

  • 结果: 因为他的“大脑”已经通过《特训教材》做好了铺垫,现在的学习效率极高,学得非常快,而且做得非常好。

3. 为什么这个方法很厉害?(实验结果)

论文通过三个机器人任务(像 Calvin、SimplerEnv、Libero 等)进行了测试,发现:

  1. 小模型也能打大模型: 作者用的模型其实很小(只有 11 亿参数),但经过这个“特训”后,它的表现竟然超过了那些参数巨大(几十亿甚至上百亿)、但没经过这种精选训练的“大胖子”模型。
    • 比喻: 一个经过精准特训的小个子厨师,比一个读过所有书但没经过针对性训练的大胖子厨师,切菜更稳、更快。
  2. 举一反三: 这套“选书策略”是通用的。用 A 模型选出来的好教材,拿去训练 B 模型,B 模型也能变强。说明这种“实操思维”是通用的。
  3. 起步即巅峰: 这种训练带来的好处,从机器人开始学习动作的第一秒就显现出来了,并且随着训练时间越长,优势越大。

4. 总结

这篇论文的核心思想就是:不要盲目地让机器人去读所有的书,要教它读“对”的书。

  • 以前: 给机器人喂海量的通用数据(像大海一样),然后指望它自己悟出怎么干活。
  • 现在(EmbodiedMidtrain): 先派一个聪明的“选书员”,从海量数据里精准挑出那些最接近实际操作场景的内容,让机器人先“预习”一遍。
  • 效果: 这样不仅省资源(不用读那么多没用的书),而且让机器人学得更扎实、更聪明,最终能更好地完成复杂的物理任务(如抓取物体、组装零件)。

这就好比教孩子学开车,与其让他先背完所有交通法规和历史,不如先让他看一些关于“如何握方向盘”、“如何判断车距”的精选视频,然后再上路练习,效果会好得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →