← 最新论文
🤖 machine learning

Fast and Accurate: An Adaptive VLA Inference Framework through Environment-aware Model Selection

本文提出了环境感知模型选择(EMS),这是一种自适应视觉-语言-动作(VLA)推理框架,它能够根据实时反馈在完全解耦的大规模决策系统与轻量级反应系统之间进行动态切换,从而在无需端到端联合训练的情况下,实现高频闭环控制和鲁棒的任务成功。

原作者: Yuewei Sun, Lang Qin, Zechuan Tian, Jingwen Li, Guiqin Wang, Shengzeng Huo, Wenxin Ren, Tao Fang, Xiaochen Zhang, Guanqing Deng, Xiang Wang, Xiaowen Dong, Qinghai Guo, Yuxin Ma

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuewei Sun, Lang Qin, Zechuan Tian, Jingwen Li, Guiqin Wang, Shengzeng Huo, Wenxin Ren, Tao Fang, Xiaochen Zhang, Guanqing Deng, Xiang Wang, Xiaowen Dong, Qinghai Guo, Yuxin Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:机器人不再是仅仅遵循僵化脚本的笨拙机械臂,而是能够观察、理解并对复杂多变的现实世界做出反应的聪明助手。这就是“具身智能”(embodied intelligence)的梦想——赋予机器一个身体和一个大脑,让它们能够完成诸如冲咖啡、叠衣服或搭建积木塔之类的任务。为了实现这一目标,科学家们正在构建一种特殊的 AI 模型,称为视觉-语言-动作(Vision-Language-Action, VLA)模型。你可以把这些模型想象成机器人的大脑,它能看一张图片,读到一个句子如“拿起红色的杯子”,然后计算出精确的动作来完成指令。

然而,这里有一个棘手的难题:聪明与快速往往是相互矛盾的。那些能够解决复杂谜题和制定长期策略的超级聪明的大脑通常既沉重又缓慢,就像一位在走一步棋之前需要思考数分钟的国际象棋大师。但机器人需要以眨眼间的速度进行反应——每秒钟数百次——以接住掉落的物体或避免撞到墙壁。如果机器人思考太久,就会错过时机;如果思考太快,则可能会犯低级错误。科学家们曾尝试通过构建“双系统”机器人来解决这个问题,其灵感源于人类的思维方式:一个用于快速反应的本能系统,以及一个用于重大决策的深思熟度的系统。但直到现在,这两个系统一直被紧紧地粘合在一起,无法独立工作,导致它们难以升级或切换。

本文介绍了一种构建机器人大脑的新方法,称为 EMS(环境感知模型选择)。作者并没有将快速大脑和慢速大脑粘在一起,而是构建了一个框架,让它们成为完全独立、可即插即用的搭档。它们就像一支拥有“教练”和“球员”的运动队。教练(系统 2)是那个缓慢而超级聪明的模型,负责规划整体策略并确保任务正确完成,但它太慢了,无法进行实时比赛。球员(系统 1)则是轻量级、闪电般的快速模型,它可以每秒数百次地驱动机器人的关节运动,以保持动作的流畅和响应。

其中的神奇之处在于一个微小且聪明的开关(切换模块),它充当了裁判的角色。它实时观察机器人的环境,并决定:“我们现在需要教练的深度思考吗?还是球员可以处理这件事?”如果机器人只是在空旷的房间里移动,开关会让快速的“球员”接管,以保持动作的流畅与迅速。但如果机器人即将抓取一个光滑的物体,或者需要处理一个棘手的新步骤,开关会立即召唤“教练”来看一眼,并给出一个更好的计划。至关重要的一点是,这两个系统并不共享它们的内部“想法”或混乱的数据;它们只交流最终想要执行的动作。这意味着你可以稍后将教练更换为更聪明的模型,而无需重新训练整个团队。

研究人员在计算机模拟和真实的双手机器人上测试了这一想法。在模拟实验中,使用 LIBERO 基准测试,他们的系统达到了约 92.4% 的成功率,这几乎与仅使用缓慢而聪明的“教练”单独运行的效果持平。但关键在于:虽然缓慢的“教练”每秒只能做出 6.3 次决策,但 EMS 系统却能让机器人以 93.4 Hz 的惊人频率运动(接近每秒 100 次)。这意味着机器人的智能程度几乎与慢速模型相当,但运动速度快了近 15 倍。

在现实世界中,他们测试了一个进行叠碗任务的双臂机器人。仅使用慢速模型时,完成任务平均需要 29 秒;而仅使用快速模型时速度很快(约 18 秒),但因为不够谨慎而经常失败。EMS 系统找到了平衡点:它在 23 秒 内完成了任务,且成功率为 70%。它之所以能做到这一点,是因为它仅在约 15% 的时间里使用缓慢且谨慎的模型(在模拟中),或者在特定的现实场景中增加 1.0 到 1.68 倍 的使用频率,仅在需要纠正错误和规划复杂动作时才调用,而在其余大部分时间里让快速模型承担主要工作。

论文明确反对了以往那种快速和慢速系统紧密耦合、共享内部数据的旧方法。作者发现,这种紧密的连接使得在不重新训练整个系统的情况下升级其中一部分变得不可能,并且限制了机器人的实际移动速度。他们的“解耦”方法表明,保持系统独立并由一个智能开关进行管理,是拥有既快速又可靠的机器人的关键。虽然研究结果令人鼓舞,但作者也指出,在现实世界中,系统的速度仍受限于快速模型的性能,且成功率高度依赖于快速模型自身处理任务的能力。但通过仅在绝对必要时调用慢速模型,他们证明了机器人终于可以开始深度思考,而不必失去反应能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →