rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference
rMuscle 是一个受人类肌肉记忆启发而设计的实时视觉-语言-动作推理框架,通过一种在相似重复任务中复用视觉标记(visual tokens)和神经元激活的双阶段缓存机制,在保持原始成功率的同时,将机器人的响应速度提升了 1.29–1.42 倍。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代制造业繁忙的世界中,一种新型的工人正走上工厂车间:由人工智能引导的机器人。与过去只能永远重复单一动作的僵化、预设程序的机器不同,这些新系统旨在通过视觉和语言来理解世界。它们可以观察杂乱的桌面,阅读如“拿起红瓶子”之类的指令,并计算出完成任务所需的精确动作。这种能力依赖于机器的一种特定类型的“大脑”,即视觉-语言-动作模型(vision-language-action model)。这些模型充当机器的中枢神经系统,处理机器人所见所闻,然后将这种理解转化为物理指令流。对于这些机器人在真实的工厂中真正发挥作用,它们必须具备极高的速度。如果机器人的“大脑”思考时间过长,机器就会出现停顿,动作变得生硬,并且在人类工人介入或物体移动时无法做出快速反应。机器人思考和决策的速度,是决定其能否跟上人类工作节奏的最关键因素。
上海交通大学的研究人员发现,这些智能机器人目前的思考方式存在一个根本性的瓶颈。他们发现,虽然驱动这些机器人的软件极其先进,但由于不断地重复学习相同的内容,往往造成了时间的浪费。在典型的工厂环境中,机器人并不会每秒钟都面对一个全新的世界。相反,它执行的是一种重复的任务循环,通常是在相似的照明条件下将相似的物体移动到相似的位置。研究团队发现,由于任务高度相似,机器人的内部状态——即其数字大脑内部复杂的活动模式——从一次尝试到下一次尝试也会变得非常相似。正如人类钢琴家在演奏熟悉的曲目时,不需要每次都重新学习手指的动作一样,机器人也具备回忆这些模式的能力。然而,现有的软件框架并未利用这一点;它们强迫机器人从头开始进行每一次计算,即使答案与刚才的答案几乎完全相同。
为了解决这个问题,研究人员开发了一种名为 rMuscle 的新系统,该框架旨在赋予机器人一种数字形式的“肌肉记忆”。该系统通过观察机器人如何执行任务,并保存其在成功尝试过程中的“想法”。当机器人遇到看起来与之前类似的场景时,rMuscle 不会从零开始,而是从其记忆库中检索相关的内部模式。该系统基于两种截然不同的记忆类型来处理机器人思考的不同方式。第一部分被称为“上下文缓存”(Context Cache),负责视觉处理。当机器人看到熟悉的场景时,该缓存允许它跳过对每个像素进行繁重分析的过程,转而复用之前视觉分析的结果。第二部分是“动作缓存”(Action Cache),负责运动的决策。它识别出在许多重复性任务中,实际上只需要机器人内部一小部分特定的决策组件即可解决问题。通过识别在熟悉场景中哪些特定的“大脑区域”处于活跃状态,系统可以忽略其余部分,仅加载必要的组件来进行决策。
研究人员在各种机器人和任务上测试了这种方法,范围涵盖了从模拟环境到在流水线上工作的真实物理机器人。他们使用了通常出现在高端机器人实验室中的高性能计算机和专用硬件,以观察机器人的思考速度提升了多少。结果显示,速度有了显著提升。在标准高性能计算机上,新系统使机器人的思考速度提高了约 29%。在专门设计用于安装在机器人内部的小型计算机上,速度提升更为显著,达到了 42%。这意味着,此前需要花费零点几秒才能决定下一步动作的机器人,现在几乎可以瞬间做出决策,从而实现了更平滑、更流畅的运动。至关重要的是,这种速度的提升并没有以牺牲准确性为代价。机器人并没有开始出错或掉落物体;它们保持了与之前相同的高成功率,只是更高效地达成了决策。
rMuscle 的成功依赖于一种巧妙的内存管理方式,以确保机器人不会被它试图复用的数据本身所拖累。存储机器人产生过的每一个想法需要耗费过多的空间,因此该系统设计得非常有选择性。它保留一个包含最近最相关记忆的“滑动窗口”,并丢弃那些不太可能再次需要的旧记忆。当机器人需要调用当前不在活跃窗口内的记忆时,系统会在机器人物理移动手臂的过程中实时重建该记忆。这意味着机器人始终在工作,利用其移动的时间来为下一次停止思考并进行决策做准备。这种无缝集成确保了机器人永远不必等待其记忆跟上步伐。
这项工作的意义不仅在于让机器人变得更快,它还改变了我们在现实世界中部署机器人的方式。通过缩短机器人处理环境所需的时间,该系统使得交互更加灵敏。机器人可以更快地对人类步入其路径或零件从传送带上掉落做出反应,从而使其在与人协作时更加安全可靠。研究人员通过执行复杂组装任务的物理机器人证明了这一点,例如将家具组件装填到移动的传送带上,或使用两只手臂协同处理精细的瓶子。在每种情况下,该系统都在保持机器人成功率的同时,缩减了每个决策周期中关键的毫秒级时间。
这种方法代表了构建智能机器方式的一种转变。研究人员并没有致力于让机器人的底层大脑变得更强大或更复杂,而是专注于如何使用这个大脑。他们意识到,工厂工作所需的智能不在于每秒钟都要解决一个新的谜题,而在于如何高效地复用已知问题的解决方案。通过构建一个尊重工业作业重复性并利用任务相似性的系统,他们创造了一种让机器人能够实现以往难以企及的流畅度的途径。这项工作表明,高效机器人的未来不仅在于更好的硬件,还在于更聪明的信息流管理方式,让机器能够记住过去的成功,并以最小的代价将其应用于当下。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。