← 最新论文
💻 computer science

Mamba-based Selective State Space Modeling Improves the Accuracy-Complexity Tradeoff of SmolVLA Vision-Language-Action Experts

本文证明了将基于 Mamba 的选择性状态空间模型集成到 SmolVLA 动作专家中,能显著改善视觉-语言-动作模型的精度-复杂度权衡,在每动作重规划下,通过在长程执行过程中实现优于 Transformer 基准模型的成功率,同时将参数复杂度降低了 24%。

原作者: Farida Mohsen, Thowayba Elkaffash, Mohammad Reza Chalak Qazani, Mohamed Mabrok, Nader Meskin, Ali Safa

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Farida Mohsen, Thowayba Elkaffash, Mohammad Reza Chalak Qazani, Mohamed Mabrok, Nader Meskin, Ali Safa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

机器人正在学习如何理解世界,不仅是通过视觉,还通过阅读指令并移动手臂来完成工作。这一被称为“视觉-语言-动作”(vision-language-action)的领域,依赖于强大的计算机大脑,它能够接收场景图像和描述任务的句子,然后计算出如何精确移动机械臂以完成任务。工程师面临的挑战是在速度与智能之间取得平衡。如果机器人在每一个微小动作前思考过多,它的动作会变得极其缓慢,从而失去实用价值。但如果为了节省时间而一次性规划一段长序列动作,它又面临出错的风险,因为在执行这些预设步骤时,世界可能会发生变化。目标是找到一种方法,让机器人既快速又准确,而这种平衡一直难以达成。

一组研究人员发现了一种新方法,能够在不牺牲准确性的情况下,使平衡向速度倾斜。他们测试了一种最初为处理语言而设计的全新计算机架构,并将其植入机器人的大脑中。通过将标准的思维引擎更换为这种新设计,他们发现机器人可以规划更长的动作序列且依然能取得成功。在测试中,当机器人被允许在再次观察环境前执行完整的五十个动作序列时,新设计的成功率比旧设计高出近百分之八。这一进步意义重大,因为这意味着机器人可以在现实世界中运行得更快,减少因思考而产生的停顿,同时仍能正确完成任务。

研究人员从一个名为 SmolVLA 的流行机器人大脑开始,该系统已因其高效和准确而闻名。该系统通过观察摄像机画面和文本指令,然后预测未来动作的一个“块”(chunk)。它不是只决定一个动作,而是预测一系列动作,就像一段关于机械臂下一步该如何行动的短片。机器人随后执行该系列中的前几个动作,停下来,再次观察世界,然后规划新的系列。机器人停止前执行的动作数量被称为“执行时界”(execution horizon)。如果它每做一个动作就停下来,它会非常准确但非常缓慢;如果它在不停止的情况下运行整个序列,它会很快,但在环境变化时容易出错。

为了解决这个问题,团队更换了处理这些动作序列时序的部分。原始系统使用一种称为“自注意力机制”(self-attention)的标准方法,这就像一个聚光灯,让动作计划的每个部分都能回顾其他部分以保持协调。研究人员将其替换为一种称为 Mamba 的不同方法,这种方法处理信息的方式更像是一种持续的更新流,而不是聚光灯。这种新方法对计算机资源的消耗更轻,所需的学习参数减少了约百分之二十四,但它处理时间流的方式有所不同。

团队在充满四十种不同任务(从堆叠积木到将物体移动到特定目标)的模拟环境中对两个版本的机器人大脑进行了测试。他们让机器人在三种不同条件下执行任务:在每一个动作后停止、在二十五个动作后停止,以及在完整的五十个动作后停止。当机器人要求在每个动作后都停止时,两个版本表现得几乎完全一样,新设计达到了与旧设计相同的成功率。然而,随着机器人被要求在不停止的情况下运行更长的序列,差异变得明显了。采用新 Mamba 设计的机器人表现得更加稳健。当要求在进行五十个动作前进行检查时,新设计的试验成功率为百分之六十一点八,而旧设计仅为百分之五十三点九。

这种差距在特定类型的任务中变得更加显著。当机器人需要将物体移动到精确位置时,在新时界下,新设计的成功率提高了近百分之十八。即使在涉及空间排列的任务中,它也提高了百分之十。研究人员发现,新设计特别擅长让序列中的后期动作与前期动作保持协调,即使机器人在执行一个不再根据新鲜视觉信息进行更新的计划时也是如此。这表明,新架构在预测动作序列随时间如何展开方面具有天然优势。

这项研究证实,机器人如何规划其动作,与其检查环境的频率同样重要。通过改变协调动作序列的内部引擎,研究人员展示了可以让机器人变得更快、更高效,而不会变得笨拙。新设计不仅提高了长序列的成功率,还减少了运行系统所需的总计算参数。这意味着在未来,机器人可以部署在需要快速连续行动的现实环境中,依靠能够长时间保持准确的长程计划进行作业。这项工作表明,正确的架构选择可以解锁速度与精度之间更好的权衡,使快速、可靠的机器人助手之梦离现实又近了一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →