← 最新论文
💻 computer science

Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation

本文通过揭示从视觉语言模型(VLM)向视觉语言动作(VLA)适配过程中存在的结构化差异模式,挑战了 VLA 模型参数冗余是均匀分布的这一假设,并提出了一种新型的多模块联合剪枝策略,在无需进行剪枝后恢复的情况下,实现了显著的参数缩减(12%–30%)并保持了原性能的 90%。

原作者: Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位才华横溢、世界级的厨师(即视觉-语言模型,或 VLM),他能够描述食谱、识别食材,并能极其详细地谈论食物。现在,你想把这位厨师变成一个能在真实厨房里实际烹饪的机器人(即视觉-语言-动作模型,或 VLA)。

为了实现这一点,你取出了这位厨师的大脑,并为他添加了一些新的“肌肉”连接,以便他能拿起刀并搅拌锅里的东西。但问题在于,这位厨师的大脑非常庞大,充满了数百万个神经元。而机器人运行起来既慢又昂贵,而且占用的空间很大。你想把这个大脑精简下来,让它变得更快,但你又非常害怕切错了地方,导致机器人变成一堆无用的废铁。

旧方法:“切割并祈祷”

传统上,当工程师试图缩小这些机器人的大脑时,他们只会开始切除他们认为“多余”的部分。

  • 结果: 机器人会立即停止工作。它会忘记如何拿杯子或移动手臂。
  • 补救措施: 工程师们会说:“噢,这是预料之中的。”然后他们会花费数天或数周的时间重新教导机器人(微调),以让它恢复工作。
  • 论文的核心问题: 该论文的作者提出了这样一个疑问:“如果我们必须在切割之后重新教导机器人所有知识,那么我们移除的真的是‘多余’的东西吗?还是我们不小心切掉了它的手和眼睛?”

他们认为,依赖于“重新教导”掩盖了一个事实,即我们切掉的是至关重要的部分。如果一个部分真的是没用的,那么即使你在移除它之后,机器人也应该能正常工作,而不需要任何帮助。

新发现:“增长图谱”

作者观察了机器人在学习烹饪之前和之后的大脑。他们对比了“旧厨师大脑”(VLM)与“新机器人大脑”(VLA)。

他们发现,大脑的变化并不是随机的。它以非常特定、有组织的方式发生变化,就像一张地图,精确地展示了新的“肌肉”连接是在哪里生长的。

  • 有些部分变化很大: 这些是学习控制机器人手臂的部分。
  • 有些部分保持不变: 这些是仍然只需要识别西红柿或勺子的部分。
  • 有些部分变化得很奇怪: 在某些层中,变化巨大;而在另一些层中,变化却微乎其微。

他们意识到这个“变化图谱”(他们称之为 Δ\DeltaW)是一个秘密指南。它准确地告诉了你,哪些部分正在为机器人的运作提供核心动力,而哪些部分只是来自厨师旧生活的残留物。

实验:“受控手术”

为了证明他们的理论,他们对机器人的大脑进行了一场“受控手术”。他们没有靠猜,而是利用这个“变化图谱”来决定切除哪些部分。

  1. 错误的切割: 他们尝试切除那些变化不大的部分(认为它们是安全的残留物)。结果: 机器人立即崩溃了。它无法移动。
  2. 正确的切割: 他们尝试切除那些变化很大的部分(认为这些是新的、活跃的部分)。结果: 令人惊讶的是,机器人几乎完美地保持了正常运作!

类比: 想象一座房子。旧厨师住在这里,拥有一个装满书籍的图书馆(VLM)。当机器人搬进来时,它在地下室建造了一个新的健身房(VLA 适配)。

  • 旧方法是随机拆除墙壁。如果房子塌了,他们稍后再重建墙壁。
  • 新方法是查看新健身房的蓝图。他们意识到,健身房的新支撑梁就是那些发生变化的部分。他们发现,那些完全没有变化的旧图书馆书籍,实际上才是撑起屋顶的部分!通过切除那些冗余的(或保留那些至关重要的改变后的)健身房部分,他们可以在不导致房屋坍塌的情况下缩小房屋的规模。

结果:更小、更快、无需重新教导

利用这种“变化图谱”策略,他们成功地将两个著名的机器人大脑(OpenVLA 和 π\pi0.5)缩小了 12% 到 30%。

  • 神奇之处: 他们在没有任何重新教导或微调的情况下完成了这一切。机器人在切割后能立即工作。
  • 对比: 当他们尝试其他流行的切割方法(如“切掉最大的数字”或“切掉使用最多的数字”)时,机器人会完全失效,除非经过长时间的重新训练。
  • 效率: 他们节省了大量内存(使机器人能运行在更小、更便宜的计算机上),同时保留了约 90% 的原始性能。

核心启示

论文得出结论:我们不应该仅仅靠猜测来决定切除什么,或者依赖于事后修复错误。通过观察大脑在学习运动时如何变化,我们可以精准地找到“多余”的部分。这使得我们能够构建更小、更快、更高效的机器人,使其能在有限的资源下运行,而这一切仅仅是通过理解从厨师转变为机器人时所发生的特定“增长”来实现的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →