{\Omega}-QVLA: Robust Quantization for Vision-Language-Action Models via Composite Rotation and Per-step Scaling
本文介绍了-QVLA,这是一种无需训练的量化后处理框架,它通过结合复合 SVD-Hadamard 旋转与每步 DiT 激活缩放,实现了整个视觉 - 语言 - 动作模型的鲁棒 W4A4 均匀量化,在基准测试和真实世界操作任务中均取得了最先进的任务成功率并显著降低了内存占用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一个价值数十亿美元的卓越机器人“大脑”。这个大脑是一个“视觉 - 语言 - 动作”(VLA)模型。它能通过摄像头观察世界,理解复杂的口头指令,并精确计算出如何移动其机械臂以完成任务。
问题在于?这个大脑过于庞大。这就像试图在一台微小的、电池供电的掌上游戏机上运行一家大型高端电影院。它占用内存过多,且在真实机器人上运行速度太慢。
为了解决这个问题,科学家们通常尝试通过压缩其数值来“缩小”大脑(这一过程称为量化)。这就像将一部高清 4K 电影转换为低分辨率的 MP4 以节省空间。
核心难题:
此前尝试缩小这些机器人大脑的方法存在一个重大缺陷。它们会压缩“思考”部分(语言模型),却将“动作”部分(动作头)保留在完整的高质量分辨率下。为什么?因为所有人都认为“动作”部分过于脆弱。他们认为,如果过度压缩,机器人就会开始颤抖、抽搐或掉落物品,因为数值变得过于“模糊”。
解决方案:Ω-QVLA
本文介绍了一种名为Ω-QVLA的新方法。它是首个成功将机器人大脑的“思考”和“动作”部分同时缩小到相同微小尺寸(称为 W4A4)的工具,且机器人不会因此崩溃。
以下是他们通过两个创新技巧实现这一目标的方式:
1. “旋转洗牌”(复合旋转)
想象你有一副扑克牌,其中几张牌异常沉重(异常值),而其余牌都很轻。如果你试图将它们塞进一个小盒子里,沉重的牌会压垮其他牌,导致盒子破裂。
在机器人大脑中,某些数据通道是“沉重”的(它们拥有巨大的数值),而其他通道则是“轻盈”的。
- 旧方法: 只是将它们强行挤压在一起。沉重的牌压垮了盒子。
- Ω-QVLA 方法: 它们使用了一种特殊的“洗牌”(一种结合了 SVD 和哈达玛旋转的数学混合)。想象旋转这副牌并重新洗牌,使得沉重牌的重量均匀分布在整个牌组中。现在,没有任何单张牌重到足以压垮盒子。这使得它们能够更激进地压缩数据,而不会丢失信息的“形状”。
2. “逐步音量控制”(逐步缩放)
机器人的“动作”部分的工作原理类似于视频编辑软件逐帧平滑视频(这一过程称为去噪)。
- 问题: 数据的“音量”(或强度)从第一帧到最后一帧剧烈变化。如果你为整段视频设置一个固定的音量级别,开头可能太安静,而结尾可能太吵且失真。
- Ω-QVLA 方法: 它们创建了一种“动态音量控制”,针对视频中的每一个步骤调整灵敏度。系统不使用单一的静态设置,而是监听每个特定时刻的数据,并相应地调整压缩比例。这防止了机器人在移动过程中因数据过强或过弱而感到困惑。
结果
该团队在两个著名的机器人大脑(Pi 0.5 和 GR00T N1.5)上测试了这种方法,使用了名为 LIBERO 的模拟环境以及真实的机械臂。
- 在模拟中: 压缩后的机器人表现与巨大的未压缩机器人一样出色。事实上,在一次测试中,微小的压缩机器人实际上比原版表现得更好!
- 在现实世界中: 当他们把压缩后的机器人放到真实的桌子上去拿杯子、折叠毛巾和移动积木时,它移动得平稳且精准。
- 竞争对比: 其他尝试做到这一点的(QuantVLA)方法导致机器人抽搐并失败。而 Ω-QVLA 保持了它们的流畅性。
- 节省空间: 它们将所需的内存减少了71%。这就像将一部 4GB 的电影文件转换为 1GB 的文件,同时没有丢失剧情。
结论
本文证明,机器人大脑的“动作”部分并非脆弱到无法被压缩。通过使用智能的“洗牌”来分散沉重数据,并利用“逐步”调整来处理变化的音量,他们可以将这些庞大的机器人大脑缩小到适合真实机器人的尺寸,使其更快、更便宜,并准备好投入现实世界的应用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。