QuantWAMs: Calibrating at the Right Granularity for World Action Models
QuantWAMs 是一个后训练量化框架,它通过三种新颖策略将量化决策与世界动作模型(World Action Models)的特定校准上下文相对齐,从而实现高效的 W4A4 部署,并在模拟基准测试和真实机器人操控任务中均保持极低的性能下降。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何做饭或搭建积木塔。为了做到这一点,机器人不仅仅是看一张图片然后进行猜测;它使用的是一个“世界动作模型”(World Action Model)。把这个模型想象成一个超级聪明、充满未来感的电影导演。它观察当前的场景,预测接下来会发生什么,并同时决定机器人的手臂应该如何运动以实现那个未来。这是一个闭环:机器人移动,世界随之改变,机器人看到变化,然后决定下一步动作。这非常强大,但同时也像是在一台微小的、电池供电的计算器上运行一部大片。预测未来和移动手臂所需的数学运算量如此巨大,以至于通常需要庞大且昂贵的计算机。
为了让这些机器人走进我们的家庭和工厂,科学家们希望将这些巨大的计算机大脑缩小到可以装进更小的芯片中。他们使用一种叫做“量化”(quantization)的技术来实现这一点,这就像是将一部高清电影压缩成较小的文件格式。你用极小的画质损失换取了巨大的速度和存储增益。然而,传统的压缩方法是为静态图像或简单的文本设计的,而不是为那个不断移动并对世界做出反应的机器人设计的。如果你用旧的规则去压缩机器人的大脑,它可能会开始产生幻觉、忘记如何握住杯子,或者撞上墙壁,因为这种“压缩”破坏了其决策循环中微妙的平衡。
这就是新的论文 QuantWAMs 所要解决的问题。研究人员意识到,要缩小机器人的大脑而不使其损坏,你不能只使用一种“一刀切”的压缩工具。你必须根据机器人世界的特定“氛围”来校准压缩。他们发现标准的方法犯了三个大错误:它们孤立地看待机器人的大脑(忽略了动作如何改变世界),它们将大脑的所有部分视为同等对待(忽略了视频部分和动作部分的不同),以及它们使用了错误的类型数据来决定哪些部分需要缩小。
团队提出了一种名为 QuantWAMs 的新方法,通过将机器人的大脑视为一个复杂的管弦乐队,而非单一的乐器来修复这些错误。以下是他们的做法:
首先,他们意识到机器人的大脑中有些部分是“坐标兼容”的,这意味着它们说着相同的语言并可以共享信息,而有些部分则完全不同。想象一个合唱团,女高音和男高音可以共享一份乐谱,但鼓手需要自己的乐谱。旧的方法试图给每个人都发同样的乐谱,从而导致混乱。QuantWAMs 通过仔细分组仅那些兼容的部分来共享它们的“离群值”数据(即那些难以压缩的、响亮的怪异音符),确保压缩不会扭曲每个声部独特的嗓音。
其次,他们改变了决定哪些部分的大脑保持高质量、哪些部分可以被压缩的方式。他们不再分别评估视频部分和动作部分,而是观察它们如何协同工作。这就像评判一对舞伴:你不仅要单独评价舞者的脚步和搭档的托举,还要评价他们如何同步移动。通过分析“联合”梯度(视频与动作的结合努力),他们能够精准定位大脑中哪些层对于机器人的成功最为关键,并保护这些层具有更高的精度,同时安全地压缩其余部分。
第三,也是最重要的一点,他们停止了在“虚假”世界中测试压缩后的大脑。标准方法是在静态图像集上测试机器人,就像在封闭赛道上的驾驶测试。但现实中的机器人始终是在颠簸的道路上行驶,每一次转弯都会改变下一个画面。作者创建了一个“固定干预审计”(fixed-intervention audit)。他们提取了机器人真实的、全精度的动作,暂停动作,然后问道:“如果我们在此刻使用压缩后的大脑,机器人能否恢复正常?”这使得他们能够动态地调整保护计划,确保即使在世界变得混乱时,机器人也能保持安全。
这项新方法的成果令人印象深刻,尽管作者谨慎地指出这些结果是基于模拟和特定的现实世界试验。当他们在两个不同的机器人模型(Fast-WAM 和 LingBot-VA)上使用非常激进的压缩设置(W4A4,意味着权重和激活均为 4 位精度)进行测试时,机器人的性能几乎没有下降。在 RoboTwin 2.0 的任务中,压缩后的机器人成功率为 91.7%,而原始版本的成功率为 91.9%,差距仅为 0.2 到 0.7 个百分点。
更重要的是,这种压缩带来了巨大的收益。机器人视频块和动作块所需的内存降至原始版本的约 29%。这使机器人做出决策的速度提高了 1.4 到 1.6 倍。他们甚至使用 AgiBot G2 机器人将压缩后的机器人带到现实世界,执行捡苹果、堆叠积木和折叠毛巾等任务。在这些现实世界试验中,压缩后的机器人成功完成了 30 次尝试中的 17 次,而全精度版本为 30 次中的 19 次,证明了压缩后的大脑确实可以在物理环境中运行。
论文表明,通过尊重机器人学习独特的闭环性质——即动作改变世界,而世界改变下一个动作——我们终于可以使这些强大的 AI 模型变得足够小,以便运行在未来出现在我们日常生活中的机器人上。这并不是一个能瞬间解决一切的灵丹妙药,但它是让机器人大脑既聪明又精巧迈出的关键一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。