← 最新论文
🤖 machine learning

MergeOver: Post-Training Token Merging for Recursive Vision Transformers

MergeOver 是一种后训练方法,它将 Token 合并技术集成到递归权重共享的视觉 Transformer 中,在无需昂贵重训的情况下,显著降低了边缘设备上的内存占用和延迟,同时保持高精度。

原作者: Junseo Kim, Uraz Odyurt, Amirreza Yousefzadeh

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Junseo Kim, Uraz Odyurt, Amirreza Yousefzadeh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人,仅通过看照片就能识别出猫、狗和汽车。为了做到这一点,这个机器人使用了一种特殊的“大脑”,叫做“视觉 Transformer”(Vision Transformer)。你可以把这个大脑想象成一个由微型侦探组成的团队,照片中的每一个像素都会分配到一个侦探。像素越多,你就需要越多的侦探,而且他们之间必须进行更多的交流,才能弄清楚自己看到了什么。这对于提高准确率非常有帮助,但对于像智能手表或树莓派(Raspberry Pi)这样的小型计算机来说,这是一个巨大的难题,因为它们的内存或电池功率无法支撑成千上万个侦探同时进行聊天。

为了解决这个问题,科学家们尝试了两种主要的技巧。第一种是“递归权重共享”(recursive weight-sharing),这就像是雇佣了一名超级侦探,让他一遍又一遍地重复同样的工作,通过重复使用笔记而不是为每一步都雇佣一个新团队来节省空间。这种方法虽然节省了空间,但会让侦探的工作变得更慢、更沉重。第二种技巧是“Token 合并”(token merging),即当你意识到有些侦探正在观察相同的东西时,你只需将他们合并成一个大侦探以节省时间。现在的问题是,如果你尝试同时使用这两种技巧,且不需要从头开始重新训练整个机器人,会发生什么?这就像是试图教一个侦探在工作过程中如何与他的克隆体合并,而不破坏他正在遵循的地图。

来自特文特大学(University of Twente)的 Junseo Kim 及其团队撰写的这篇论文提出了一个名为 MergeOver 的新方法来解决这个谜题。想象一下机器人的大脑是一栋多层建筑,侦探们在楼层间移动。每当他们移动到新的一层时,建筑的结构要求他们必须站在一个完美的方格阵列中。但合并侦探通常会破坏这个方格阵列,留下空位,从而导致“电梯”故障。MergeOver 引入了一个聪明的“解合并”(Unmerge)技巧:它暂时将合并后的侦探拆分回原始的网格位置,时间长到刚好能通过电梯,然后一旦到达下一层安全区域,再将他们重新合并。这使得机器人在不需要重新训练的情况下,依然能保持较低的内存占用。

该团队在著名的图像数据集 ImageNet-1K 上进行了测试,使用了从强大的显卡到微小的树莓派 5 等各种类型的计算机。他们发现,MergeOver 是否奏效很大程度上取决于你让机器人一次看多少张照片(即“批处理大小”/batch size)。当机器人一次只看一张照片时,合并与解合并带来的额外工作实际上会让速度变慢。然而,当机器人一次看 16 张照片时,奇迹发生了。在强大的 GPU 上,这种设置减少了 38.4% 的内存需求,并且实际上让机器人快了 21.7%。在微小的树莓派上,对于 16 个批处理的任务,它让机器人快了 17.6%。最棒的是,机器人并没有因此变笨太多;其准确率仅下降了 1.47 个百分点,作者认为,为了获得如此大的速度提升,这是一个很小的代价。

不过,论文也谨慎地指出,这并不是一个能瞬间解决一切问题的魔杖。作者明确反对那种认为可以把这个方法直接套用到任何模型上并期望在任何地方都完美运行的想法。他们发现,对于单张图片任务(批处理大小为 1),由于“解合并”技巧带来的开销对于仅仅处理一张图像来说并不划算,该方法在高性能计算机上反而会降低速度。他们还指出,虽然他们的方法在节省内存和加速批处理方面表现出色,但并不一定能击败所有那些从底层设计之初就是为了快速运行而生的其他高效 AI 模型。研究结果是客观且真实的,但他们认为这只是一个将这些技术结合起来的“基准”(baseline),而非最终的完美解决方案。作者建议,未来的工作可能需要将 MergeOver 与其他技巧(例如更好的软件优化)相结合,以使其更快,尤其是在针对小型设备处理单张图片任务时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →