✨ 要点🔬 技术摘要
想象一台能够看到照片,然后根据所见内容回答问题、描述场景或解决谜题的计算机。这就是现代视觉语言模型的承诺——一种结合了理解图像能力与生成类人文本能力的人工智能。为了让这些系统发挥作用,它们必须首先将图像转化为一长串数字构建块,称为“标记”(tokens),随后计算机的大脑会对这些标记进行处理以得出答案。图像越详细,这个列表就变得越长。虽然这带来了极高的准确性,但也造成了一个巨大的瓶颈:处理数百个此类标记需要巨大的计算能力,使得在智能手机或无人机等较小型设备上运行这些智能系统变得十分困难。长期以来,研究人员一直试图寻找减少这种列表的方法,即在保留重要部分的同时剔除不必要的成分,但现有方法在面对不完美或带有噪声的图像(这也是大多数现实世界照片的真实样貌)时往往表现挣扎。
一个研究小组开发出一种全新的轻量化方法来解决这一问题,且无需从头开始重新训练复杂的 AI 模型。他们的方法被称为 ClustRS,其作用就像是一个高效的图像标记列表编辑器。该系统并非仅仅挑选图像中最显眼的部分,也不是试图保留尽可能多样化的部分,而是首先将相似的信息块组合在一起。接着,它会从每个组中仅选出一个具有代表性的成员,从而确保最终的列表涵盖了图像中的不同概念而不会产生重复。至关重要的是,这种分组过程旨在忽略经常困扰现实世界照片的视觉“静电”或噪声(例如颗粒感或模糊),从而防止系统被损坏的数据所误导。
在选出最佳代表之后,该方法会应用第二个精炼步骤。它提取选定的标记,并利用其所在组的平均特征来修正其中的噪声,从而对噪声进行温和的平滑处理。这个过程是完全自动化的,且不需要额外的训练,这意味着它可以立即应用于现有的模型。研究人员在衡量这些模型图像推理能力的标准基准测试中测试了这一技术,包括需要描述复杂场景或回答科学问题的任务。他们发现,该方法显著优于以往的技术,尤其是在图像受到严重噪声干扰,或者允许使用的标记数量被大幅削减的情况下。在最极端的测试中,当系统被迫仅使用 16 个标记而非通常的数百个时,他们的方法在保持高准确度的同时,其他方法却宣告失败,这证明了更聪明地选择和清洗信息比单纯拥有更多数据更有价值。
这一方法的成功凸显了我们构建高效人工智能方式的一种转变。研究人员并没有试图通过扩大模型规模或增加复杂度来应对困难条件,而是展示了通过“分组”与“清洗”这两个简单的步骤,可以使现有系统变得更加稳健。他们的研究结果表明,为了让这些模型在现实世界中真正发挥作用(在现实世界中,图像很少是完美的,且计算能力往往有限),关注点应当放在所处理信息的质量和韧性上,而不仅仅是数量上。通过证明这些改进可以在无需承担沉重重训成本的情况下实现,这项工作为在更广泛的日常设备上部署强大的视觉智能打开了大门。
技术摘要:用于更快速、更鲁棒的视觉语言模型(VLM)的聚类与 Token 去噪技术
问题陈述
最近的视觉语言模型(VLM),如 LLaVA,通过将预训练视觉编码器与大语言模型(LLM)集成,取得了令人瞩目的成果。然而,存在一个显著的瓶颈:视觉编码器通常会生成大量的视觉 Token(例如 576 或 729 个),这给 LLM 的自注意力机制带来了二次方计算负担。这阻碍了其在边缘设备上的高效部署。
虽然目前已存在 Token 修剪技术来缓解这一问题,但它们面临两个主要局限性:
基于训练的方法: 需要高昂的重训练成本和专门的架构修改。
无需训练的方法: 虽然轻量化,但在现实世界的图像噪声(如高斯噪声、椒盐噪声)下的性能表现尚未得到充分探索。现有的无需训练的选择器通常仅依赖注意力分数(导致冗余且在噪声下表现脆弱)或仅依赖多样性(忽略了 Token 的显著性)。
作者提出了两个关键问题:噪声在多大程度上削弱了当前的无需训练修剪方法?能否在无需重训练的情况下,设计出一种轻量级且具备噪声抗性的选择器?
方法论:ClustRS
本文引入了 ClustRS ,这是一种由两部分组成的、无需训练的算法,旨在实现鲁棒的 Token 修剪。它由用于选择的 聚类 + Huber 距离 (C + H) 以及用于去噪的 鲁棒残差收缩 (RRS) 组成。
1. 聚类 + Huber 距离 (C + H)
该组件旨在解决 Token 显著性与多样性之间的权衡,同时确保对噪声引起的离群值的鲁棒性。
投影后聚类: 与对原始 CLIP 特征进行聚类的方法不同,ClustRS 在视觉-语言投影层之后 对 Token 进行聚类。这确保了聚类发生在 LLM 的语义嵌入空间中,反映了模型自身对概念关系的理解。
注意力加权目标: 聚类目标最小化了一个注意力加权的簇内失真。具有更高注意力分数的 Token 对其簇质心的拉力更强,从而确保显著区域被优先考虑。
K-means++ 初始化: 该算法使用一种注意力感知的 K-means++ 策略来初始化质心,根据距离和注意力分数将质心分布在特征空间中。
Huber 距离: 为了对抗标准平方误差距离对噪声诱导的离群值的高度敏感性,本文使用 Huber 距离 替换了欧几里得距离。该损失函数在残差较小时表现为二次方形式(保持紧凑的簇形成),而在残差较大时表现为线性形式(防止离群值偏离质心)。
2. 鲁棒残差收缩 (RRS)
仅靠选择并不能消除剩余 Token 中的噪声。RRS 是针对所选 Token 的一步式去噪步骤。
残差分析: 对于属于某个簇 c j c_j c j 的每个选定 Token v i v_i v i ,将其视为质心与残差之和 (r i = v i − c j r_i = v_i - c_j r i = v i − c j )。残差被认为包含了大部分的噪声方差。
自适应收缩: 受 James-Stein 估计量的启发,RRS 将 Token 向量向其簇质心收缩。收缩因子 α i \alpha_i α i 是自适应的,由簇的鲁棒尺度(中位数残差范数)与 Token 特定的残差范数之比决定。
保留语义: 更新规则 v ~ i = α i v i + ( 1 − α i ) c j \tilde{v}_i = \alpha_i v_i + (1 - \alpha_i) c_j v ~ i = α i v i + ( 1 − α i ) c j 是一个凸组合,它在减少方差的同时不进行重新归一化,从而保留了 LLM 所预期的方向统计特性。
针对 SigLIP 的适配: 对于基于 SigLIP 的模型(如 LLaVA-OneVision),作者引入了一个 范数感知显著性项 。由于 SigLIP 的注意力图比 CLIP 更平坦,作者通过结合特征向量的模长(在 SigLIP 中编码了显著性)来增强注意力分数,从而恢复动态排名信号。
核心贡献
新型鲁棒聚类 (C + H): 一种无需训练、注意力加权的聚类程序,利用 Huber 距离来选择既多样又显著的 Token 代表,使其对噪声引起的离群值具有抗性。
鲁棒残差收缩 (RRS): 一种轻量级的单次增强技术,可在特征空间中选择性地抑制选定 Token 的噪声成分,从而保留语义方向并避免分布偏移。
全面的评估: 证明了 ClustRS 在各种高斯噪声和椒盐噪声干扰下,在 MM-VET 和 ScienceQA-IMG 基准测试上均能获得一致的提升,在极端压缩(k = 16 k=16 k = 16 个 Token)和高噪声条件下优于现有的无需训练方法(如 FasterVLM、DivPrune、VisionZip)。
部署就绪: 整个流程无需训练,且兼容现有的推理优化(如 KV-cache、Flash-Attention),使其能够立即部署。它也能以极小的修改适配更新的 SigLIP 后端。
实验结果
实验在 LLaVA-1.5-7B (基于 CLIP)和 LLaVA-OneVision (基于 SigLIP)上进行,使用了 MM-VET (开放式推理)和 ScienceQA-IMG (多选题)基准测试。
极端压缩 (k = 16 k=16 k = 16 ): 在极端噪声条件下,ClustRS 比基准方法高出多达 20%。在干净的 MM-VET 图像上,其得分位 0.271,超过了 FasterVLM (0.211) 和 DivPrune (0.232)。在严重高斯噪声 (σ = 3.0 \sigma=3.0 σ = 3.0 ) 下,它仍能保持 0.140 的得分,优于所有基准方法。
噪声抗性: 在不同噪声密度(高斯噪声和椒盐噪声)下,ClustRS 始终保持最高分,尤其是在冗余度极低的低 Token 数量情况下。
SigLIP 适配: 在 LLaVA-OneVision 上,通过范数感知适配,ClustRS 仅用 16 个 Token 就实现了 0.272 的干净准确率,大幅超越了 FasterVLM (0.138) 和 DivPrune (0.164)。
计算开销: 该方法增加的计算成本微乎其微(在 A100 GPU 上对于 k = 16 k=16 k = 16 的开销约为 1ms),这仅占典型响应端到端生成时间的 1.6% 以下。
意义与主张
本文声称 ClustRS 提供了一种简单而强大的替代方案 ,可以取代现有的仅依赖分数或多样性的修剪规则。通过结合鲁棒聚类与残差收缩,该方法解决了计算效率与噪声抗性之间的关键差距。
作者强调,其方法:
无需重训练 ,使其能够适应架构变化。
提高了鲁棒性 ,能够应对多种破坏(加性噪声和脉冲噪声),且不会牺牲在干净数据上的性能。
支持边缘部署 ,通过大幅减少 Token 数量(高达 97% 的缩减)同时保持甚至提高准确率。
研究结论指出,虽然像 C+H 这样的 Token 选择方法提供了鲁棒的表示,但未来仍有改进去噪策略的空间,特别是处理那些可能被特征空间聚类丢弃的、在空间上独立但语义上相似的 Token。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。