← 最新论文
🤖 machine learning

Clustering and Token Denoising for Faster and More Robust VLMs

该论文介绍了 ClustRS,这是一种结合了注意力加权聚类与残差收缩去噪的免训练算法,它在显著减少高达 97% 的视觉标记的同时,增强了对图像噪声的鲁棒性,并保持或提升了在 ScienceQA-IMG 和 MM-VET 等 VLM 基准测试上的性能。

原作者: Baptiste Rossigneux, Inna Kucher, Vincent Lorrain, Emmanuel Casseau

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Baptiste Rossigneux, Inna Kucher, Vincent Lorrain, Emmanuel Casseau

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一台能够看到照片,然后根据所见内容回答问题、描述场景或解决谜题的计算机。这就是现代视觉语言模型的承诺——一种结合了理解图像能力与生成类人文本能力的人工智能。为了让这些系统发挥作用,它们必须首先将图像转化为一长串数字构建块,称为“标记”(tokens),随后计算机的大脑会对这些标记进行处理以得出答案。图像越详细,这个列表就变得越长。虽然这带来了极高的准确性,但也造成了一个巨大的瓶颈:处理数百个此类标记需要巨大的计算能力,使得在智能手机或无人机等较小型设备上运行这些智能系统变得十分困难。长期以来,研究人员一直试图寻找减少这种列表的方法,即在保留重要部分的同时剔除不必要的成分,但现有方法在面对不完美或带有噪声的图像(这也是大多数现实世界照片的真实样貌)时往往表现挣扎。

一个研究小组开发出一种全新的轻量化方法来解决这一问题,且无需从头开始重新训练复杂的 AI 模型。他们的方法被称为 ClustRS,其作用就像是一个高效的图像标记列表编辑器。该系统并非仅仅挑选图像中最显眼的部分,也不是试图保留尽可能多样化的部分,而是首先将相似的信息块组合在一起。接着,它会从每个组中仅选出一个具有代表性的成员,从而确保最终的列表涵盖了图像中的不同概念而不会产生重复。至关重要的是,这种分组过程旨在忽略经常困扰现实世界照片的视觉“静电”或噪声(例如颗粒感或模糊),从而防止系统被损坏的数据所误导。

在选出最佳代表之后,该方法会应用第二个精炼步骤。它提取选定的标记,并利用其所在组的平均特征来修正其中的噪声,从而对噪声进行温和的平滑处理。这个过程是完全自动化的,且不需要额外的训练,这意味着它可以立即应用于现有的模型。研究人员在衡量这些模型图像推理能力的标准基准测试中测试了这一技术,包括需要描述复杂场景或回答科学问题的任务。他们发现,该方法显著优于以往的技术,尤其是在图像受到严重噪声干扰,或者允许使用的标记数量被大幅削减的情况下。在最极端的测试中,当系统被迫仅使用 16 个标记而非通常的数百个时,他们的方法在保持高准确度的同时,其他方法却宣告失败,这证明了更聪明地选择和清洗信息比单纯拥有更多数据更有价值。

这一方法的成功凸显了我们构建高效人工智能方式的一种转变。研究人员并没有试图通过扩大模型规模或增加复杂度来应对困难条件,而是展示了通过“分组”与“清洗”这两个简单的步骤,可以使现有系统变得更加稳健。他们的研究结果表明,为了让这些模型在现实世界中真正发挥作用(在现实世界中,图像很少是完美的,且计算能力往往有限),关注点应当放在所处理信息的质量和韧性上,而不仅仅是数量上。通过证明这些改进可以在无需承担沉重重训成本的情况下实现,这项工作为在更广泛的日常设备上部署强大的视觉智能打开了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →