← 最新论文
💻 computer science

Hybrid Token Compression for Vision-Language Models

本文介绍了 HTC-VLM,一种混合视觉标记压缩框架,它通过将连续补丁特征与离散语义锚点相融合,有效地平衡了细粒度外观细节的保留与高层语义的提取,与现有的连续基准方法相比,实现了更优越的性能保持能力与效率。

原作者: Jusheng Zhang, Xiaoyang Guo, Tongyu Mo, Qinhan Lv, Wenhao Chai, Jian Wang, Keze Wang, Liang Lin

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Jusheng Zhang, Xiaoyang Guo, Tongyu Mo, Qinhan Lv, Wenhao Chai, Jian Wang, Keze Wang, Liang Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

视觉过载之困:为什么 AI 需要更好的总结方式

想象一下,你正在试图教一位聪明但非常饥饿的学生如何理解一张图片。在人工智能的世界里,这个学生被称为“视觉语言模型”(Vision-Language Model, VLM)。这是一种可以观察图像并回答相关问题(例如“狗狗穿着什么?”或“为什么天空是蓝色的?”)的计算机大脑。为了实现这一点,计算机将图像分解成数百个微小的方块,称为“补丁”(patches),并将每一个方块转化为一长串计算机可以读取的数字列表(即 token/标记)。

问题在于,计算机会被这些信息淹没。如果你喂给它 576 个这样的微小方块,大脑必须将每一个方块与所有其他方块进行比较才能理解整张图片。这会产生巨大的工作量,就像试图同时阅读一整个图书馆的书籍一样。这会减慢处理速度并消耗大量的计算机内存。科学家们一直试图通过将图像总结为仅一个或几个“总结标记”(summary tokens)来解决这个问题,但其中有一个陷阱:如果你只是将所有细节揉成一个平均数值,你就会丢失重要的故事线(比如“这是一只狗”);如果你试图通过挑选特定的“关键词”来保留故事,你又会丢失精细的细节(比如狗狗毛发的纹理)。这是一个令人沮丧的权衡:你要么掌握了大意却丢了细节,要么掌握了细节却忘了主旨。这篇论文提出了一个简单的问题:我们能否两者兼得?

混合英雄:HTC-VLM

由 Jusheng Zhang 及其团队领导的研究人员表示,答案是肯定的,但前提是我们必须停止试图用单一工具强迫计算机完成所有工作。他们引入了一种名为 HTC-VLM(用于视觉语言模型的混合标记压缩技术)的新方法。你可以把它想象成一种聪明的办法,可以在不丢失情节或角色细节的情况下,对复杂的故事进行总结。

以下是他们的“混合”技巧是如何运作的,我们使用一个简单的类比:

想象一下,你正在向一位只能听懂一句话的朋友描述公园里混乱的一幕:

  • 旧方法(连续压缩): 你试图把一切都挤进一句话里:“有很多东西在移动,带有各种颜色和形状。”你的朋友听到了噪音,但完全不知道实际发生了什么。他们知道现场很忙碌,但不知道到底是什么在忙碌。这就是当 AI 试图将图像压缩成一个平均数值时发生的情况;“高层含义”(如“这是一只狗”)会被“噪声”(如草地和天空)所冲淡。
  • 另一种旧方法(离散量化): 你试图变得精确,说:“狗。草。树。”你的朋友知道了主要角色,但他们完全不知道那只狗看起来是什么样的,是在奔跑还是在坐着,或者它的毛发是什么颜色的。他们错过了纹理和动作。
  • HTC-VLM 的方式(混合解决方案): 研究人员建议采用两步走的方法。首先,你给你的朋友四张特殊的“锚点”卡片,上面准确写着主要事物是什么(例如:“狗”、“草”、“树”)。这些就是离散标记。它们充当了骨架或地图。然后,你给他们一个单一的“总结”标记,这个标记承载了所有杂乱、细粒度的细节(如毛发的纹理、草丛中的风、狗狗的姿态)。

神奇之处在于,计算机被训练去利用这些“锚点卡片”来引导它如何阅读“总结标记”。锚点告诉计算机:“嘿,在这里找一只狗!”这样总结标记就不会被其他细节所干扰。通过这种方式,AI 在最后时刻之前,将宏观图景(语义)和微观细节(外观)保持分离,最后再将它们完美地融合在一起。

他们的发现

该团队在七个不同的挑战性测试上测试了这个想法,范围从回答关于图像的问题到理解科学图表。他们将这种新方法与现有的最佳图像压缩方法进行了对比。

  • 结果: 当他们将整个图像压缩到仅剩一个单一标记(极致压缩)时,这种混合方法保留了原性能的 87.2%。而之前的最佳方法(仅使用“平均值”法)仅保留了 81.0%。虽然这听起来差距不大,但在 AI 领域,当你丢弃了几乎所有数据时,还能保留多出的 6% 智能,这意义重大。
  • 为什么有效: 研究人员分析了计算机的“注意力”是如何运作的。他们发现,单个总结标记会先积极地寻找那四个“锚点”卡片。它利用这些锚点作为指南来理解图像的其余部分。这证明了锚点在保持含义完整方面起到了核心作用。
  • 权衡: 该方法确实需要花费一点额外的精力来生成那四个锚点卡片,但研究人员表明,由于不再需要处理数百个标记,节省下来的处理时间是非常巨大的,因此整体速度仍然极快。这就像是花 5 秒钟写一个出色的提纲,从而节省了写一篇糟糕论文所需的 5 个小时。

它不是什么

需要注意的是,这篇论文并没有声称什么。研究人员明确反对仅仅通过“平均化”一切来期望在极端压缩下表现良好的观点。他们表明,试图强迫一个单一的连续数值同时承载“故事”和“细节”会导致故事的崩溃。他们还表明,仅仅挑选图像的随机部分或使用旧的“剪枝”(pruning)方法(即切掉部分内容)在只剩下一两个标记时效果并不理想。

论文指出,这种混合方法是针对特定极端压缩问题的稳健解决方案,但它并不声称解决了 AI 的所有问题。例如,他们提到,虽然它在处理单张图像时表现出色,但在处理更长的视频或复杂的多图对话时,可能需要进行调整。

核心结论

简而言之,HTC-VLM 表明,为了让 AI 既聪明又快速,我们不应该只是尝试将图像缩小为一个微小的点。相反,我们应该给 AI 一张地图(离散锚点)和一份简报(连续细节),并让它们协同工作。通过将“是什么”与“如何是”分开,计算机可以用仅有的一个标记来理解图片,既保持了含义清晰,又保持了细节锐利,而不会迷失在噪声中。这提醒我们,有时为了节省空间,你不需要扔掉东西;你只需要更好地组织它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →