← 最新论文
🤖 machine learning

How Much Information Can a Vision Token Hold? A Scaling Law for Recognition Limits in VLMs

本文通过识别在视觉密度增加时从稳定到崩溃的三阶段转变,并制定一个通用的缩放法则以指导上下文压缩效率与准确性的优化,研究了视觉语言模型中视觉标记的信息容量极限。

原作者: Shuxin Zhuang, Zi Liang, Runsheng Yu, Hongzong Li, Rong Feng, Shiqin Tang, Youzhi Zhang

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuxin Zhuang, Zi Liang, Runsheng Yu, Hongzong Li, Rong Feng, Shiqin Tang, Youzhi Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是该论文的通俗易懂版解释,使用了日常类比。

核心问题:单个“视觉标记(Vision Token)”能承载多少信息?

想象一下,你正试图给朋友寄一封很长的信,但你只能使用极少量的明信片来完成。你必须把整封信的内容都挤进这几张明信片里。

在人工智能领域,**视觉语言模型(VLMs)**的工作原理与之类似。它们观察一张图像(例如扫描的文本页面),并将其转化为一系列数字“标记”(即微小的数字数据包),以便 AI 大脑进行读取。

这篇论文提出了一个根本性的问题:我们将信息压缩进单个视觉标记中的容量是否存在极限? 如果我们尝试在图像中放入过多的文本,并强迫 AI 将其压缩到过少的标记中,会发生什么?

实验过程:“压力测试”

研究人员并非仅仅靠猜测,而是进行了一场压力测试。他们创建了充满纯文本(如小说、法律条文或信件)的图像,并逐渐增加每张图像中的文本量。他们保持 AI 被允许使用的“明信片”(视觉标记)数量固定不变,然后观察随着文本变得更长、更密集时会发生什么。

三个失败阶段

研究人员发现,AI 的性能并不是随着文本变长而缓慢下降,而是经历了三个截然不同的“阶段”,就像灯泡在烧毁前会闪烁一样:

  1. 稳定阶段(“简单模式”):

    • 现象: AI 能够完美地读取文本。
    • 类比: 想象一扇清晰的窗户。因为窗前没有堆积太多东西,你可以看清一切。AI 在其标记中有足够的“空间”来描述这些文本。
  2. 不稳定阶段(“闪烁模式”):

    • 现象: AI 开始出错,而且表现得非常混乱。有时它能读对,有时即使文本量几乎没变,它也会完全失败。
    • 原因: 这并不是因为 AI “变笨了”,而是由于**网格对齐(Grid Alignment)**问题。
    • 类比: 想象 AI 是通过一组方格窗户(类似于铁丝网围栏)来观察图像的。如果一个字母恰好落在两个窗口之间的分界线上,AI 就会感到困惑。它可能会在两个窗口中各看到半个字母,然后无法将它们拼凑在一起。
    • 验证: 研究人员通过轻微移动图像(就像挪动墙上的画框)证明了这一点。当他们移动图像后,那些“错误”的字母突然又变得“正确”了。这意味着信息依然存在,只是被隐藏在了错误的网格部分之后。
  3. 崩溃阶段(“硬壁垒”):

    • 现象: AI 突然放弃。错误率飙升,它再也无法读取文本。
    • 原因: 这是一个真正的容量极限。
    • 类比: 想象你有一个只能装 5 磅重量的背包。如果你试图往里塞进 50 磅重的书,背包并不会只是变得“有点乱”——它会直接被撕裂,所有东西都会掉出来。无论你怎么移动背包或重新排列书籍,它就是无法承受这么大的重量。AI 已经耗尽了其“精神空间”来编码这些信息。

“神奇公式”(缩放法则)

研究人员不仅发现了问题,还创建了一个数学规则(缩放法则)来预测 AI 何时会失败。

他们发现有两个因素最为关键:

  1. 有多少文本?(总负载)。
  2. 文本有多拥挤?(密度)。

他们将这两者结合成了一个单一的“难度评分”。

  • 发现: 文本的总量比字母看起来有多拥挤要重要得多。
  • “不稳定区”是恒定的: 他们发现,无论图像有多大,“闪烁”阶段(即 AI 感到困惑的阶段)总是持续大约文本长度的 2.2 倍。这是在彻底崩溃之前一个可预测的缓冲地带。

为什么这很重要(根据论文观点)

论文结论指出,虽然将图像转化为文本标记是节省计算能力的一种极佳方式,但这种压缩方式存在一个物理硬极限。

  • 对于开发者: 如果你想构建一个阅读长文档的 AI,你不能仅凭直觉猜测需要多少标记。你需要先计算“难度评分”。如果文本过于密集,你必须给 AI 提供更多的标记(更多的“明信片”),否则系统会撞上“硬壁垒”并宣告失败。
  • 核心启示: 视觉标记功能强大,但它们并非万能。它们拥有有限的容量,一旦跨越那条线,信息就会彻底丢失,而不仅仅是变得难以理解。

一句话总结

论文证明了 AI 视觉系统存在一个“崩溃点”,届时它们将无法再读取文本;这种现象首先是由图像与 AI 内部网格的对齐问题引起的,最终则是由于单纯地耗尽了存储信息的数字空间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →