← 最新论文
🤖 AI

Visual Text Compression as Measure Transport

本文提出了一种用于视觉文本压缩的测度传输框架,该框架通过精度和覆盖成本量化任务相关信息损失,从而实现无标签路由机制和自适应注视策略,在显著降低令牌使用量的同时大幅提升下游性能。

原作者: Lv Tang, Tianyi Zheng, Yang Liu, Bo Li, Xingyu Li

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Lv Tang, Tianyi Zheng, Yang Liu, Bo Li, Xingyu Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个庞大的文本文档图书馆。你想快速阅读它们,但如果试图逐字逐句地阅读每一个单词,你的大脑(即 AI 模型)就会感到疲惫。

视觉文本压缩(VTC) 是一个巧妙的技巧:与其阅读文字,不如给页面拍张照片,并将这张图片展示给 AI。AI 看着图片并“阅读”它。这种方法要快得多,因为 AI 是将整页视为几个大块(像素)来观察,而不是去识别成千上万个微小的字母。这就像查看城市地图,而不是去阅读每一栋房子的地址。

然而,这篇论文的作者发现了一个问题:有时这个技巧效果惊人,但有时却会让 AI 变得愚蠢。

  • 好的一面: 在某些任务中(例如在长文档中查找特定事实),“拍照法”不仅更快,而且与阅读文本一样聪明。
  • 坏的一面: 在其他任务中(例如解决逻辑谜题或核对特定数字),“拍照法”彻底失败。AI 会遗漏微小的细节,因为将文本压缩成图片会模糊边缘。

核心问题在于:我们如何知道何时使用图片,何时阅读文本?

核心理念:“运输”信息

作者提出了一种思考这个问题的新方法,使用了一个名为**测度传输(Measure Transport)**的概念。

把文本想象成一堆沙子。每一粒沙子就是一个单词。

  • 文本路径: 你用手推车一粒一粒地运送沙子。这很慢,但你不会丢失任何沙粒。
  • 视觉路径: 你把沙子倒进桶里,然后提着桶走。这快得多,但一些沙子会洒出来,沙粒也会混合在一起。

论文认为,这种“洒漏”并非随机发生,而是以两种特定方式出现:

  1. “平滑”洒漏(精度成本): 当你把沙子倒进桶里时,沙粒之间的微小差异会被平滑掉。如果任务需要区分"2023"和"2024",桶装法可能会将它们模糊在一起。
  2. “散射”洒漏(覆盖成本): 如果重要的沙子散布在整个地板上,将其倒入桶中可能会将线索散落得太远,导致你无法将它们重新拼凑起来以解决谜题。

解决方案:“智能红绿灯”

作者构建了一个系统,充当 AI 的智能红绿灯。在 AI 尝试阅读文本或查看图片之前,该系统会计算一个“传输效率分数”。

它无需预先知道问题的答案,只需提出两个简单的问题:

  1. 这项任务需要多少细节?(如果需要微小细节,就不要使用图片。)
  2. 信息分布得有多广?(如果线索分散在各处,就不要使用图片。)

根据这个分数,系统会做出决定:

  • 绿灯(图片): “任务足够简单,或者布局很有帮助。让我们使用快速的图片法。”
  • 红灯(文本): “这项任务对图片来说太棘手了。让我们仔细阅读文本。”

“注视”技巧:放大镜

有时,系统决定使用图片,但它意识到图像的某一小部分太模糊了(例如合同中的一个小数字)。

系统不会放弃,而是使用数字放大镜(称为注视,foveation)。它仅放大那个模糊且重要的部分,以高清重新捕捉它,并将其添加到图片中。这就像查看地图时,发现一个模糊的街道名称,然后仅放大那条街道以清晰阅读,而无需再次放大整张地图。

他们的发现

他们在 24 种不同类型的语言任务(如回答问题、总结新闻或核实事实)上测试了这种方法。

  • 结果: 他们的“智能红绿灯”约有 71% 的时间判断正确。它确切地知道何时切换到图片,何时坚持使用文本。
  • 益处: 通过使用这种切换机制,AI 的工作表现更好(分数更高),同时与一直只阅读文本相比,资源消耗减少了 10%(计算能力和时间更少)。

总结

这篇论文不仅仅说“图片更快”。它指出,“图片更快,但前提是你必须知道何时使用它们。”

他们制定了一条数学规则,充当交通指挥员,根据信息的具体“形状”,引导 AI 选择最快的路径(文本或图像),确保 AI 永远不会为了节省时间而丢失重要细节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →