在人工智能领域,计算机能够记忆的信息量与其思考这些信息的速度之间存在着日益增长的紧张关系。大型语言模型(许多现代聊天机器人和写作助手背后的系统)旨在处理海量的文本。然而,当这些系统试图阅读一篇非常长的文档时——例如一整本书或一份冗长的法律报告——它们会面临一个显著的障碍。它们需要同时考虑的词汇越多,所需的计算能力和时间就越多,这往往会导致速度变得极其缓慢,或者遗漏掉埋藏在文本深处的关键细节。为了解决这个问题,研究人员最近尝试了一种聪明的捷径:将文本页面转化为图像。通过将文字渲染成图片,计算机可以更快地处理整个文档,类似于人类快速扫描页面以获取整体布局的方式。然而,这种速度是有代价的。当文本被转换为图像时,精细的细节——准确的数字、特定的名称或精确的日期——可能会变得模糊或难以辨认,导致计算机在需要回答关于内容的特定问题时出现错误。
一个研究团队开发了一种名为 SEER 的新方法,旨在兼顾图像观察的速度与文字阅读的精确度。SEER 并不把文档中的每一页都同等对待,而是学习像一位熟练的人类读者那样,知道何时该略读,何时该停下来仔细阅读。该系统首先将文档视为一系列图像,以快速识别哪些页面可能包含特定问题的答案。一旦定位了这些相关页面,它就不再仅仅依赖模糊的图像。相反,它会回溯到这些特定页面的原始文本以检索准确的词汇。随后,它将来自图像的宏观上下文与来自文本的精确细节相结合,从而得出答案。这种方法通过忽略无关页面来保持高效,同时仍能对真正重要的部分保持高准确度。
研究人员在一组涉及长文档的标准挑战性问题上测试了这一新系统。他们发现,SEER 的表现显著优于以往仅依赖视觉压缩的方法。在一项用于衡量长文档理解能力的重大基准测试中,新系统的平均准确率达到了 51.11%。这明显高于之前仅使用视觉的方法(得分为 48.78%),同时也超越了一个完全不使用图像压缩的领先文本模型。这种提升在需要提取特定事实的任务中尤为明显,例如统计某位作者写了多少部小说,或在报告中寻找一个特定的日期。在这些情况下,从快速视觉扫描切换到精确文本查找的能力产生了实质性的影响,在一些文本密集且难以通过图像阅读的特定中文任务中,准确率提升了近 19 个百分点。
研究还揭示了该系统在工作时的行为模式。平均而言,对于每一个提出的问题,系统仅选择对文档中的约 1.59 页进行详细检查,尽管这些文档通常包含更多页面。这表明系统成功学会了忽略绝大部分不需要的文本。然而,研究人员指出,这种效率是有极限的。如果一个问题的答案取决于散布在许多不同页面上的信息,那么系统仅挑选几页的策略可能并不足够,其准确率也会下降。此外,虽然该系统通过不阅读每一页的每一个词节省了大量的计算能力,但在纯粹的时间运行方面并不总是更快。因为系统需要多出一个步骤来决定阅读哪些页面并随后获取文本,所以回答单个问题的总时间有时会比直接阅读整个文档更长,即使处理的总数据量更小。
最终,这项工作表明,处理长文档最有效的方式不是在速度和准确度之间做出选择,而是采用一种能够适应任务需求的混合策略。通过教会计算机何时观察大局以及何时放大观察细节,研究人员创建了一个在许多类型的问题中都比以往方法更快、更精确的系统。研究结果表明,未来的人工智能系统将不再仅仅依赖于对每个词进行“蛮力”处理,而是更多地依赖于智能选择,模仿人类通过将注意力仅集中在需要的地方来自然地处理复杂信息的方式。
技术摘要:SEER —— 通过选择性视觉-文本压缩实现长上下文推理
问题陈述
由于自注意力机制在文本标记(tokens)上的二次方复杂度,长上下文推理对于大语言模型(LLMs)而言仍然计算成本高昂。虽然视觉-文本压缩(将文本渲染为图像并使用视觉语言模型(VLMs)进行处理)提供了一种极具前景的替代方案——通过减少标记数量(通常可实现 3–4 倍的压缩),但现有方法存在一个关键局限性:均匀压缩。
目前的各种方法(如 Glyph、Vist)对整个上下文进行均匀压缩,而不考虑查询的相关性。这造成了一种权衡:激进的压缩可以提高效率,但会牺牲精确推理所需的细粒度细节(例如提取特定的数字或名称);而保守的压缩虽然保留了细节,却抵消了效率收益。本文认为,许多查询仅需要从上下文的一个小子集中获取详细信息,而其余部分主要用于全局理解。
方法论:SEER 框架
SEER(选择性视觉-文本压缩)通过学习执行选择性视觉-文本压缩来解决这一权衡问题。它将视觉选择和文本检索视为统一推理过程中的工具,结合了视觉扫描的高效性和基于文本推理的精确性。
1. 三阶段推理流水线
SEER 通过一个顺序的工具交互轨迹运行:
- 第一阶段:视觉选择。 模型扫描渲染图像序列 (I) 和查询 (q),以预测一组相关的图像索引 (S)。这利用了视觉表示的全局可访问性,能够快速识别与查询相关的区域,类似于人类的扫视行为。
- 第二阶段:文本检索。 对于选定的图像,系统确定性地检索其对应的源文本 (yR)。这一步绕过了推理过程中对 OCR 组件的需求,因为在渲染过程中源文本是可用的。这提供了细粒度的局部推理能力。
- 第三阶段:推理。 模型通过对完整的视觉图像 (I)、查询 (q)、选定的图像索引 (S) 以及检索到的文本 (yR) 的组合上下文进行推理,生成最终答案。这遵循了 ReAct 式的“思考-行动-观察”(Thought-Action-Observation)范式。
2. 训练策略
SEER 通过在完整的工具交互轨迹上进行**监督微调(SFT)**来训练。
- 数据构建: 训练数据集由包含渲染图像、查询、地面真值相关图像(使用更强的模型 Qwen3.5-9B 进行标注)、参考思维链(CoT)推理以及最终答案的轨迹组成。
- 目标: 模型被训练输出结构化的工具调用(例如
{"name": "select", "indices": [1, 3]}),接收检索到的文本作为观察结果,并继续进行推理。使用逐标记权重掩码(per-token weight mask)来仅监督模型生成的内容,屏蔽掉非生成的观察标记。
- 初始化: 模型从 Glyph-9B 初始化,并在来自 2WikiMQA、HotpotQA 和 Qasper 等数据集构建的轨迹上进行微调。
核心贡献
- 框架提案: SEER 是第一个将视觉-文本压缩与选择性工具调用相结合的框架,学习仅从与推理任务最相关的图像中检索文本。
- 流水线设计: 一种新颖的三阶段推理流水线(选择-检索-推理),共同优化选择和推理能力,使模型能够平衡效率与精度。
- 经验性能: 在长上下文基准测试中展示了性能提升,特别是在通过选择性检索恢复了均匀压缩所损失的精度,且未完全回归到全文本处理的标记成本。
实验结果
作者在 LongBench 基准测试(涵盖 6 个类别的 21 个任务)上将 SEER 与基于文本的 LLMs 及视觉-文本压缩基准进行了评估。
- 准确率: SEER 在 LongBench 上实现了 51.11% 的平均准确率。
- 超越了视觉-文本基准 Glyph-9B 2.33 个百分点(48.78% vs. 51.11%)。
- 超越了基于文本的 Qwen3-8B 3.49 个百分点(47.62% vs. 51.11%)。
- 特定任务增益: 改进在提取密集型任务中最为显著:
- 在 Qasper(单文档问答)上 +8.75 个百分点。
- 在 MultiFieldQA-Zh(中文问答)上 +19.17 个百分点。
- 在 NarrativeQA 上 +4.22 个百分点。
- 标记效率:
- Glyph-9B 相比全文本基准实现了约 3.14 倍的提示词压缩。
- SEER 实现了 1.28 倍压缩。虽然比纯视觉压缩效率低,但它通过牺牲部分标记节省量来恢复任务相关的文本精度。
- 平均而言,SEER 每个查询仅选择 1.59 张有效图像(中位数为 1),保持了检索预算的稀疏性。
消融实验
- 无检索: 去掉文本检索阶段(仅保留选择)后,准确率降至 43.00%(−8.11 个百分点),表明仅靠选择不足以实现精确提取。
- 无选择 + 检索: 纯视觉推理(Glyph-9B 的行为)得分为 48.78%(−2.33 个百分点)。
- 机制 vs. 数据: 使用等效训练控制(相同数据,无 select/retrieve 机制)得分为 45.20%,证实了性能提升源于 select-retrieve 机制,而非仅仅是微调数据。
意义与主张
论文声称 SEER 有效缓解了均匀视觉-文本压缩固有的精度-效率权衡。通过学习仅在需要时选择性地检索文本,该框架既保持了视觉处理的全局上下文感知能力,又将具体的推理步骤锚定在精确的文本证据之上。
作者强调,准确率的提升集中在需要提取确切细节(姓名、数字、日期)的任务上,在这些任务中,仅靠视觉解码容易出错,尤其是在处理密集的渲染文本(如中文字符)时。这项工作证明,稀疏的检索预算(选择约 1–3 页)足以恢复大部分在均匀压缩中损失的性能,这表明长上下文推理并不需要对整个上下文进行高保真度的文本处理,而是需要处理“正确”的部分。
局限性
论文明确指出了以下几点局限性:
- 鲁棒性: 选择机制并非完美鲁棒;模型偶尔会预测出范围外的索引,这些索引会被丢弃,这在生产系统中可能会导致检索失败。
- 效率范围: 标记节省量是一个平均值,而非保证。在某些任务上,检索带来的开销使得提示词比全文本处理更大。此外,由于显式的推理轨迹输出,SEER 在实际运行时间(wall-clock time)上的延迟提升有限。
- 证据分布: 该方法针对证据存在于少数页面中的问题进行了优化。当证据分布在许多页面时,性能会下降,因为单轮选择受限于召回率。
- 适用范围: SEER 专门用于渲染的长文档(如 PDF、代码等),未在自然图像、图表或标准 OCR 基准测试上进行评估。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。