← 最新论文
🤖 machine learning

Question-Guided Evidence Acquisition for Multimodal Visual Question Answering

该论文介绍了 Q-Guide,一种通过动态分配推理时计算量以获取针对性证据(例如阅读文本、缩放或定位区域)而非依赖单一固定编码来改进多模态视觉问答的提问引导型智能体,通过刻意的多轮感知,其在 DocVQA2026 和 Manga109 上显著优于现有方法。

原作者: Alin-Ionut Popa

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Alin-Ionut Popa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,出现了一类被称为多模态大语言模型的系统。这些强大的计算机可以观察图像、阅读其中的文本,并回答关于它们所见内容的问题。它们表现得非常出色,通常就像人类扫视一份文件并立即理解其大致含义一样。然而,在仅仅是“看到”文档与真正“精准阅读”文档之间,仍然存在着巨大的鸿沟。当页面布满了细小的印刷体、复杂的表格、彩色图表或复杂的图解时,这些模型往往会遗漏回答难题所需的具体细节。它们可能看到了页面在那里,但却无法从视觉噪声中提取出精确的数字、名称或关系。这种局限性尤其令人沮丧,因为信息就在计算机面前;只是系统没有在正确的位置进行足够的观察。

亚马逊的研究人员开发了一种新方法来解决这个问题,他们不再认为计算机应该进行一次性的、快速的瞥视。相反,他们创建了一个名为 Q-Guide 的系统,将阅读视为一个缓慢且深思熟虑的过程。Q-Guide 不再试图一次性理解整个文档,而是像一名细心的调查员,首先观察问题,弄清楚究竟缺少哪 piece 的证据,然后放大或使用特殊工具去寻找它。这种方法优先考虑获取正确的信息,而非追求回答的速度。通过花费额外的计算时间和精力去主动搜寻缺失的细节,该系统能够解决那些让最先进的单次处理模型也感到困惑的问题。

这项工作的核心理念是:感知应当由问题本身来引导。在传统系统中,文档被处理一次,模型根据它在第一次观察中捕捉到的内容进行回答。这对于简单的文档来说没问题,但当答案取决于地图上的微小标签或密集表格中的特定单元格时,这种方法就会失效。Q-Guide 系统通过引入一个循环改变了这一点:计算机会询问自己需要知道什么。如果问题涉及图表中的某个特定数值,系统会将注意力转向该图表,放大以清晰读取数字,并在提交答案前验证信息。它并不依赖于页面的单一固定视图。相反,它可以调用不同的工具来恢复文本、检查视觉细节或理解文档的布局,并且只使用针对特定问题所必需的工具。

为了测试这一想法,研究人员在两种截然不同的挑战上对该系统进行了评估。第一种是包含 80 个问题的集合,这些问题源自八种不同类型的文档,包括商业报告、工程图纸、地图和科学海报。这些文档经过专门设计,具有极高的难度,包含了从微小文字到复杂空间关系的一切内容。第二个挑战涉及来自日本漫画集的任务,系统必须通过匹配视觉外观和姓名,在多个页面中识别特定角色。在这两种情况下,研究人员都将 Q-Guide 与标准方法(即模型仅进行单次观察)以及其他尝试将问题分解为多个步骤的复杂系统进行了对比。

结果显示,这种缓慢且深思熟虑的方法具有明显的优势。在文档测试中,Q-Guide 达到了 65.0% 的准确率,相比于表现最好的标准方法(仅达到 38.8%)有了显著提升。它也超越了其他使用多智能体协作的先进系统(后者仅达到 40.0%)。在工程图纸和科学海报等特定类别中,这种提升更为显著,系统的准确率达到了 90.0%。这表明,专注于图像正确部分的能力,比拥有更复杂的内部逻辑或更大的虚拟智能体团队更为重要。在漫画任务中,该系统也表现优于竞争对手,在标准文本阅读模式下正确识别角色的比例为 32.4%,而在提供完美文本数据后,这一比例跃升至 53.7%。这表明,该系统的优势在于其收集正确证据的能力,而不仅仅在于它阅读文本的能力有多强。

最令人惊讶的发现之一是,增加更多的规划层或控制层并没有带来帮助。研究人员测试了给系统配备一个用于规划策略的“规划器(planner)”或一个用于决定路径的“路由(router)”是否能提高性能。他们发现,这些额外的层级反而使情况变糟,或者没有任何效果。最成功的版本是一个简洁紧凑的循环:系统只需观察缺失了什么,选择一个工具去寻找,然后重复这一过程。随着允许系统进行更多轮次的观察和检查,系统的准确率随之增长,但在两到三轮之后基本趋于平稳。这表明,解决这些问题的关键不在于使推理过程变得更加复杂,而在于使观察行为变得更加仔细且有针对性。

研究人员还发现,该系统在不同的底层计算机模型上都能表现良好。他们使用三个不同版本的 Claude 语言模型(从功能最强到能力稍弱的版本)对 Q-Guide 进行了测试。在每种情况下,Q-Guide 方法都比标准提示法提高了结果。这证明了收益来自于系统收集证据的策略,而非其使用的“大脑”的具体能力。即使在文本阅读工具并不完美的情况下,该系统仍能胜过那些拥有完美文本但缺乏聚焦注意力的方法。这凸显了在这些任务中,瓶颈往往在于无法感知正确的细节,而非理解语言的能力问题。

尽管取得了成功,该系统并非完美无缺。它在涉及地图的问题上表现最吃力,因为这类问题的答案依赖于遵循路径或理解空间布局,而现有的工具无法完全呈现这些内容。系统可以读取地图上的文字并看到颜色,但无法轻易导航其中的连接关系。这指出了一个明确的未来改进方向:开发能够将地图布局转化为可导航结构的工具。同样,虽然该系统在匹配漫画角色方面非常有效,但当许多角色看起来非常相似时,它有时也会遇到困难。这些剩余的挑战表明,该领域的下一步不是建立更复杂的思考规则,而是构建更丰富的感知世界的方式。

最终,这项工作证明,为了让计算机真正读懂复杂的文档,它们需要慢下来。过去那种通过单次快速扫描来处理页面的方式,已不足以应对现实世界中杂乱且充满细节的现状。通过允许系统花费额外的时间来决定下一步观察什么,并通过赋予它放大并验证所见内容的工具,研究人员创造出了一个显著更加可靠的系统。研究结果表明,视觉任务领域的前进方向不一定是让模型变得更聪明或更复杂,而是教它们成为更细致的观察者,确保在尝试回答任何问题之前,它们已经掌握了正确的证据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →