← 最新论文
🤖 machine learning

SAVER: Selective As-Needed Vision Evidence for Multimodal Information Extraction

本文提出了SAVER,一种选择性多模态信息提取框架,该框架采用共形可 grounding 门控机制来动态决定何时咨询以及咨询哪些图像子集,从而在显著降低计算成本和延迟的同时提高提取精度,相较于始终开启的融合方法而言。

原作者: Miaobo Hu, Shuhao Hu, Bokun Wang, Rui Chen, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Miaobo Hu, Shuhao Hu, Bokun Wang, Rui Chen, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,正试图基于一篇社交媒体帖子解开一个谜团。该帖子包含一段简短的文字描述,并附带了五张不同的照片。

问题:
过去,AI 侦探每次阅读文字时,无论情况如何,都会尝试查看每一张照片。

  • 有时,照片毫无用处(例如,当文字是关于汽车时,却配了一张随机云的照片)。
  • 有时,照片是冗余的(五张同一辆车的照片)。
  • 有时,照片具有误导性(当文字是关于狗时,却配了一张猫的照片)。

查看所有这些照片会浪费侦探的脑力(计算能力),甚至可能使其产生混淆,从而导致错误的答案。

解决方案:SAVER
作者创建了一个名为SAVER(按需选择性视觉证据)的新系统。将 SAVER 想象成一名聪明的侦探,它学会了忽略那些并非绝对必要的照片。

以下是 SAVER 逐步工作的过程:

1. “守门人”(共形可 grounding 门控)

在侦探查看照片之前,一位聪明的“守门人”会快速瞥一眼文字和照片的标题(此时尚未查看细节)。

  • 职责: 守门人会问:“这些照片真的有可能帮助解开这个特定线索吗?”
  • 类比: 想象你正在人群中寻找一个特定的人。如果文字说“我看到了一顶红帽子”,守门人会检查照片中是否有人。如果文字说“我今天感到难过”,守门人就知道照片帮不上什么忙,并会说:“跳过照片,只读文字即可。”
  • 安全网: 守门人使用一条特殊的数学规则(就像安全带一样)进行校准,以确保它不会意外跳过那些原本会有帮助的照片。它承诺:“如果我说‘跳过’,我有 95% 的把握不会错过答案。”

2. “策展人”(次模选择器)

如果守门人说:“是的,查看照片”,SAVER 也不会查看所有照片。它像一位博物馆策展人那样行动。

  • 职责: 它只从一堆照片中挑选出最佳、最独特的照片。
  • 类比: 如果你有 10 张音乐会的照片,你并不需要看完所有 10 张就能知道发生了什么。你只需要一张歌手的照片、一张观众的照片,也许再加一张舞台灯光的照片。策展人会挑选出这些特定的照片,而忽略那些模糊的重复照片。这既节省了时间,又保持了证据的清晰。

3. “融合”(集合 Transformer 与联合评分)

现在,侦探将文字与那几张精选的照片结合起来。

  • 职责: 它检查文字与所选照片是否相互一致。
  • 类比: 如果文字说“汽车是蓝色的”,而选中的照片显示一辆蓝色的汽车,侦探就会感到自信。如果文字说“蓝色”,但照片显示的是一辆红色的汽车,系统就会收到“一致性警告”并调整其答案。

为什么这更好?
该论文声称,通过使用这种“挑挑拣拣”的方法而不是查看所有内容:

  1. 更聪明: 它能获得更准确的答案(更高的 F1 分数),因为它不会被糟糕或冗余的照片所迷惑。
  2. 更快速: 它使用的计算能力(FLOPs)更少,完成任务的速度更快(延迟更低),因为它跳过了不必要的工作。
  3. 更安全: 它知道何时停止并说“我不需要看图片就能确定”,从而防止其基于误导性图像做出错误判断。

简而言之: SAVER 教会 AI 成为一个精明的购物者。它不是购买商店里的每一件商品(查看每一张照片),而是检查清单,只挑选它真正需要的商品,从而在买到正确杂货的同时节省金钱和时间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →