想象你是一名侦探,正试图基于一篇社交媒体帖子解开一个谜团。该帖子包含一段简短的文字描述,并附带了五张不同的照片。
问题:
过去,AI 侦探每次阅读文字时,无论情况如何,都会尝试查看每一张照片。
- 有时,照片毫无用处(例如,当文字是关于汽车时,却配了一张随机云的照片)。
- 有时,照片是冗余的(五张同一辆车的照片)。
- 有时,照片具有误导性(当文字是关于狗时,却配了一张猫的照片)。
查看所有这些照片会浪费侦探的脑力(计算能力),甚至可能使其产生混淆,从而导致错误的答案。
解决方案:SAVER
作者创建了一个名为SAVER(按需选择性视觉证据)的新系统。将 SAVER 想象成一名聪明的侦探,它学会了忽略那些并非绝对必要的照片。
以下是 SAVER 逐步工作的过程:
1. “守门人”(共形可 grounding 门控)
在侦探查看照片之前,一位聪明的“守门人”会快速瞥一眼文字和照片的标题(此时尚未查看细节)。
- 职责: 守门人会问:“这些照片真的有可能帮助解开这个特定线索吗?”
- 类比: 想象你正在人群中寻找一个特定的人。如果文字说“我看到了一顶红帽子”,守门人会检查照片中是否有人。如果文字说“我今天感到难过”,守门人就知道照片帮不上什么忙,并会说:“跳过照片,只读文字即可。”
- 安全网: 守门人使用一条特殊的数学规则(就像安全带一样)进行校准,以确保它不会意外跳过那些原本会有帮助的照片。它承诺:“如果我说‘跳过’,我有 95% 的把握不会错过答案。”
2. “策展人”(次模选择器)
如果守门人说:“是的,查看照片”,SAVER 也不会查看所有照片。它像一位博物馆策展人那样行动。
- 职责: 它只从一堆照片中挑选出最佳、最独特的照片。
- 类比: 如果你有 10 张音乐会的照片,你并不需要看完所有 10 张就能知道发生了什么。你只需要一张歌手的照片、一张观众的照片,也许再加一张舞台灯光的照片。策展人会挑选出这些特定的照片,而忽略那些模糊的重复照片。这既节省了时间,又保持了证据的清晰。
3. “融合”(集合 Transformer 与联合评分)
现在,侦探将文字与那几张精选的照片结合起来。
- 职责: 它检查文字与所选照片是否相互一致。
- 类比: 如果文字说“汽车是蓝色的”,而选中的照片显示一辆蓝色的汽车,侦探就会感到自信。如果文字说“蓝色”,但照片显示的是一辆红色的汽车,系统就会收到“一致性警告”并调整其答案。
为什么这更好?
该论文声称,通过使用这种“挑挑拣拣”的方法而不是查看所有内容:
- 更聪明: 它能获得更准确的答案(更高的 F1 分数),因为它不会被糟糕或冗余的照片所迷惑。
- 更快速: 它使用的计算能力(FLOPs)更少,完成任务的速度更快(延迟更低),因为它跳过了不必要的工作。
- 更安全: 它知道何时停止并说“我不需要看图片就能确定”,从而防止其基于误导性图像做出错误判断。
简而言之: SAVER 教会 AI 成为一个精明的购物者。它不是购买商店里的每一件商品(查看每一张照片),而是检查清单,只挑选它真正需要的商品,从而在买到正确杂货的同时节省金钱和时间。
技术摘要:SAVER——面向多模态信息抽取的选择性按需视觉证据
1. 问题陈述
社交媒体上的多模态信息抽取(IE)面临一个独特的挑战:帖子往往包含多张图像,这些图像与 accompanying 文本的关系微弱、冗余,甚至具有误导性。传统方法通常采用“始终开启”的多模态融合策略,将所有可用的视觉特征与文本进行拼接或注意力融合。然而,在此背景下,该策略效率低下且适得其反,原因如下:
- 计算浪费:无论相关性如何,处理所有图像都会增加延迟和浮点运算次数(FLOPs)。
- 噪声放大:当图像不相关时,“始终开启”的融合会放大虚假的跨模态相关性。
- 缺乏可 grounding 标签:训练数据标注了实体和关系,但很少指明特定的文本单元(例如实体跨度或关系对)是否具有视觉 grounding 依据,这使得模型难以学习何时需要调用视觉信息。
核心挑战在于:针对每个预测单元,确定是否应调用视觉信息;如果应调用,则确定哪一小部分图像能提供可信的证据。
2. 方法论:SAVER 框架
SAVER(选择性按需视觉证据)通过将视觉视为可选证据而非强制性输入通道来解决上述问题。该框架通过一个包含四个主要阶段的模块化流程运行:
2.1 任务设定与表示
SAVER 针对两项任务:
- 多模态命名实体识别(MNER):识别实体跨度及其类型。
- 多模态关系抽取(MRE):对标记的实体对之间的关系进行分类。
系统使用文本编码器生成 token/跨度表示,并使用视觉编码器生成全局图像向量。仅在必要时才提取区域级向量。
2.2 共形可 grounding 门控(CGG)
CGG 是决定何时使用视觉的核心机制。
- 评分:对于候选跨度(在 MNER 中)或实体对(在 MRE 中),门控机制仅使用缓存的全局图像向量计算“可 grounding 分数”(g)。除非门控被激活,否则不提取区域向量。
- 校准:为了避免显式的可 grounding 标签,SAVER 在保留集上使用共形风格的校准程序。它选择一个阈值(τ),使得利用 Clopper–Pearson 上界,激活子集的误差率被目标风险(α)所限定。
- 决策:如果分数超过 τ,则激活视觉分支;否则,模型遵循仅文本路径。
2.3 证据构建器(SIS 或 RES)
当门控被激活时,SAVER 必须从可能庞大的附加图像集合中选择一个紧凑且多样化的子集。
- 子模态图像选择器(SIS):主要选择器使用单调子模态目标,以最大化相关性(与查询的相似度)和多样性(对其他相关图像的覆盖)。它采用具有 (1−1/e) 近似保证的贪心算法。
- 强化证据选择器(RES):一个可选扩展,利用强化学习(RL)按顺序获取证据,包含“停止”动作,并通过成本感知奖励进行优化。
- 聚合:选定的图像(及其 top-k 区域)使用 Set Transformer 进行聚合,以确保排列不变性。
2.4 能量启发的联合评分头
最后阶段将文本、可选视觉证据和一致性正则化结合到一个统一的评分函数中。
- 融合:文本表示通过门控机制与聚合的视觉证据(zset)融合。
- 一致性:一致性分数衡量融合后的文本表示与视觉证据之间的对齐程度。
- 目标:模型最小化一个能量函数,该函数包含特定任务的损失(跨度有效性、类型、关系)、一致性正则化以及激活视觉分支的稀疏性惩罚。在推理过程中,应用硬门控;在训练过程中,软门控允许进行可微优化。
3. 主要贡献
本文概述了三项主要贡献:
- 风险控制的门控:引入 CGG,利用共形风格的选择规则校准激活阈值,以保证激活子集的误差率有界,从而在没有显式监督的情况下有效决定何时需要视觉。
- 紧凑的多图像证据:使用子模态选择器(SIS)构建一个小型、多样化的证据集,在保留相关信息的同时减少冗余和计算成本。
- 结合一致性与稀疏性的统一评分:一种能量启发的联合评分头,将 MNER 和 MRE 任务与文本 - 图像一致性及稀疏路由相结合,在保持效率的同时提高了准确性和选择性。
4. 实验结果
实验在多个基准测试上进行,包括 MRE-MI(多图像)、MNRE(单图像)以及各种 MNER 数据集(Twitter-2015/2017, MNER-MI/Plus)。
- 性能:SAVER 在 F1 分数方面始终优于强大的仅文本基线模型和“始终开启”的多模态模型(例如 HVPNeT, RSRNeT)。在图像相关性差异显著的多图像设置中,提升最为明显。
- 效率:SAVER 显著降低了计算成本。在 MRE-MI 基准测试上,它将每样本的 FLOPs 从约 60G(RSRNeT)降低至 36G,P90 延迟从 90ms 降低至 54ms。
- 选择性与校准:该框架实现了高激活覆盖率(ActCov@0.10),同时保持激活子集的误差率低于目标风险水平(α=0.10)。与基于置信度的门控基线相比,它展现了更优越的风险 - 激活 - 覆盖率权衡。
- 消融研究:移除任何组件(CGG、SIS 或联合评分头)都会导致性能下降,证实了每个模块都独立地为系统的成功做出了贡献。
5. 意义与主张
本文主张 SAVER 代表了多模态 IE 的范式转变:从“如何融合文本和图像”转向“何时使用视觉以及信任哪些图像”。
- 模块化:该框架设计为模块化,允许集成替代的编码器或证据选择器。
- 可解释性:与黑盒融合模型不同,SAVER 提供明确的输出,说明选择了哪些图像、Set Transformer 的注意力权重以及激活单元的一致性分数。
- 实用性:通过依赖缓存的全局嵌入进行门控,且仅对选定图像提取区域特征,该框架在延迟和成本是关键约束的现实世界部署中具有计算可行性。
作者得出结论:在处理社交媒体特有的噪声、冗余和松散对齐的图文对时,选择性使用视觉尤为关键,这为更高效、更准确的多模态抽取提供了一条路径。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。