在社交媒体这片广阔而嘈杂的领域中,每天都有数十亿条帖子将文字与图片交织在一起,计算机面临着一项艰巨的任务:理解这种组合背后的真实含义。这一被称为“多模态关系抽取”的领域,要求机器识别单条帖子中两个人物、地点或事物是如何相互关联的。这是构建人类知识数字地图的一项基本技能,它能让搜索引擎找到特定的事实,并帮助人工智能理解我们的世界。然而,为了让计算机学习这一点,必须用海量的实例对其进行训练。问题在于,现实世界的数据很少是公平的。正如一座图书馆可能拥有数千本畅销书,却只有一本稀有且晦涩的书籍一样,社交媒体数据被常见的关系所主导,而稀有、特定的联系则留下的样本极少。此外,两种类型的信息——文本和图像——并不总是保持一致。一张图片可能模糊、具有误导性或仅仅是无关紧要,而文本却是清晰的;或者反之亦然。当计算机试图从这种不平衡且充满噪声的混合物中学习时,它往往会忽略稀有的联系和令人困惑的图像,从而无法理解完整的叙事。
西南财经大学的研究人员开发了一种旨在解决这些特定问题的新系统。他们意识到,标准的计算机模型经常因为被最常见的关系类型所淹没以及被不可靠的图片所困扰而陷入停滞。为了解决这个问题,他们创建了一个统一的框架,该框架充当了一个双重平衡系统,同时处理稀有数据和冲突信息的问题。该系统并没有从一开始就将文本和图像视为平等的伙伴,而是学会了仔细权衡它们。它明白,有时图片是带有噪声的,应当减少信任,而文本持有真相;而在其他时候,图像则提供了文字所遗漏的关键线索。这种自适应方法使计算机能够针对每条特定的帖子专注于正确的信号,而不是盲目地遵循最频繁出现的模式。
该解决方案的第二部分解决了“长尾”问题,即由于在训练数据中出现频率极低,导致稀有关系被忽视的问题。标准模型自然会对常见关系产生偏见,就像一个只读标题而错过深度故事的人一样。研究人员引入了一种机制来调整计算机的最终决策过程。通过观察每种关系在训练集中出现的频率,该系统可以自觉地纠正自身的偏差。它本质上是在告诉模型:“不要对常见的答案如此自信;要更加关注那些稀有的答案。”这种调整无需人工创造更多数据,也不需要丢弃常见的示例,从而使模型能够学习到更完整的现实图景。
为了测试他们的想法,团队将该框架应用于两个包含数千个已知关系的社交媒体帖子(文本-图像对)的主要数据集。他们将自己的方法与广泛的现有模型进行了对比,包括那些过度依赖纯文本的模型,以及那些尝试以不同方式结合文本和图像的模型。结果表明,他们的平衡方法始终优于其他方法。最重要的是,它显著提高了计算机识别以往模型经常遗漏的稀有“尾部”关系的能力。在一次特定的测试中,该系统在识别晦涩联系方面表现出了显著的提升,证明了这种双重平衡策略成功地防止了模型被噪声和常见模式所淹没。
研究人员还仔细观察了他们的系统内部是如何运作的,以确保其达到了预期目标。他们发现,负责平衡文本和图像的部分成功学会了在文本清晰时忽略误导性的视觉线索,并在文本含糊不清时利用视觉线索。同样,负责纠正对常见关系偏见的组件被证明能够将计算机的信心从频繁出现的答案转向稀有的答案。当他们使用极少的训练数据测试该系统时,它的表现仍然优于标准模型,这表明这种方法即使在信息匮乏的情况下也是稳健且有效的。该研究得出结论:通过同时解决信息来源的不平衡和数据频率的不平衡,计算机可以更好地理解社交媒体上复杂且混乱的人类交流现实。
技术摘要:一种用于长尾多模态关系抽取的双重平衡框架
1. 问题陈述
多模态关系抽取(MRE)旨在识别包含文本和图像的社交媒体帖子中实体之间的语义关系。虽然传统的基于文本的方法在平衡数据集上表现良好,但现实世界的 MRE 面临两个关键且常被忽视的挑战,这些挑战会降低模型性能,特别是对于稀有关系而言:
- 标签不平衡(长尾分布): 现实世界的数据集呈现高度偏斜的标签分布,即少数“头部”关系占据主导地位,而“尾部”关系缺乏足够的训练数据。这会导致模型向频繁出现的类别偏移,从而损害其泛化到稀有但语义有效的关系的能力。
- 模态不平衡: 文本和视觉模态的贡献是不平等的。文本通常具有丰富的语义,而社交媒体中的视觉信号往往是嘈杂、不完整或具有误导性的。这导致了跨模态失配,即模型过度依赖文本,而对视觉线索利用不足或误解,从而削弱了多模态融合的效果。
现有方法通常独立地解决这些问题,或者假设各模态贡献平衡,未能为这种双重不平衡问题提供统一的解决方案。
2. 方法论
作者提出了一个统一的双重平衡框架(Unified Dual-Balance Framework),旨在同时解决表示层面的模态不平衡和决策层面的标签不平衡。该框架由三个主要部分组成:
A. 跨模态表示 (Cross-Modal Representation, CMR)
该框架首先使用预训练骨干网络(用于文本的 BERT,用于图像的 CLIP-ViT 或 ResNet-50)对输入进行编码。
- 文本编码: 通过插入特殊标记来突出显示实体对。
- 视觉编码: 通过拼接原始图像、生成图像(提供辅助语义线索)以及落地目标区域(提供实体局部证据)的特征,构建统一的面向对象的表示。
- 对齐: 文本引导的跨模态注意力机制将视觉标记与文本标记对齐,将两种模态投影到共享的隐藏空间中。
B. 模态平衡器:模态分支融合策略 (Modality-Branch Fusion Strategy, MFS)
为了解决模态不平衡问题,MFS 模块动态平衡文本和视觉的贡献。
- 双分支架构: 它采用两组并行的分支(K 个文本分支和 K 个视觉分支)分别处理表示。
- 平衡门控: 门控网络分析两种模态及其相互作用的全局摘要,以生成归一化的路由向量。该向量为文本分支、视觉分支以及一个残差文本捷径分配权重。
- 自适应融合: 最终的表示是各分支输出的加权和。这使得模型能够在视觉信号具有信息量时更多地依赖视觉,并在视觉信号存在噪声时转向依赖文本,同时通过残差捷径保留可靠的语义线索。
C. 标签平衡器:先验感知类别校准器 (Prior-aware Class Calibrator, PCC)
为了解决标签不平衡问题,PCC 模块在决策层面运行,以在不进行重采样的情况下纠正预测偏差。
- 逻辑值校准: 该模块从训练集中估计经验类别先验。它通过减去一个与类别先验对数 (logp^y) 成比例的项来调整分类器的逻辑值(logits)。
- 自适应强度: 校准强度 (α) 根据类别先验分布的方差动态计算。较高的方差(表明存在严重的失衡)会触发更强的校准,从而有效地移动决策边界以有利于尾部关系。
- 损失函数: 模型使用经过 PCC 校准的交叉熵损失进行优化,该损失函数惩罚对头部类别的过度自信,并鼓励对尾部类别的识别。
3. 核心贡献
论文声称了以下贡献:
- 统一框架: 提出了一个能够同时解决长尾 MRE 中模态不平衡(表示层面)和标签不平衡(决策层面)问题的单一框架。
- 专门模块:
- MFS: 一种利用门控机制自适应平衡和整合视觉与文本信号的策略,增强了跨模态一致性。
- PCC: 一种轻量级的校准器,根据标签分布先验重塑决策边界,以提高尾部关系的识别能力。
- 实证验证: 通过广泛的实验证明,该框架在双重不平衡条件下实现了具有竞争力的性能,并持续提升了尾部关系的识别能力。
4. 实验结果
该框架在两个具有严重标签不平衡特征的基准数据集 MNRE 和 MORE 上进行了评估。
- 整体性能: 当与强基线模型(如 HVFormer, TMR)结合使用时,所提出的框架一致提高了 Micro-F1 分数。例如,在 MORE 数据集上,集成 HVFormer 带来了 +1.82 的 Micro-F1 增益,集成 TMR 带来了 +2.50 的增益。
- 尾部关系识别: 对频率分组(高、中、低)的分析显示,最显著的改进发生在低频(尾部)组。在 MNRE 上,低频组的 F1 值提升了 +10.15 点;在 MORE 上,提升了 +13.92 点。
- 消融实验: 移除 MFS 或 PCC 都会导致性能大幅下降,证实了表示层面的平衡和决策层面的校准都是必要且互补的。
- 鲁棒性: 与基线模型相比,该模型在低资源设置(5%-50% 的训练数据)下表现出卓越的鲁棒性。
- 案例研究: 逻辑值可视化显示,该模型成功增加了真实尾部关系的置信度,同时抑制了对于“无(None)”或频繁出现的错误关系的伪激活。
5. 意义与主张
本文将这项工作定位为实现现实场景中稳健 MRE 的必要步骤。作者声称,现有方法在很大程度上忽视了模态不平衡与标签不平衡之间的相互作用。通过提出这种双重平衡方法,该框架:
- 减轻了模型在视觉线索存在噪声时过度依赖文本的倾向。
- 在不依赖数据重采样的情况下,缓解了对主导关系类别的偏差。
- 提供了一个统一的流水线,增强了对语义有效但稀有的关系的识别,这些关系对于从社交媒体构建全面的知识图谱和信息提取至关重要。
作者总结道,他们的方法为长尾 MRE 提供了一个稳定且有效的解决方案,并计划在未来工作中将该框架扩展到多模态大语言模型(MLLMs)和更具挑战性的低资源场景。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。