CandidateFusion-MKAN: A Unified Framework for Robust Multimodal Crisis Classification across Diverse Supervision and Evidence Conditions
CandidateFusion-MKAN 是一个统一的框架,通过整合模态支持的候选集学习、候选集似然以及有界自适应软目标,有效地处理多样化监督、缺失或退化的证据以及冲突或互补的线索,从而实现鲁棒的单输出多模态危机分类。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在灾后混乱的数小时内,应急管理人员依赖社交媒体上涌入的海量信息来了解现场发生的情况。一条单一的帖子可能包含一条描述桥梁坍塌的文本信息,以及一张显示一家人困在屋顶上的照片。理想情况下,这两件证据应该指向同一个紧迫需求,例如“救援行动”或“基础设施损坏”。然而,人类沟通的现实往往更加混乱。有时文本和图像讲述的是不同的故事,也许是因为作者关注的是人,而照片捕捉到的是破坏;或者是因为图像模糊不清,文本成了唯一的清晰线索。在这些时刻,一个旨在对这些帖子进行分类的计算机系统面临着一个艰难的选择:它应该信任文本、信任图像,还是尝试猜测一个可能忽略了其中一方真相的单一答案?如果系统过早地强行做出单一且僵化的决策,它就有可能丢弃那些能够挽救生命的至关重要的信息。
这正是由应急管理部大数据中心及应急管理大学的研究人员开发的名为 CandidateFusion-MKAN 的新框架所解决的具体挑战。该团队致力于构建一个能够处理混乱的危机数据,且不会丢失原始证据细微差别的系统。该系统并没有在计算机做出决策之前就强迫文本和图像在单一标签上达成一致,而是让这两种可能性在学习过程中都保持活跃状态。它将文本和图像视为两个独立的证人,各自提供其版本的真相,并且仅在最后阶段才将它们结合起来,以产生一个最终可靠的答案。这种方法使得系统即使在证据缺失、退化或相互矛盾时,也能保持稳健。
研究人员在名为 CrisisMMD 的大规模真实世界灾难帖子数据集上测试了他们的系统,该数据集包含了来自七种不同灾难的超过 18,000 个图文对。他们发现,在超过一半的帖子中,文本和图像实际上支持不同的救灾类别。例如,一个帖子可能关于“受影响人员”,而图像显示的却是“基础设施损坏”。传统系统在这里往往难以应对,要么忽略其中一方,要么产生混乱。然而,这个新框架学会了保留这两个类别作为有效的候选选项。它使用一种方法,将计算机的置信度集中在证据所支持的选项集上,而不是过早地强迫它选出一个胜出者。如果文本和图像一致,系统表现得像一个标准的分类器;如果它们不一致,系统则会将这两个选项都保留在考虑范围内,确保最终决策是基于所提供的实际证据。
为了应对现实世界数据往往不完整的问题,该系统还经过了训练,以应对缺失或质量低下的输入。在现实世界中,照片可能太暗而看不清,或者文本信息可能被截断。研究人员通过在测试期间故意删除文本或模糊图像来模拟这些情况。他们发现,该系统可以无缝适应,将依赖转向剩余的清晰证据。当文本缺失时,系统会重度依赖图像;当图像消失时,它会信任文本。至关重要的是,它无需针对每种特定类型的缺失数据进行重新训练。系统还学会了识别文本和图像何时提供互补的线索——即两者单独都无法构成完整信息,但结合在一起就能描绘出完整图景的情况。在这种情况下,系统成功地结合了来自两个来源的不同见解,从而比将其视为冗余信息时得出了更准确的结论。
该研究的结果是在数千个测试案例中衡量的,其中包括文本和图像存在分歧的情况。在文本和图像一致的帖子中,新框架实现了 92.60% 的准确率,达到了现有最佳系统的性能水平。更重要的是,在文本和图像提供冲突信息的困难帖子中,该系统保持了高度的可靠性,正确识别有效类别的比例超过 90%。与那些简单平均文本和图像分析结果的旧方法相比,它也显著降低了预测的不确定性。通过在最后一刻之前保持证据的独立性,该系统避免了“平均化”问题,即避免了来自一个来源的强信号被另一个来源的弱信号或矛盾信号所稀释。
研究人员还观察了系统如何处理罕见类别,例如在极少数帖子中出现的特定类型伤亡或损坏。他们发现,标准方法由于强行要求一个可能无法得到文本和图像共同支持的单一标签,往往会丢失这些罕见案例。通过保持候选选项开放,新系统保留了识别这些虽然罕见但至关重要的局面的能力,即使这些情况仅在帖子的某一部分中可见。这对于应急响应至关重要,因为错过一种罕见但严重的状况可能会产生严重后果。研究表明,只要在训练期间见过足够多的通用类型事件(如洪水或地震)的示例,该系统就可以将其学习能力迁移到从未见过的全新灾难类型中。
最后,这项工作证明了稳健的危机分类并不要求证据必须完美或一致。它需要一个能够尊重人类沟通复杂性和现实世界数据局限性的系统。通过将文本和图像视为独立的真相来源,并仅在必要时进行合并,CandidateFusion-MKAN 框架为应急管理人员提供了一个更可靠的工具。它确保了当决策做出时,它是基于所有可用证据的全部权重,无论这些证据是清晰的、冲突的还是不完整的。这种方法为在高风险环境下使用人工智能提供了一条切实可行的路径,因为在这些环境下,忽视细节所导致的错误判断代价极其高昂。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。