Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline
本文介绍了 OmniFake,这是一个结合了人工编造的虚假信息与 AI 生成内容的规模化基准数据集,以及 UMFDet 框架,该框架利用类别感知混合专家架构,实现了对社交媒体上多种类型多模态欺骗行为检测的统一并超越了专门化模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一个巨大且繁忙的城镇广场,每个人都在那里大声讲述故事、分享照片和发布新闻。在这个广场里,有两种主要的捣蛋鬼。第一种是“人类骗子”——指那些为了吸引注意力、传播谣言或激怒他人而编写虚假故事或篡改照片的人。第二种是“机器人艺术家”——这是一个强大的计算机程序,它可以画出一只会飞的狗的画像,或者写出一个关于从未发生过的事件的极具说服力的新闻标题。长期以来,那些试图维护城镇广场安全的人(研究人员)构建了两种不同的保安。一个保安是识别人类谎言的专家,另一个则是识别机器人伪造品的专家。但在现实世界中,一条狡猾的帖子可能来自人类、机器人,或者是两者的结合,而这些保安并不知道该去叫谁。他们就像是一个只知道扑灭木头火灾的消防队,和一个只知道抓捕银行抢劫犯的警察部队;当银行发生火灾时,两支队伍都不知道该怎么办。这篇论文通过构建一个超级聪明的侦探,旨在应对这种混乱,无论这种假新闻是由谁制造的,它都能处理。
这篇论文的作者是一支来自中国大学和科技公司的团队,他们意识到,过去将“人类谎言”与“AI伪造”分开处理的方法对于现实世界来说太慢且太笨拙了。因此,他们创建了一个庞大的全新训练场,名为 OmniFake。把这个数据集想象成一个拥有 98,592 个样本——几乎 10 万条帖子!——的巨型图书馆,其中包含了真实新闻、人类编写的谣言以及 AI 生成的诡计。他们不仅是收集这些内容,更是创造了它们。他们使用真实的图片,并利用 AI 进行换脸、更换背景,甚至生成完全不存在的事物的全新图像。他们还利用 AI 将真实的标题改写成具有误导性的故事。他们甚至将这些技术混合在一起,创造了“混合操纵”(Mixed Manipulation),即一个帖子拥有真实的图片但虚假的故事,或者虚假的图片配上真实的故事。为了测试这种复杂程度,他们请了八位人类专家查看了 600 个样本。人类的正确率仅为 40% 左右,这证明了这些伪造品是极其难以识别的。
为了解决这个问题,团队构建了一个新的侦探系统,名为 UMFDet。他们没有雇佣两个独立的保安,而是构建了一个拥有内部“专家团队”的聪明大脑。想象一下一个中央枢纽,它接收到一个帖子(一张图片和一段文字),然后询问:“谁是看这个帖子的最佳专家?”该系统拥有三位专门的专家:一位负责真实新闻,一位负责人类创作的谎言,以及一位负责AI合成的伪造品。这被称为“类别感知混合专家模型”(Category-aware Mixture-of-Experts)。当一个帖子进来时,系统会将它路由到正确的专家那里。但巧妙之处在于,他们确保这些专家不会产生混淆。他们使用了一种特殊的训练规则(称为“专家级判别正则化”,Expert-wise Discriminative Regularization),强制要求“人类专家”紧密聚集在其他人类谎言周围,并远离 AI 伪造品,反之亦然。他们还添加了一个“跨模态一致性”(Cross-modal Consistency)检查,这就像一个事实核查员,会询问:“图片真的与故事相符吗?”如果文字说“一只会飞的狗”,但图片显示的却是一只猫,这个检查就会将其标记为可疑。
结果表明,这个新侦探比旧的专家系统要出色得多。在针对他们这个拥有 9.8 万个样本的新型图书馆进行测试时,UMFDet 平均有 82% 的概率能正确识别出误导信息的类型。这比其他方法有了巨大的飞跃。例如,在观察“文本操纵”(假故事)时,新系统的表现比之前最好的方法提高了 13% 以上。它还证明了自己比任何人都更能处理“混合操纵”(真实与虚假的结合)。该团队甚至在其他现有数据集(如 DGM4 和 MMFakeBench)上测试了他们的系统,结果依然名列前茅,击败了那些专为单一类型伪造品设计的专门化模型。
论文指出,通过统一这些任务,我们可以构建一个更具实用性和更强大的社交媒体安全工具。作者们并不声称已经永久解决了假新闻问题,但他们展示了将人类谎言和 AI 伪造视为一个统一挑战的做法效果要好得多。他们的系统连同这个庞大的新数据集,现在已向公众开放,供他人使用和改进,为实现一个无论谁在试图隐藏真相,都能让真相更容易被发现的城镇广场迈出了充满希望的一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。