KITE: A Tri-Modal Transformer Integrating Text, Images, and Knowledge Graphs for Fake News Detection
该论文介绍了 KITE,这是一个通过跨模态注意力机制整合文本、图像和知识图谱事实的三模态 Transformer 框架,在检测高级多模态虚假新闻方面显著优于现有方法,同时提供了具有可解释性的置信度评分。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在试图破解谜题的侦探:这则新闻报道是真的,还是一个巧妙的谎言?
在过去,侦探(或计算机程序)通常一次只观察一件证据。有些只阅读文本,而另一些则只观察照片。但坏人变得越来越聪明了;他们可以写出一个引人入胜的故事,并配上一张相符的 Photoshop 照片来误导那些只能处理单一证据的侦探。
这篇论文介绍了一位新的侦探,名叫 KITE(知识集成文本-图像编码器)。KITE 很特别,因为它不仅观察文本或照片,它还引入了第三个强大的证人:一个经过验证的事实巨型图书馆(称为知识图谱)。
以下是 KITE 的工作原理,分为简单的步骤:
1. 三位证人
KITE 收集三种不同类型的信息来做出决定:
- 讲述者(文本): KITE 使用一个超级聪明的语言大脑(称为 RoBERTa)来阅读文章,理解词汇和语境。
- 摄影师(图像): KITE 使用一个视觉大脑(称为 CLIP)来观察图片,理解照片中实际存在的内容。
- 事实核查员(知识): 这是 KITE 的秘密武器。它提取故事中的人物和地点名称,跑去一个庞大的、经过验证的百科全书(Wikidata),并调取关于他们的真实事实。然后,它使用“图注意力网络”(可以理解为一个连接网络)来组织这些事实。
2. “圆桌会议”
大多数旧系统会让讲述者和摄影师先交谈,然后可能在会议结束后再让事实核查员发表意见。
KITE 采取了不同的做法。它让所有三位证人同时坐在同一个圆桌旁。
- 他们都坐在一个“跨模态 Transformer”(一个高级会议室)里。
- 他们可以即时进行交流。讲述者可以说:“等等,照片里显示的是一只猫,但文本里说是狗!”
- 事实核查员可以介入并说:“实际上,文本说这位政治家当时在巴黎,但我们的记录显示他们那天在伦敦。”
因为他们都在同时交谈,KITE 能够发现其他系统会错过的矛盾之处。如果文本和照片看起来很契合,但两者都与事实相悖,KITE 就会知道这是假新闻。
3. 判决与“为什么”
在会议结束后,KITE 会做出最终裁决:真实还是虚假。
但 KITE 在做出决定时也非常诚实。它会为每位证人提供一个“置信度分数”:
- “我认为这是假的,因为照片看起来很可疑。”
- “我认为这是假的,因为事实不匹配。”
- “我认为这是假的,因为故事本身逻辑不通。”
这有助于人类理解计算机为什么要标记这条新闻,而不是仅仅得到一个“黑箱式”的答案。
表现如何?
作者在两个著名的真实与虚假新闻集合(GossipCop 和 PolitiFact)上测试了 KITE。
- 结果: KITE 打败了所有其他的“侦探”,包括那些只读文本的、只看照片的,以及那些尝试混合文本和照片但忽略了事实的系统。
- 优势: 它特别擅长捕捉那些文本和照片看起来都没问题,但事实却是错误的情况。
缺陷(局限性)
论文承认 KITE 尚未达到完美:
- 它需要高质量的数据: 如果照片模糊或文本含糊不清(例如讽刺),KITE 可能会感到困惑。
- 它运行较慢: 因为 KITE 必须为每一则故事跑去“图书馆”(Wikidata)核实事实,而且作者是在一台标准计算机(而非超高速计算机)上进行的测试,所以训练耗时较长(约 20 小时)。
简而言之: KITE 是一种更聪明的方法来识别假新闻,它通过确保故事、图片和现实世界的客观事实相互一致,来判定一条新闻是否真实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。