← 最新论文
💬 NLP

The Automatic Verification of Image-Text Claims (AVerImaTeC) Shared Task

本文介绍了旨在推动图像 - 文本事实核查系统发展的 AVerImaTeC 共享任务,详细描述了任务设置、评估方法、14 个开发阶段和 6 个测试阶段提交系统的表现(其中优胜团队 HUMANE 得分为 0.5455),并总结了关键见解与经验教训。

原作者: Rui Cao, Zhenyun Deng, Yulong Chen, Michael Schlichtkrull, Andreas Vlachos

发布于 2026-02-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Rui Cao, Zhenyun Deng, Yulong Chen, Michael Schlichtkrull, Andreas Vlachos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一场名为 AVerImaTeC 的“网络打假”比赛。想象一下,互联网上每天都在发生各种事情,有人发一张图配上一段文字,声称“某位名人做了某件荒谬的事”。有时候是真的,有时候是假的,有时候是张冠李戴(比如把旧图说成是刚发生的)。

这篇论文就是关于如何教计算机像一位超级侦探一样,去核实这些“图文谣言”。

以下是用通俗易懂的语言和生动的比喻对这篇论文的解读:

1. 为什么要办这场比赛?(背景)

以前,我们主要检查文字谣言(比如“某人说了一句假话”)。但现在,谣言越来越喜欢“图文并茂”。

  • 比喻:以前的谣言是“空口无凭”,现在的谣言是“有图有真相”(虽然图可能是 P 的,或者被断章取义了)。
  • 问题:现有的电脑程序太笨了,它们要么只看图,要么只看字,很难把两者结合起来。而且,很多以前的测试数据是人工编造的,不像现实世界那么复杂。
  • 目标:这次比赛就是为了让电脑学会:看到一张图和一段话,能像侦探一样,去网上找证据,最后判断这句话是真是假,并解释为什么。

2. 比赛规则:侦探的“工具箱”

为了让参赛队伍公平竞技,主办方给了大家两样东西:

  1. 案件卷宗(数据集):1297 个真实的“图文谣言”案例,每个案例都有标准答案(真/假/证据不足)和详细的推理过程。
  2. 情报库(知识商店):这是最酷的地方。主办方预先帮大家在网上搜好了一堆可能相关的文章和图片,整理成一个巨大的“情报包”。
    • 比喻:以前侦探得自己花钱买电话查号、自己跑图书馆查资料(这很贵且慢)。现在主办方直接给了一个装满线索的百宝箱。你可以直接用这个百宝箱,也可以自己花钱去网上搜(但大多数队伍选择了直接用百宝箱,因为省钱又高效)。

3. 侦探们是怎么工作的?(系统流程)

参赛的队伍(也就是各种 AI 系统)需要完成三个步骤,就像侦探办案的三件套:

  • 第一步:提问(Question Generation)
    • 侦探看到谣言,不能瞎猜,得先问对问题。
    • 例子:看到“卡玛拉·哈里斯和她父母在一起”的图,AI 要问:“这张图是哪年拍的?”“她父母当时还活着吗?”
  • 第二步:找证据(Evidence Retrieval)
    • 根据问题,去“情报库”或“互联网”里翻找答案。
    • 比喻:就像在图书馆里快速翻阅成千上万本书,找出那几页能证明真相的纸片。这次比赛发现,不仅要会翻书,还要会“看图”(比如用反向图片搜索,看看这张图是不是从别的地方偷来的)。
  • 第三步:下结论(Verdict & Justification)
    • 把找到的证据拼起来,判断谣言是“支持”、“反驳”还是“证据不足”,并写一段话解释理由。

4. 谁赢了?(比赛结果)

  • 冠军HUMANE 团队。他们的得分最高(0.5455),而官方给的“新手村”基准程序只有 0.1136。这说明大家的进步非常大!
  • 获胜秘诀
    1. 更聪明的“爬虫”:冠军团队发现主办方给的情报库里有些链接打不开,或者只有网页的页脚(像只有封面没有内容的书)。他们用了更高级的工具(像 Playwright 浏览器自动化工具)把网页里的干货都“抠”了出来,信息量增加了 20% 多。
    2. 多管齐下:他们用了不止一种“反向图片搜索”工具。就像侦探不只问一个线人,而是问三个,这样就不容易漏掉关键线索。
    3. 强大的大脑:他们使用了非常先进的 AI 模型(闭源大模型),这些模型“读”过的书更多,理解力更强。

5. 发现了什么新问题?(教训与反思)

虽然大家进步很大,但论文也指出了几个“坑”:

  • 图片证据很难评
    • 比喻:如果侦探只给你看文字报告,但标准答案里有一张关键的照片。自动评分系统可能会觉得“文字对上了就行”,但人类评委觉得“没图怎么行?”。这导致自动评分和人类打分有时候对不上。
  • 时间陷阱
    • 有些 AI 模型在训练时已经“背过”了这些新闻。如果它不是去查证据,而是靠“记忆”回答,那就不算真正的侦探了。比赛发现,对于最近发生的新闻(AI 没背过的),大家的表现反而更好,这很有趣。
  • 开源 vs 闭源
    • 这次表现最好的队伍大多用了“闭源”的大模型(像黑盒,别人不知道里面怎么想的,但很强)。虽然“开源”模型(大家都能看的)更透明、更便宜,但目前还是稍微弱一点点。未来的研究就是要让开源模型也能这么强。

总结

这篇论文告诉我们:教电脑识别“图文谣言”已经迈出了重要一步。

现在的 AI 不仅能看图,还能像侦探一样去网上找证据、问问题、写报告。虽然离完美的“真相探测器”还有距离(比如对图片证据的评估还不够完美,对最新新闻的实时性还有挑战),但这次比赛证明了,只要给 AI 配上好的“情报库”和聪明的“搜索策略”,它们就能成为打击网络谣言的得力助手。

一句话概括:这是一场教 AI 当“网络福尔摩斯”的比赛,冠军团队通过升级“搜证工具”和“大脑模型”,成功揭穿了许多披着图片外衣的谣言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →