← 最新论文
🤖 AI

VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection

该论文介绍了 VendorBench-100,这是一个统一的跨范式基准测试,通过一个精选的 100 张图像语料库,对商业 API、视觉语言模型以及开源检测器中的 36 个深度伪造检测模型进行了评估,结果表明,尽管商业 API 在中位数性能方面领先,但在排序能力(ROC-AUC)与可靠决策能力(MCC)之间存在关键性的分歧。

原作者: Sharayu N. Deshmukh, Md Rashidunnabi, Nelton Tiago Gemo, Kurundkar G. D., Mahamune M. R., Nilesh K. Deshmukh

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Sharayu N. Deshmukh, Md Rashidunnabi, Nelton Tiago Gemo, Kurundkar G. D., Mahamune M. R., Nilesh K. Deshmukh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名安保团队的经理。你的工作是识别那些用来欺骗人们的假照片(深度伪造/deepfakes)。你有三种截然不同的保安类型可以雇佣:

  1. 高科技专业人士(商业 API): 你向像“Neural Defend”或“Reality Defender”这样的公司付费,让他们来检查照片。他们接受过专门针对这项工作的昂贵且专业的训练。
  2. 聪明的一般主义者(视觉大语言模型/Vision LLMs): 你向一个超级聪明的 AI 助手(比如一个能看图的聊天机器人)寻求猜测。他们并非专门为了识别伪造而训练的,但他们非常聪明,并且能够对所见之物进行推理。
  3. DIY 爱好者(开源检测器): 你下载由研究人员和爱好者制作的免费工具。其中一些非常出色,另一些则漏洞百出,而且它们都在你自己的电脑上运行。

问题在于,从来没有人把这三类人放在同一个房间里参加同样的测试。因为“专业人士”有他们自己的报告,“一般主义者”有通用的测试分数,而“DIY 圈子”则有他们自己的排行榜。这就像是在拿赛车的圈速与卡车在高速公路上的速度进行比较,然后称它们都“很快”。

论文的核心思想:“VendorBench-100”测试
作者决定构建一个单一、不公平且极其困难的测试,以看看谁才是真正的赢家。他们并没有只做一个包含 1,000 张简单照片的测试。他们精心挑选了 100 张特定的、棘手的照片,旨在让这些系统崩溃。

把这个测试想象成检测器的“生存课程”:

  • 有些照片只是将一张脸换到了一个身体上,但背景是真实的。
  • 有些是来自 AI 视频的帧,看起来就像普通的电影。
  • 有些照片中,有人使用手机 App 对真实图片中的某一个微小部分进行了编辑。
  • 有些照片很小、模糊且经过了重度压缩(就像通过短信发送的照片)。

他们让 36 种不同的模型(5 个专业模型、7 个一般主义者模型和 24 个 DIY 工具)通过了这个由 100 张照片组成的精确考验。

陷阱:为什么“准确率”是个骗子
这是本文最重要的部分,用一个简单的类比来解释。

想象一下,测试中有 79 张假照片21 张真照片
如果你雇佣了一个懒惰的保安,他根本不去观察照片,而只是对每一张照片都大喊 “假的!”,会发生什么?

  • 他会答对 79 张假照片。
  • 他会答错 21 张真照片。
  • 他的“准确率(Accuracy)”得分将是 79%。这听起来很棒!

但实际上,这个保安毫无用处。他只是根据概率在瞎猜。论文认为,仅仅看“准确率”就像是只根据厨师端出了多少盘菜来评判他,却忽略了食物是否可口。

因此,作者使用了一个更聪明的得分指标——MCC(马修斯相关系数)。只有当你同时答对假照片和真照片时,这个得分才会上升。它会惩罚那个只会盲目喊“假”的懒惰保安。

令人惊讶的结果
当他们根据这个更聪明的得分进行排名时,发现了以下情况:

  1. 专业人士基本胜出: 付费的商业服务通常表现最好。他们是最可靠的保安。
  2. 一般主义者处于中游: 聪明的聊天机器人表现尚可,但不如专业人士那样出色。
  3. DIY 圈子表现参差不齐: 大多数免费工具的表现是最差的。然而,一些特定的免费工具在识别模式方面实际上比聪明的聊天机器人还要好。

大反转:“排序能力” vs. “决策能力”
这是本论文最大的发现。他们发现,一个模型可以非常擅长排序(将假照片排在真照片前面),但在决策(当你询问它是“真”还是“假”时做出判断)方面却表现糟糕。

  • “TruthScan”案例: 其中一个商业工具在排序方面非常出色。如果你给它 100 张照片的列表,它可以完美地按顺序将假照片与真照片分开。它的“排序得分(Ranking Score)”是所有模型中最高的。
  • 问题在于: 但当要求它做出最终决定时,因为它太害怕错过任何假照片,所以它判定所有东西都是假的。它之所以测试失败,是因为它把所有的真照片都标记成了假货。

这就像机场里的金属探测器,它对任何东西都会发出警报——硬币、钥匙、皮带扣和枪支。它拥有完美的“排序能力”(它能找到所有的金属),但作为一名保安它是毫无用处的,因为它从不停止任何人通行。

总结
论文得出结论,你不能仅仅看一个数字(如排行榜得分)来决定使用哪个检测器。

  • 如果你只看排序能力(Ranking),你可能会选出一个擅长分类但做决策却很糟糕的工具。
  • 如果你只看准确率(Accuracy),你可能会选出一个只会不停猜“假”的懒惰工具。

要挑选合适的保安,你需要同时检查他们区分真假的能力,以及他们在做出最终判断时避免犯错的能力。作者发布了他们所有的资料和工具,以便其他人可以再次进行这些测试并验证结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →