Beyond Seeing Is Believing: On Crowdsourced Detection of Audiovisual Deepfakes
本文评估了众包检测音视频深度伪造的方法,发现虽然聚合多名工作者的判断可以可靠地筛查视频真实性,但众包在持续识别特定篡改类型和时间戳方面存在困难,尤其是在复杂的音视频案例中。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是大型新闻编辑部的编辑。突然,大量视频涌入,其中有些是真实的,有些则是“深度伪造”(deepfakes)——这些视频看起来和听起来都很真实,但已被人工智能秘密篡改。你的任务是甄别它们。但你无法独自看完每一个视频,于是你雇佣了一支由 240 名普通人组成的团队(即“众包”团队)来协助你识别伪造内容。
本文就是对该团队表现的成绩报告。以下是他们发现的简要说明:
设置:两个不同的“训练营”
研究人员并非只测试了一次众包团队,而是利用两组不同的视频进行了两次独立实验:
- “困难”训练营(AV-Deepfake1M): 这些视频时长较短、极具迷惑性,且非常逼真。
- “较易”训练营(TMC): 这些视频时长较长,且相对更容易被识别。
在这两个训练营中,众包团队必须对每个视频完成三项任务:
- 识别伪造: 这是真实的还是被篡改过的?
- 指出篡改方式: 他们篡改了音频(声音)、视频(画面),还是两者皆有?
- 定位时间点: 篡改究竟是从何时开始的?
结果:众包团队做对了什么(以及做错了什么)
1. “安全网”效应(RQ1)
众包团队在不“狼来了”方面表现出色。如果视频确实是真实的,工作人员几乎不会将其标记为伪造。他们非常谨慎,不会冤枉无辜的视频。
- 问题所在: 他们在识别真正的伪造视频方面表现糟糕。这就像一名保安,非常擅长放行真实的人,却几乎漏掉了所有试图混入的小偷。
- 差异: 与“困难”训练营相比,众包团队在“较易”训练营(TMC)中识别出的伪造视频数量大约多了一倍。这证明视频的类型至关重要。
2. “从众心理”(RQ2)
当研究人员询问“大家意见一致吗?”时,答案是否定的。
- 对于任何单个视频,工作人员之间经常意见不一。一个人可能认为它是真实的,而另一个人则认为它是伪造的。
- 然而,当你采用多数投票(即大多数人所说的)时,信号会变得更加清晰。这就像让满屋的人猜测一头牛的重量;一个人可能猜得离谱,但 10 个人的平均值通常相当接近。
- 局限性: 即使采用多数投票,如果视频是非常棘手的伪造品,众包团队仍然会漏掉它。你无法仅仅通过询问更多人就能消除盲点。
3. 细节上的“盲点”(RQ3)
这是最困难的部分。即使众包团队确实识别出了伪造视频,他们在猜测如何被伪造方面表现极差。
- 混淆: 如果一个视频既有伪造的声音又有伪造的画面,众包团队通常只会猜测“伪造声音”或“伪造画面”,很少能正确回答“两者皆有”。
- 一线希望(时间戳): 虽然他们无法就什么被篡改达成一致,但他们在何时发生篡改方面却出奇地一致。如果他们认定某个视频是伪造的,通常能指出同一个 5 秒片段,即异常开始的地方。
结论:两步走策略
本文提出了一种利用这种“众包”系统的实用方法,使用了一个简单的类比:
将众包团队想象成机场的金属探测器。
- 第一步(筛查): 金属探测器(即众包团队)非常适合快速扫描成千上万个包裹。它很少标记空包裹(误报率低),但可能会漏掉一些隐藏的微小物品(漏掉伪造视频)。
- 第二步(专家审查): 如果探测器发出警报,你不必问探测器是什么物品,也不必问它确切在包裹的哪个位置。你只需将该包裹送交人类专家(或智能 AI)进行开箱和仔细检查。
简而言之: 众包团队是一个极佳的“初筛”工具,用于捕捉明显的伪造视频,并将可疑视频标记出来供专家审查。但不要指望他们作为最终裁决者来判断视频如何被伪造,因为他们很可能会出错。
一个小警告
研究人员指出,有些工作人员在开始测试时可能将音量调低了。由于他们听不到音频,可能会漏掉“仅音频”类的伪造视频。这提醒我们,即使在简单的任务中,像音量这样的小细节也可能改变结果。
核心结论: 众包是识别视频中“有问题”的有用工具,但要弄清楚具体“出了什么问题”,它需要其他手段的协助。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。