From Cheap Fakes to Pure Synthesis: Addressing the New Era of T2V Fake News Videos
为了应对由文本生成视频模型产生的纯合成虚假新闻视频这一新兴威胁,本文引入了首个专用数据集(PS-FNVD)以及一种创新的三元分类框架(R-T2V),该框架通过将语义推理与物理痕迹相结合,实现了最先进的检测性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正刷着手机,观看短视频新闻。多年来,如果有人想对你撒谎,他们必须是一个笨拙的剪辑师。他们会截取一段真实的政治人物视频,剪掉一个句子,再拼凑进另一个句子,或者把一张脸换到另一个身体上。这些被称为“低级伪造”(cheap fakes)——如果你仔细观察,很容易就能发现它们,因为这些碎片并不契合,就像把拼图强行塞进了错误的盒子里。但最近,一种新的魔术出现了。想象一下,一个机器人可以听取一个虚构的故事,并瞬间绘制出一场全新的、超写实的电影来匹配这个故事,逐帧生成,从无到有。这就是“文本生成视频”(Text-to-Video, T2V)技术。现在,骗子不再需要旧素材了;他们只需输入一个谎言,计算机就能描绘出一个完美的、虚假的现实世界,且看起来与谎言完全一致。
这种转变给那些试图识破骗子的人带来了巨大的头痛。旧有的工具旨在识别那些由于视频被切割而产生的“瑕疵”。但如果这段视频从一开始就不是真实的,那么也就没有所谓的“切割痕迹”可寻。更糟糕的是,新的 AI 极其擅长遵循指令,以至于生成的虚假视频与虚假故事完美契合。这就像一位魔术师不仅变出了一只兔子,还让这只兔子戴上了你要求的帽子。如果你只检查兔子是否匹配帽子,你就会认为一切都是真实的。科学家们面临的核心问题是:当谎言看起来如此完美,且故事与画面配合得天衣无衔时,我们该如何识破它?
这篇论文正是针对这一问题展开研究。作者们来自香港浸会大学和北京师范大学,他们意识到,仅仅询问“这是真的还是假的”这种传统的视频核查方式已经不够了。他们认为,我们需要一种更聪明的方法来对三类视频进行分类:真实视频、低级伪造(即旧式的剪辑式伪造)以及纯合成(即全新的 AI 生成式伪造)。
为了解决这个问题,他们首先建立了一个全新的测试场,称为 PS-FNVD 数据集。他们没有仅仅抓取旧视频,而是使用强大的 AI 视频生成器创建了两类特定的复杂假新闻。第一类是“完美陷阱”:他们编写了一个虚假故事,并让 AI 生成一段与之高度一致的视频,使其看起来 100% 协调。第二类是“错误外衣”:他们选取一个真实的故事(例如:城市公园迎来了一个新机器人),但让 AI 生成一段完全虚假且夸张的视频来配对(例如:一个巨大的机器人在公园里接管了一切)。这个数据集非常特殊,因为它迫使计算机去学习如何区分一个在“语义”上一致(故事与画面匹配)但在“物理”上虚假(从未实际拍摄过)的视频,与一个仅仅是不匹配的剪辑视频之间的区别。
接着,他们开发了一种名为 R-T2V 的新型侦探工具。R-T2V 不仅仅是猜测“真”或“假”,它被训练成像一名法医专家一样,在做出决定之前先撰写一份详细的报告。他们教导 AI 去观察七个特定的线索,这些线索分为两组:逻辑线索(故事是否合理?文本是否在试图误导?)和物理线索(阴影看起来是否奇怪?人的动作是否像机器人?纹理是否过于平滑?)。
结果非常令人印象深刻。当他们用这个新侦探去测试其他十种流行方法时,R-T2V 完胜。当第二名的准确率约为 72% 时,R-T2V 的准确率达到了 84.79%。在衡量如何平等处理三类视频的“宏观 F1 分数”方面,它得分 0.8000,大幅领先第二名 8.46 个百分点。
论文指出,秘诀不在于单纯扩大 AI 的规模或提高其智能,而在于教它“步步为营”地思考。当他们测试一个没有经过这种“思考”训练的小型化版本 AI 时,其表现骤降至约 29%,这证明了通过推理七个线索的能力才是拉开差距的关键。作者展示了,通过强制 AI 去解释“为什么”一段视频是假的——即使故事听起来很对,也要检查物理属性是否出错——它就能识破那些足以欺骗所有人的新型“纯合成”伪造。
然而,作者也谨慎地指出,这并不是解决一切的万灵药。他们的系统目前只能读取视频中的文本内容,无法读取实际的声音波形,因此可能会错过虚假的语音。此外,它也没有观察视频在社交媒体上的传播方式,而这在现实生活中往往是一个重要的线索。但就目前而言,他们已经证明,通过教导 AI 去区分“故事是否匹配”与“视频看起来是否真实”,我们可以开始捕捉这些看似完美却充满谎言的新型伪造。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。