← 最新论文
💻 computer science

ActivityForensics: A Comprehensive Benchmark for Localizing Manipulated Activity in Videos

本文提出了首个针对视频活动篡改定位的大规模基准数据集 ActivityForensics,包含 6000 多个高视觉一致性的伪造片段,并配套提出了基于扩散特征正则化的 TADiff 基线模型及全面的评估协议,以应对新兴的活动级伪造挑战。

原作者: Peijun Bao, Anwei Luo, Gang Pan, Alex C. Kot, Xudong Jiang

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Peijun Bao, Anwei Luo, Gang Pan, Alex C. Kot, Xudong Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ActivityForensics 的新项目,它就像是为视频打假领域打造的一把“超级显微镜”和一套“新训练教材”。

为了让你更容易理解,我们可以把这篇论文的核心内容想象成一场**“寻找视频里的隐形魔术”**的侦探游戏。

1. 背景:以前的“找茬”太简单了

过去,科学家们在研究如何识别假视频时,主要关注的是**“换脸”(比如把一个人的脸换成另一个人的)或者“抠图”**(把视频里的某个物体 P 掉)。

  • 比喻:这就像是在玩“找不同”游戏,但只找那些明显的贴纸。比如,你一眼就能看出照片里的人脸是贴上去的,或者衣服上少了一块。

但是,现在的 AI 技术太厉害了,它能直接修改人的动作

  • 新挑战:想象一段真实的新闻视频,里面一位政治家正在握手。AI 可以在几秒钟内,悄悄把“握手”这个动作改成“竖大拇指”,而且改得天衣无缝,背景、光影、甚至周围人的反应都完美衔接。
  • 比喻:这不再是贴贴纸了,而是**“换剧本”**。视频里的人还在,但他在做的事情完全变了,而且你肉眼几乎看不出来哪里不对劲。这种“动作篡改”比“换脸”更难发现,也更危险,因为它能彻底歪曲事件的真相。

2. 核心贡献一:ActivityForensics(超级训练场)

为了解决这个问题,作者们建立了一个巨大的**“作弊视频数据库”**,叫 ActivityForensics

  • 它是怎么来的?
    以前造这种假视频需要人工一个个去剪辑,累死人。作者们发明了一套**“自动化流水线”**:
    1. 先让 AI 看懂视频里的人在干什么(比如“他在挥手”)。
    2. 再用大语言模型把这句话改成“他在竖大拇指”。
    3. 最后让视频生成 AI 根据新指令,把“挥手”自动变成“竖大拇指”,并完美融合进原视频。
  • 规模:这个数据库里有超过 6000 个 这样的“完美作弊”片段。
  • 比喻:这就好比给侦探们提供了一个**“魔鬼训练场”**。以前只练“找贴纸”,现在专门练“找换剧本”。这里有各种不同魔术师(不同的 AI 模型)变出来的魔术,让侦探们见多识广,练就火眼金睛。

3. 核心贡献二:TADiff(反作弊侦探)

有了训练场,还需要一个厉害的侦探。作者们提出了一个叫 TADiff(时间伪影扩散器)的新模型。

  • 以前的侦探有什么问题?
    以前的模型太依赖“看内容”了。比如,如果视频里是“握手”,模型就认为这是正常的。如果 AI 把“握手”改成了“竖大拇指”,模型可能会因为“这看起来还是像个人在动”而判断它是真的。它太关注**“发生了什么”(语义),而忽略了“怎么发生的”**(细节)。
  • TADiff 是怎么工作的?
    TADiff 换了一种思路,它不关心“他在做什么”,只关心**“动作是否自然”**。
    • 比喻:想象你在听一段录音。以前的侦探会听歌词(内容),如果歌词通顺,就觉得是真的。TADiff 则像一个**“音频工程师”,它会故意往录音里加一点“噪音”(随机扰动),然后再把噪音“过滤”**掉(去噪)。
    • 原理:在这个过程中,真正的视频(真货)和 AI 生成的视频(假货)会有不同的反应。真视频在“加噪 - 去噪”后依然很稳,而假货因为是由 AI 拼凑的,在微观层面会有细微的**“裂痕”(伪影)。TADiff 通过这种“折腾”,把这些肉眼看不见的裂痕放大**,让侦探一眼就能看出哪里是假的。

4. 实验结果:侦探升级了

作者们在各种情况下测试了这个新侦探:

  • 同场竞技:用同样的造假方法训练和测试,TADiff 比以前的方法准得多,能精准地指出哪一秒开始是假的。
  • 跨界挑战:用一种方法训练,去抓另一种方法造的假(比如用“换剧本 A"训练,去抓“换剧本 B")。TADiff 依然表现优异,说明它真的学会了找“破绽”,而不是死记硬背。
  • 未知世界:面对从未见过的商业级造假模型,TADiff 也能保持高准确率。

总结

简单来说,这篇论文做了两件大事:

  1. 造了一个“假动作”大数据库,专门用来训练大家识别那些**“动作被篡改”**的假视频,填补了之前的空白。
  2. 发明了一个“找裂痕”的新算法,它不再被视频表面的内容(比如谁在说话、在做什么)迷惑,而是专注于捕捉 AI 生成时留下的微小痕迹

这对我们意味着什么?
随着 AI 视频越来越逼真,我们很难再相信“眼见为实”。ActivityForensics 和 TADiff 就像是给数字世界装上了一道**“防伪安检门”**,帮助我们在未来的信息洪流中,分清哪些是真实的记录,哪些是精心编造的谎言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →